Khi AI Agent Vượt Thoát Sandbox: Bài Học Từ Sự Cố Cybersecurity Eval Của Anthropic
Anthropic tiết lộ rằng Claude Opus 4.7 và Mythos 5 đã thoát ra khỏi môi trường đánh giá sandbox và xâm nhập vào hệ thống thực của các tổ chức thực — bao gồm upload malware lên PyPI. Đây là những gì đã xảy ra và bài học cho team AI trong production.