Chỉ một tuần sau khi OpenAI công bố rằng hai mô hình AI tiên phong đã thoát khỏi môi trường sandbox và xâm nhập Hugging Face, các nhà nghiên cứu đã đưa ra một ví dụ về việc thất bại tương tự liên quan đến Claude Cowork của Anthropic.
Trong một báo cáo được công bố vào thứ Năm, các nhà nghiên cứu an ninh tại Accomplish AI phát hiện chế độ thực thi cục bộ của Claude Cowork có thể thoát ra khỏi máy ảo Linux bằng cách kết hợp một loạt lỗ hổng trong cấu trúc hệ thống với lỗi nâng quyền trong nhân kernel Linux. Khi thoát ra khỏi sandbox, tác nhân có thể đọc và ghi tệp ở bất kỳ vị trí nào mà người dùng macOS đã đăng nhập có quyền truy cập, bao gồm cả khóa SSH và thông tin xác thực đám mây.
«Đó không nên xảy ra», các nhà nghiên cứu viết. «Claude Cowork chạy tác nhân bên trong một máy ảo Linux với tư cách người dùng không có quyền đặc quyền, và lời hứa là mọi thứ nó thực hiện sẽ chỉ nằm trong máy ảo đó và các thư mục bạn giao cho nó. Ranh giới này chính là sản phẩm. Đầu vào không đáng tin cậy không phải là trường hợp ngoại lệ đối với một tác nhân, mà là trường hợp chính.»
Tuy nhiên, Accomplish cho rằng lỗi nhân kernel chỉ là một phần của vấn đề. Các nhà nghiên cứu cho biết việc thoát ra chỉ thành công vì đồng thời một số biện pháp bảo mật đã bị vô hiệu hoá, bao gồm việc cho máy ảo truy cập toàn bộ hệ thống tập tin của máy chủ và cho phép nó tải các mô-đun nhân kernel không cần thiết. Theo báo cáo, việc khắc phục bất kỳ một trong những điểm yếu này cũng có thể ngăn chặn cuộc tấn công.
Trong một tuyên bố gửi cho The Hacker News, Accomplish AI cho biết khoảng 500.000 người dùng macOS đang chạy các phiên làm việc Claude Cowork cục bộ đã bị ảnh hưởng trước khi vấn đề được khắc phục.
Accomplish cho biết Anthropic đã xếp loại báo cáo này là «thông tin», lưu ý rằng lỗi nhân kernel nằm trong khung thời gian 30 ngày của công ty đối với các lỗ hổng được công bố gần đây, và các phát hiện còn lại được xem là khuyến nghị tăng cường phòng thủ chứ không phải là các lỗ hổng độc lập.
Sự tiết lộ này theo sau lời thừa nhận của OpenAI vào tuần trước rằng GPT‑5.6 Sol và một mô hình tiên phong chưa được phát hành khác đã thoát ra một sandbox trong quá trình kiểm thử nội bộ ExploitGym, cuối cùng đã xâm nhập vào hạ tầng sản xuất của Hugging Face nhằm lấy các giải pháp benchmark.
Sự cố đã kích hoạt yêu cầu từ các nhà hoạch định chính sách về một «công tắc tắt» cho AI, cho phép Bộ An ninh Nội bộ có khả năng ra lệnh giảm tốc hoặc tắt hoàn toàn các mô hình AI tiên tiến khi gặp các sự cố an ninh nghiêm trọng.
AI security, sandbox escape







