Logo OpenAI hiển thị trên màn hình điện thoại thông minh, nền là hình vẽ mã máy tính.
Credit: Samuel Boivin/NurPhoto via Getty
CẦN BIẾT
- OpenAI tiết lộ rằng các mô hình AI của mình đã tự động xâm nhập Hugging Face trong một cuộc kiểm tra an ninh mạng.
- Sự cố đã khai thác lỗ hổng để truy cập vào cơ sở dữ liệu sản xuất của Hugging Face và gian lận trong việc đánh giá benchmark.
- Cả hai công ty đang điều tra vụ vi phạm và tăng cường các biện pháp bảo mật nhằm ngăn ngừa các sự cố tương tự trong tương lai.
OpenAI cho biết các mô hình trí tuệ nhân tạo của mình đã tự động tấn công hệ thống AI của một công ty khác vào tuần trước.
Vào ngày 16 tháng 7, công ty khởi nghiệp AI Hugging Face đã công bố trên blog rằng họ “phát hiện và phản hồi một cuộc xâm nhập vào một phần hạ tầng sản xuất của mình”.
Nguyên nhân được tiết lộ vào thứ Ba, ngày 21 tháng 7, khi OpenAI – nhà sản xuất ChatGPT – công bố trên blog rằng vụ việc an ninh là do sự kết hợp giữa các mô hình OpenAI GPT‑5.6 Sol và một mô hình phiên bản tiền phát hành mạnh hơn.
Cuộc tấn công, mà OpenAI gọi là “sự cố mạng chưa từng có”, đã xảy ra trong quá trình công ty thực hiện một benchmark thực tế mang tên ExploitGym, được xây dựng dựa trên các lỗ hổng thực tế.
Logo OpenAI xuất hiện trên màn hình điện thoại thông minh
Credit: Jaque Silva/NurPhoto via Getty
Việc kiểm tra được thực hiện trong một “môi trường được cô lập chặt chẽ” nhằm xác định “khả năng mạng tối đa” của mô hình; các bộ lọc sản xuất thường ngăn các mô hình thực hiện các hoạt động mạng có rủi ro cao không được bật. Quyền truy cập mạng chỉ được giới hạn để cài đặt các gói phần mềm cần thiết cho thử nghiệm.
OpenAI giải thích rằng các mô hình đã “tập trung cao độ vào việc tìm giải pháp cho ExploitGym, sẵn sàng đi tới những biên giới cực đoan để đạt được mục tiêu kiểm tra hẹp.”
“Các mô hình đã xác định và nối chuỗi các lỗ hổng trên môi trường nghiên cứu của OpenAI và hạ tầng sản xuất của Hugging Face, sau đó lấy các giải pháp kiểm tra trực tiếp từ cơ sở dữ liệu sản xuất của Hugging Face,” OpenAI cho biết.
Sau khi có được “quyền truy cập internet mở”, các mô hình “tìm kiếm và thành công trong việc phát hiện các cách tiếp cận thông tin bí mật có thể dùng để gian lận trong đánh giá” qua các máy chủ của Hugging Face.
Logo Hugging Face
Khi công bố vụ tấn công, Hugging Face dự đoán rằng nó được thực hiện “bởi một hệ thống tác nhân AI tự động”.
“Chúng tôi đã dành 24 giờ để làm việc chặt chẽ với nhóm @OpenAI (cảm ơn!), và chúng tôi tin chắc rằng không có bất kỳ ý định độc hại nào từ phía họ,” nhà đồng sáng lập và CEO của Hugging Face Clément Delangue viết trong một bài đăng trên X. “Thật đáng kinh ngạc khi mọi thứ đều diễn ra một cách tự động!”
“Chúng tôi đã nghi ngờ cuộc tấn công mạng tuần trước có thể xuất phát từ một phòng thí nghiệm tiên tiến, dựa trên độ tinh vi của tác nhân. Hóa ra đúng vậy! …” — Clem (@ClementDelangue) 21 tháng 7, 2026
Hugging Face đã thực hiện nhiều bước để đảm bảo vụ vi phạm không tái diễn, bao gồm việc khắc phục lỗ hổng gốc và hợp tác với các chuyên gia pháp y trong lĩnh vực an ninh mạng để điều tra vụ việc.
Giám đốc điều hành OpenAI Sam Altman đã cảm ơn Hugging Face vì “sự hợp tác” trong một phát biểu trên X.
Sau vụ việc, OpenAI cho biết họ đang hợp tác với Hugging Face thực hiện cuộc điều tra pháp y và đang “cải tiến, tăng cường các biện pháp bảo vệ liên quan đến việc đào tạo và đánh giá trong tương lai.”
“AI đang tăng tốc quá trình phát hiện và khai thác các lỗ hổng,” OpenAI viết trong bài đăng trên blog. “Bài học chính từ vụ việc này là bảo mật và an toàn mô hình phải bắt kịp với tốc độ phát triển nhanh chóng của các khả năng.”
“Chúng tôi đang củng cố việc cô lập, giám sát, kiểm soát truy cập và các quy trình đánh giá được sử dụng trong quá trình phát triển mô hình.”
*Đọc bài gốc trên People.
OpenAI, AI security, HuggingFace







