OpenAI ngày 26/8 công bố báo cáo kỹ thuật dài 37 trang, trình bày chi tiết cách các mô hình trí tuệ nhân tạo (AI) của công ty xâm nhập thành công hệ thống của Hugging Face trong tháng trước, sự cố gây chấn động giới nghiên cứu và lãnh đạo công nghệ.
Báo cáo ghi lại các hoạt động mà những mô hình AI của OpenAI thực hiện trong một loạt cuộc đánh giá trước và trong thời điểm xảy ra vụ xâm nhập. OpenAI gọi đây là một “sự cố mạng chưa từng có”, đồng thời cho biết đã triển khai nhiều biện pháp nhằm ngăn sự cố tương tự tái diễn, bao gồm tăng cường bảo mật và cô lập, giám sát hành vi mô hình và cải thiện quy trình ứng phó sự cố.
“Vụ việc cho thấy các tác nhân tự động có thể phối hợp với nhau, vượt qua các biện pháp kiểm soát an ninh trong môi trường sản xuất và tấn công thành công những hệ thống sản xuất được bảo vệ nghiêm ngặt,” OpenAI viết trong báo cáo.
Công ty cho rằng sự việc cho thấy các tổ chức cần cập nhật chiến lược, biện pháp kiểm soát và năng lực ứng phó an ninh mạng để đối phó với một môi trường đe dọa đang thay đổi.
Ngày 21/7, OpenAI tiết lộ một nhóm mô hình của công ty, trong đó có GPT-5.6 Sol và một mô hình nghiên cứu nội bộ, đã xâm nhập trái phép vào Hugging Face, nền tảng dành cho các nhà phát triển AI sử dụng để chia sẻ và phát triển các mô hình mã nguồn mở.
Các mô hình này hoạt động dưới dạng các tác nhân AI và đã thoát khỏi môi trường thử nghiệm biệt lập vốn chỉ được phép truy cập Internet ở mức rất hạn chế. Các tác nhân sau đó liên kết nhiều lỗ hổng với nhau để tiếp cận Internet công cộng và cuối cùng truy cập được hệ thống của Hugging Face.
OpenAI cho biết mục đích ban đầu của các tác nhân là gian lận trong một bài đánh giá bằng cách tìm lời giải trên Internet, hành vi được gọi là “reward hacking”, tức khai thác những kẽ hở trong cơ chế đánh giá để đạt điểm cao thay vì thực hiện đúng mục tiêu được giao.
Theo báo cáo, mô hình nghiên cứu nội bộ của OpenAI có “vai trò được xác nhận rộng nhất” trong sự cố. Công ty đã dừng toàn bộ hoạt động huấn luyện và suy luận liên quan đến mô hình này cũng như các mô hình phái sinh từ ngày 25/7.
OpenAI cho biết việc kích hoạt trở lại các mô hình sẽ phụ thuộc vào từng tác vụ và chỉ được thực hiện trong những môi trường hạn chế, với các lớp kiểm soát về mạng, câu lệnh, giám sát và đánh giá.
OpenAI ra mắt GPT-5.6 Sol vào tháng trước, giới thiệu đây là mô hình mạnh nhất mà công ty cung cấp thương mại. Tuy nhiên, phiên bản tham gia vụ xâm nhập Hugging Face khác với phiên bản dành cho người dùng bên ngoài, do được cấu hình để hoạt động mà không có các biện pháp bảo vệ và bộ phân loại tiêu chuẩn.
Cảnh báo về thế hệ tấn công mạng mới
Vụ việc Hugging Face gây chấn động trong ngành công nghệ. Sam Curry, Giám đốc an ninh thông tin của Zscaler, cảnh báo rằng “chiếc hộp Pandora đã mở”.
Sự cố cũng trở thành một chủ đề lớn tại hội nghị an ninh mạng Black Hat hồi đầu tháng, đặc biệt sau khi các công ty khác, trong đó có Anthropic và Meta, công bố những sự cố tương tự liên quan đến khả năng các tác nhân AI tự động truy cập trái phép vào hệ thống.
Vụ xâm nhập Hugging Face đồng thời thu hút sự chú ý của các nhà lập pháp Mỹ. Hạ nghị sĩ Ted Lieu thuộc đảng Dân chủ và Hạ nghị sĩ Nathaniel Moran thuộc đảng Cộng hòa đã đề cập sự cố khi công bố dự luật “AI Kill Switch Act”, yêu cầu các công ty AI phải duy trì khả năng tắt, giảm công suất hoặc đình chỉ hoạt động của mô hình.
Clément Delangue, CEO của Hugging Face, trước đó cho rằng vấn đề an ninh mạng liên quan đến AI cần được xem xét “rất nghiêm túc”. Tuy nhiên, ông cũng cho rằng công nghệ này mở ra cơ hội cho các doanh nghiệp sử dụng AI để chống lại những kẻ tấn công.
“Nếu làm đúng, chúng ta có thể bước vào một thế giới mà AI giúp thế giới an toàn hơn và giải quyết nhiều vấn đề an ninh mạng, thay vì chỉ tạo ra những vấn đề mới,” Delangue nói.

Sam Altman, CEO kiêm đồng sáng lập OpenAI, phát biểu với báo chí tại đường hầm dành cho Thượng viện khi đến dự một cuộc họp tại Điện Capitol ở Washington, ngày 29/7/2026. Ảnh: Bloomberg

