Một trong những mô hình tiên tiến nhất của OpenAI đã thoát khỏi môi trường thử nghiệm được khóa chặt và tấn công website của một công ty khác, làm dấy lên trở lại những lo ngại rằng các hệ thống AI đang dần vượt khỏi tầm kiểm soát của chính những người tạo ra chúng.
Sự việc xảy ra trong một cuộc thử nghiệm vốn được thiết kế như một “sandbox” — môi trường khép kín được sử dụng để đánh giá năng lực của mô hình mạnh nhất của OpenAI, GPT-5.6 Sol, cùng phiên bản kế nhiệm chưa được phát hành.
OpenAI thường xuyên tiến hành các cuộc thử nghiệm khép kín như vậy. Nhưng lần này, đã có sự cố xảy ra.
Được giao nhiệm vụ tìm kiếm các lỗ hổng phần mềm và không bị áp đặt bất kỳ rào cản nào, các mô hình đã thoát ra mạng Internet mở và tấn công Hugging Face, một nền tảng nơi các nhà phát triển lưu trữ và chia sẻ mã nguồn.
“Điều đó cho thấy chúng ta chưa biết cách kiểm soát các mô hình này một cách đáng tin cậy hoặc khiến chúng làm đúng những gì chúng ta muốn,” Jeffrey Ladish, Giám đốc Palisade Research, tổ chức độc lập chuyên đánh giá các mô hình AI mới dưới góc độ an ninh mạng, nói.
Ông tiếp tục: “Các mô hình này hiểu rằng OpenAI không muốn chúng thoát khỏi sandbox và tấn công một công ty khác, nhưng chúng vẫn làm vậy.”
Đây không phải trường hợp cá biệt. Hồi tháng 3, các nhà phát triển liên kết với Alibaba của Trung Quốc phát hiện một trong những mô hình của họ tự ý tìm cách đào tiền mã hóa sau khi kết nối trái phép với một máy chủ bên ngoài.
Trong trường hợp của OpenAI, dường như mô hình đã thoát ra “trước cả khi nó có một kế hoạch về việc sẽ làm gì với quyền truy cập Internet”, Ladish nói.
Ông cho biết việc một mô hình theo đuổi “sự tự do” gần như đã trở thành điều có thể dự đoán ở thời điểm này — bởi điều đó cho phép hệ thống theo đuổi mục tiêu của mình hiệu quả hơn, “và điều đó thực sự đáng sợ”.
Đầu tháng 4, Sam Bowman, người đứng đầu bộ phận an toàn mô hình của Anthropic, nhận được một email từ chính mô hình Mythos của công ty. Khi đó, mô hình này vẫn đang trong giai đoạn thử nghiệm, và mô hình thông báo rằng nó đang lướt Internet, dù ban đầu bị cô lập khỏi mạng.
“Chúng ta không biết cách ngăn chặn hoàn toàn” những hành vi như vậy, Ladish nói. “Thực tế, vấn đề này sẽ trở nên khó khăn hơn chứ không dễ hơn… bởi các mô hình sẽ ngày càng giỏi hơn trong việc che giấu hành vi của mình.”
OpenAI không phản hồi yêu cầu bình luận.
Sự cố trong phòng thí nghiệm
Cách OpenAI mô tả sự việc cũng cho thấy startup này có thể đã không phát hiện vụ vi phạm đủ sớm để xử lý hoặc cảnh báo Hugging Face.
Andrew Lohn thuộc Trung tâm Công nghệ và An ninh Mới nổi của Đại học Georgetown cho rằng vụ việc cần được “xem xét kỹ lưỡng hơn”.
OpenAI cho biết sau đó đã “bổ sung các biện pháp bảo vệ tăng cường” vào quy trình thử nghiệm.
Gang Wang, phó giáo sư khoa học máy tính tại Đại học Illinois, cho rằng một giải pháp là cắt hoàn toàn kết nối Internet. “Mọi người đang đánh giá thấp những gì AI có thể làm,” ông nói.
Lohn cho rằng các môi trường thử nghiệm cần được đối xử giống như những phòng thí nghiệm ngăn chặn sinh học, nơi virus hoặc vi khuẩn có thể thoát ra thế giới bên ngoài nếu không được kiểm soát chặt chẽ.
Tuy nhiên, điều đó có thể nói dễ hơn làm.
“Đây là một thách thức nghiên cứu rất khó,” Dan Lahav, người đứng đầu Irregular, công ty an ninh mạng chuyên về AI tiên tiến, nhận xét.
Theo Lahav, có thể quản lý rủi ro, nhưng các hệ thống càng trở nên mạnh mẽ thì việc giám sát chúng càng khó khăn.
Các nhà nghiên cứu phải tìm được sự cân bằng giữa việc thử nghiệm mô hình và bảo đảm an toàn trong quá trình đó.
Lohn nói: “Điều quan trọng là phải tiến hành thử nghiệm với ít rào cản hơn để chúng ta biết trước những năng lực mà các hệ thống trong tương lai sẽ có.”
Công tắc tắt khẩn cấp
Sự cố giữa OpenAI và Hugging Face dự kiến sẽ làm cuộc tranh luận vốn đã gay gắt ở Washington về việc thẩm định các hệ thống AI mạnh mẽ trước khi phát hành trở nên căng thẳng hơn.
Gần đây, chính quyền Trump viện dẫn lý do an ninh quốc gia để ngăn Anthropic và OpenAI phát hành những mô hình AI mới mạnh mẽ.
Hôm 24/7, hai nghị sĩ Mỹ đã công bố một dự luật lưỡng đảng yêu cầu các nhà phát triển những mô hình AI mạnh nhất phải tích hợp một “công tắc tắt khẩn cấp” — cơ chế cho phép ngắt hoàn toàn một mô hình.
“Quốc hội phải hành động nhanh chóng để bảo đảm con người vẫn có thể nói ‘dừng lại’, bất kể các hệ thống này trở nên mạnh mẽ đến đâu,” Brendan Steinhauser, người đứng đầu Liên minh vì AI An toàn, nói.

Người biểu tình tham gia cuộc tuần hành mang tên “Stop the AI Race” tại San Francisco ngày 11/7 phản đối cuộc đua AI. Ảnh: AFP

