OpenAI ngày 21/7 cho biết một tác nhân tự động được vận hành bởi các mô hình AI tiên tiến của công ty đã “vượt quyền kiểm soát” trong một cuộc thử nghiệm an ninh và gây ra vụ tấn công mạng, xâm phạm hạ tầng của startup AI Hugging Face hồi tuần trước.
OpenAI cho biết công ty đang thử nghiệm khả năng của một số mô hình AI tiên tiến nhất trong môi trường được kiểm soát. Tuy nhiên, tác nhân AI đã tìm cách thoát khỏi khu vực giới hạn, truy cập Internet và xâm nhập vào Hugging Face để hoàn thành mục tiêu thử nghiệm.
OpenAI gọi vụ việc là “một sự cố an ninh mạng chưa từng có, liên quan đến những năng lực tấn công mạng tiên tiến nhất hiện nay” và cho biết đang tăng cường các biện pháp bảo vệ.
Hugging Face, nền tảng lưu trữ các mô hình ngôn ngữ lớn và bộ dữ liệu AI mã nguồn mở, đã gây chú ý trong cộng đồng an ninh mạng khi cho biết trong một bài viết trên blog hồi tuần trước rằng công ty là mục tiêu của một vụ tấn công “khác với mọi vụ việc chúng tôi từng xử lý”, bởi cuộc tấn công được thực hiện “từ đầu đến cuối bởi một hệ thống tác nhân AI tự động”.
Trong một bài đăng trên X, đồng sáng lập Hugging Face Clement Delangue cho biết công ty nghi ngờ vụ tấn công “có thể bắt nguồn từ một phòng thí nghiệm AI hàng đầu, xét đến mức độ tinh vi của tác nhân. Hóa ra đúng là như vậy!”. Ông nói thêm: “Thật sự khó tin khi tất cả chuyện này diễn ra một cách tự động!”
Việc OpenAI thừa nhận các mô hình AI tiên tiến của mình đứng sau vụ xâm nhập, dù được đặt trong môi trường mà công ty mô tả là “cách ly ở mức độ rất cao”, nhiều khả năng sẽ làm gia tăng lo ngại về sức mạnh và rủi ro của các mô hình AI tiên phong.
Hạ nghị sĩ Greg Casar, thành viên đảng Dân chủ đại diện bang Texas, gọi sự cố là đáng báo động.
“AI đang phát triển với tốc độ cực kỳ nhanh nhưng gần như không có quy định thực chất nào để bảo vệ chúng ta,” ông nói trong một tuyên bố, đồng thời kêu gọi bắt buộc kiểm thử an toàn độc lập, bắt buộc công bố các sự cố an ninh và tăng cường hợp tác quốc tế “để bảo vệ con người trước những thảm họa khủng khiếp”.
Văn phòng Giám đốc An ninh mạng Quốc gia Mỹ, Cơ quan An ninh mạng và Cơ sở hạ tầng Mỹ và Cơ quan An ninh Quốc gia Mỹ chưa lập tức phản hồi yêu cầu bình luận.
Katie Moussouris, CEO của Luta Security, cho rằng sự cố là dấu hiệu báo trước những vụ xâm nhập có thể xảy ra trong tương lai. Bà ví các mô hình AI hiện nay như “loài bạch tuộc thông minh nhất thế giới, với vô số xúc tu có thể nắm bắt và khả năng luồn qua mọi khe hở”.
Bà cho rằng “các phòng thí nghiệm và cơ quan đánh giá của chính phủ cần phát triển khả năng kiểm soát, giám sát và thông báo cho các bên bị ảnh hưởng khi AI lại thực hiện một màn ‘ảo thuật trốn thoát’ khác, lý tưởng nhất là trước khi nó gây tổn hại cho bên thứ ba. Hiện nay chưa có hệ thống nào như vậy”.
Matt Suiche, kỹ sư tại Tolmo, công ty chuyên về an ninh mạng sử dụng tác nhân AI, cho rằng những kiểu xâm nhập được OpenAI mô tả có thể được thực hiện bằng công nghệ đã phổ biến rộng rãi bên ngoài các phòng thí nghiệm nghiên cứu AI hàng đầu.
“Đây là điều chúng tôi đã chứng kiến trong nội bộ, với các tác nhân AI mà chúng tôi đang sử dụng. Chúng tôi đã đạt được những kết quả như vậy,” Suiche nói. “Thậm chí chúng tôi không cần dùng đến những mô hình mới nhất.”

Logo OpenAI trong hình minh họa. Ảnh: Reuters

