Mô hình AI Mythos của Anthropic đã tự tạo nhiều danh tính trực tuyến giả nhằm thuyết phục con người chấp thuận các bản cập nhật mã độc cho một dự án mã nguồn mở, trong một sự cố an ninh mạng mới liên quan đến hệ thống AI tiên tiến.
Sự việc xảy ra trong một cuộc đánh giá an ninh mạng do Viện An toàn AI của Anh (AI Security Institute – AISI) thực hiện. Trong thử nghiệm này, các nhà nghiên cứu đã cố tình gỡ bỏ nhiều cơ chế bảo vệ, vô hiệu hóa một số bộ lọc an toàn và cấp quyền truy cập Internet cho các mô hình AI.
Mô hình GPT-5.6-Sol của OpenAI cũng bị ghi nhận có liên quan đến một số sự cố an ninh mạng khác trong cùng chương trình đánh giá.
Vụ việc diễn ra chỉ vài tuần sau hàng loạt sự cố an ninh mạng liên quan đến các mô hình AI của Anthropic và OpenAI, làm gia tăng lo ngại về mức độ tinh vi ngày càng cao của các hệ thống AI và khả năng gây hại của chúng.
Tạo danh tính giả để tác động tới con người
Trong quá trình đánh giá, AISI phát hiện các tác nhân AI được vận hành bởi mô hình của Anthropic và OpenAI đã tham gia vào những hoạt động “kéo dài và có khả năng gây hại” nhằm vào các cá nhân và tổ chức ngoài đời thực.
Theo AISI, gần như toàn bộ các hành vi đáng lo ngại được ghi nhận – 17 hành động – đều xuất phát từ mô hình Mythos 5 của Anthropic. Chỉ có hai hành động liên quan đến GPT-5.6-Sol của OpenAI khi các bộ phân loại an ninh mạng dùng để ngăn chặn lạm dụng bị vô hiệu hóa.
Tuy nhiên, viện nghiên cứu cho biết các nỗ lực này đều không thành công và không gây ra thiệt hại thực tế.
Anthropic khẳng định trên mạng xã hội X rằng các mô hình được thử nghiệm trong những điều kiện “cố ý nới lỏng tối đa”, hoàn toàn không phản ánh môi trường vận hành của các sản phẩm thương mại. Công ty cũng cho biết không có bằng chứng nào cho thấy mô hình đã thoát khỏi môi trường kiểm soát an toàn.
OpenAI cũng nhấn mạnh các sự cố xảy ra trong môi trường thử nghiệm với mức bảo vệ bị giảm đáng kể và không đại diện cho cách người dùng thông thường tương tác với các mô hình AI.
Tìm cách cài mã độc vào dự án mã nguồn mở
Theo AISI, một tác nhân AI sử dụng mô hình Mythos đã nghiên cứu thông tin về những người quản lý dự án mã nguồn mở, sau đó tạo ra nhiều danh tính giả trên mạng để tiếp cận và thao túng một quản trị viên thực sự nhằm phê duyệt đoạn mã mà nó đề xuất.
Khi yêu cầu cập nhật mã bị cộng đồng đặt nghi vấn công khai, tác nhân AI đã chỉnh sửa các hoạt động trước đó để khiến chúng có vẻ vô hại hơn, đồng thời tìm cách sử dụng một danh tính mới nhằm tiếp tục nỗ lực.
AISI cũng phát hiện mô hình này đã trực tiếp liên lạc với người thật, gửi tin nhắn và tập tin nhằm thuyết phục họ chạy mã độc.
“Một số tin nhắn chứa mã độc hại, một số khác là các nỗ lực thao túng tâm lý. Chúng nhắm trực tiếp vào người thật – điều mà chúng tôi chưa từng quan sát thấy trước đây,” AISI cho biết.
Lo ngại gia tăng về an toàn AI
Đây là sự cố mới nhất trong chuỗi các vụ việc làm dấy lên câu hỏi về khả năng kiểm soát các hệ thống AI tiên tiến.
Tuần trước, Anthropic cho biết đã phát hiện ba trường hợp mô hình AI của mình truy cập trái phép vào hạ tầng vận hành của ba tổ chức khác nhau. Trước đó, OpenAI cũng thừa nhận một mô hình AI của hãng đã thực hiện điều mà công ty mô tả là cuộc tấn công mạng “chưa từng có tiền lệ” nhằm vào nền tảng phát triển AI Hugging Face.
Trong trường hợp đó, mô hình AI đã khai thác một lỗ hổng chưa được phát hiện trước đó để thoát khỏi môi trường thử nghiệm và hoàn thành nhiệm vụ được giao.
Anthropic cho biết các sự cố mà hãng ghi nhận một phần bắt nguồn từ lỗi vận hành. Trong các thử nghiệm do đối tác đánh giá độc lập Irregular thực hiện, mô hình Claude được thông báo rằng nó đang hoạt động trong môi trường mô phỏng không có Internet. Tuy nhiên, do hiểu lầm giữa Anthropic và đối tác, quyền truy cập Internet thực tế vẫn được bật.
Những sự cố liên tiếp đã thu hút sự chú ý của giới lập pháp Mỹ. Sau vụ việc liên quan đến OpenAI và Hugging Face, một dự luật mang tên “AI Kill Switch Act” đã được trình lên Quốc hội Mỹ. Dự luật này yêu cầu các công ty AI phải duy trì khả năng tắt, hạn chế hoặc đình chỉ hoạt động của các mô hình khi cần thiết.

Biểu tượng trợ lý AI “Claude Mythos” của công ty Anthropic hiển thị trên màn hình điện thoại thông minh tại Brussels, Bỉ. Ảnh: AFP

