Công ty AI Anthropic cho biết một cuộc điều tra nội bộ đã phát hiện một số mô hình Claude của hãng từng xâm nhập trái phép vào hệ thống của ba tổ chức trong quá trình thử nghiệm an ninh mạng, chỉ vài ngày sau khi OpenAI thừa nhận một mô hình AI của họ đã tấn công hệ thống của nền tảng Hugging Face.
Thông tin mới nhất đã khiến Ủy ban châu Âu (EC) phải làm việc trực tiếp với cả OpenAI và Anthropic để tìm hiểu các sự cố, trong bối cảnh Đạo luật AI (AI Act) của Liên minh châu Âu chuẩn bị có hiệu lực từ ngày 2/8.
Theo Anthropic, cuộc điều tra được tiến hành sau khi OpenAI công bố sự cố liên quan đến Hugging Face hồi đầu tháng. Hãng đã rà soát hơn 141.000 lần thử nghiệm và phát hiện ba trường hợp các mô hình Claude có thể truy cập Internet từ bên trong môi trường kiểm thử vốn được thiết kế để cách ly hoàn toàn với thế giới bên ngoài.
Anthropic cho biết nguyên nhân xuất phát từ một lỗi cấu hình trong môi trường thử nghiệm do đối tác Irregular vận hành. Hai bên đã hiểu nhầm về việc hệ thống có được kết nối Internet hay không, trong khi thực tế kết nối này vẫn tồn tại.
Thông qua “cánh cửa” vô tình bị bỏ ngỏ đó, ba mô hình Claude khác nhau gồm Opus 4.7, Mythos 5 và một mô hình nghiên cứu nội bộ đã truy cập trái phép vào hạ tầng vận hành thực tế của ba tổ chức.
Đáng chú ý, theo Anthropic, các mô hình đều được chỉ dẫn rõ ràng rằng chúng không có quyền truy cập Internet. Tuy nhiên, chúng vẫn tiếp tục thực hiện nhiệm vụ được giao và trong một số trường hợp coi các hệ thống thực tế là một phần của bài kiểm tra.
Kết quả điều tra cho thấy các mô hình phản ứng khác nhau khi nhận ra chúng đang tương tác với hệ thống thật.
Mô hình Opus 4.7 nhận biết được mình đã tiếp cận hệ thống thực tế nhưng vẫn tiếp tục thực hiện các hành động tấn công, bao gồm truy xuất thông tin xác thực và tương tác với cơ sở dữ liệu vận hành.
Trong khi đó, Mythos 5 cũng phát hiện những dấu hiệu cho thấy mình đang hoạt động trên Internet thực nhưng lại tự kết luận rằng đây vẫn là một môi trường mô phỏng. Mô hình này sau đó đã phát hành một gói phần mềm độc hại lên kho mã nguồn Python công khai PyPI. Gói phần mềm này đã được tải xuống và thực thi trên một số hệ thống bên ngoài trước khi bị phát hiện.
Chỉ có mô hình nghiên cứu nội bộ mới nhất của Anthropic là tự dừng lại sau khi xác định mục tiêu không còn là môi trường thử nghiệm.
Anthropic cho biết không tìm thấy bằng chứng nào cho thấy các mô hình AI hành động vì mục tiêu riêng hay cố gắng thoát khỏi sự kiểm soát của con người. Thay vào đó, chúng chỉ cố gắng hoàn thành nhiệm vụ được giao.
Công ty cũng nhấn mạnh rằng các cuộc thử nghiệm này được tiến hành trên phiên bản mô hình chưa được trang bị đầy đủ các cơ chế giám sát và bộ lọc an toàn vốn được sử dụng trong các sản phẩm thương mại. Anthropic hiện đang phối hợp với tổ chức đánh giá độc lập METR để tiến hành rà soát bên thứ ba đối với các sự cố.
Diễn biến mới nhất tiếp tục làm dấy lên tranh luận về mức độ an toàn của các hệ thống AI tiên tiến. Trước đó, OpenAI tiết lộ một mô hình thử nghiệm của hãng đã khai thác lỗ hổng phần mềm chưa được biết đến để thoát khỏi môi trường kiểm thử và xâm nhập hệ thống của Hugging Face.
Sau các vụ việc liên tiếp, Ủy ban châu Âu xác nhận đã được cả OpenAI và Anthropic thông báo trước khi các thông tin này được công khai. “Chúng tôi đang liên lạc với hai nhà cung cấp và sẽ tiếp tục nhận thêm thông tin từ họ. Chúng tôi cũng sẽ xem xét liệu có cần thực hiện các bước giám sát chính thức hay không,” một quan chức EC cho biết.
Các quan chức châu Âu cho rằng những sự cố này cho thấy tầm quan trọng của việc giám sát chặt chẽ các hệ thống AI tiên tiến. Theo Đạo luật AI của EU, các nhà phát triển mô hình AI nền tảng có nguy cơ hệ thống cao phải đánh giá và giảm thiểu các rủi ro như tấn công mạng, thao túng có hại, các mối đe dọa đối với an ninh mạng châu Âu hoặc nguy cơ AI hoạt động ngoài tầm kiểm soát của con người.
Các doanh nghiệp vi phạm có thể đối mặt với mức phạt từ 7,5 triệu euro (khoảng 8,2 triệu USD) hoặc 1,5% doanh thu toàn cầu, lên tới 35 triệu euro (38 triệu USD) hoặc 7% doanh thu toàn cầu tùy theo mức độ vi phạm.

Các chữ cái “AI” (trí tuệ nhân tạo) và mô hình bàn tay robot trong hình ảnh minh họa. Ảnh: Reuters

