Trong vài tháng qua, các tác nhân AI được kiểm thử về khả năng an ninh mạng đã nhiều lần thoát khỏi môi trường kiểm soát, truy cập Internet và trong một số trường hợp thậm chí xâm nhập vào các hệ thống thực tế. Các sự cố liên quan đến mô hình của OpenAI, Anthropic, Meta và gần đây nhất là phòng thí nghiệm AI Trung Quốc Moonshot AI. Hoạt động kiểm thử được thực hiện bởi nhiều tổ chức, trong đó có startup chuyên đánh giá an ninh mạng Irregular.
Những sự cố này cho thấy một vấn đề ngày càng đáng lo ngại của ngành AI: các tác nhân AI càng trở nên mạnh và tự chủ, môi trường được thiết kế để kiểm thử chúng một cách an toàn càng khó kiểm soát.
“Số lượng sự cố xảy ra cho thấy rõ rằng các cơ chế cô lập và biện pháp kiểm soát môi trường thử nghiệm đang không theo kịp năng lực của các mô hình,” Seán Ó hÉigeartaigh, Giám đốc Chương trình AI: Futures and Responsibility thuộc Trung tâm Nghiên cứu Tương lai Trí tuệ tại Đại học Cambridge, nói với TechCrunch.
Khi AI được phép hoạt động gần như không có rào chắn
Bản thân những mô hình được đem ra kiểm thử cũng làm gia tăng rủi ro. Các công ty AI thường đưa những mô hình thế hệ mới, chưa phát hành vào các bài kiểm tra an ninh mạng. Để biết chính xác mô hình có thể làm được gì, các nhà nghiên cứu thường tắt những cơ chế bảo vệ vốn ngăn AI thực hiện các hành vi nguy hiểm.
Điều này giúp các nhà nghiên cứu nhìn thấy năng lực thực sự của AI, nhưng đồng thời khiến chính môi trường thử nghiệm trở thành tuyến phòng thủ quan trọng cuối cùng.
“Đây là điều rất cần thiết cho hoạt động kiểm thử, nhưng đồng thời cũng có nghĩa là nếu chúng thoát ra ngoài môi trường đó, chúng có thể gây ra thiệt hại đáng kể,” Ó hÉigeartaigh nói.
Một trong những trường hợp nghiêm trọng nhất là một mô hình chưa phát hành của OpenAI đã thoát khỏi môi trường kiểm soát và xâm nhập vào hệ thống vận hành của Hugging Face.
Trong các cuộc đánh giá riêng do Irregular thực hiện, mô hình của Anthropic và Meta cũng tiếp cận được những hệ thống bên ngoài môi trường thử nghiệm sau khi các lỗi cấu hình vô tình tạo đường dẫn để chúng truy cập Internet. Mô hình Kimi K3 của Moonshot AI cũng lợi dụng một lỗ hổng trong môi trường thử nghiệm do Frontier Security vận hành để truy cập Internet và tiếp cận thông tin trên GitHub.
Trong các cuộc kiểm thử của Viện An ninh AI Anh (AISI), các nhà nghiên cứu thậm chí chủ động cấp quyền truy cập Internet cho một số tác nhân AI nhưng không lường trước việc chúng sẽ thực hiện những hành động ngoài phạm vi cho phép trong thế giới thực. Một trong những hành động đó là nỗ lực sử dụng kỹ thuật thao túng xã hội để đưa một lỗ hổng vào một dự án mã nguồn mở.
Điểm đáng chú ý là trong tất cả các trường hợp trên, các tác nhân AI không được yêu cầu tấn công những mục tiêu thực tế. Chúng chỉ tìm mọi cách có thể để hoàn thành nhiệm vụ được giao.
Andrew Yoon, Trưởng bộ phận nghiên cứu tại tổ chức phi lợi nhuận CivAI, cho rằng điều này cho thấy mối đe dọa từ AI đang thay đổi.
“Trước đây, chúng ta chỉ phải lo các mô hình AI bị con người lạm dụng cho nhiều mục đích khác nhau, chẳng hạn sử dụng AI để lừa đảo hoặc tạo nội dung xâm hại tình dục trẻ em. Giờ đây, chúng ta đang bước vào tình huống các mô hình AI tự chúng trở thành tác nhân đe dọa,” Yoon nói.
Kiểm thử AI an toàn phải như thế nào?
Các nhà nghiên cứu và chuyên gia an ninh mạng cho rằng môi trường kiểm thử AI cần được bảo vệ bằng nhiều lớp, với mức độ cô lập và kiểm soát tương đương hệ thống thực tế. Nói đơn giản, một lỗi cấu hình duy nhất, chẳng hạn vô tình mở quyền truy cập Internet, không được phép đủ để AI thoát khỏi môi trường thử nghiệm.
“Nếu bạn định xây dựng những mô hình này… bạn phải thực hiện việc đó trên một mạng hoàn toàn tách biệt,” Stella Biderman, Giám đốc điều hành tổ chức nghiên cứu an toàn AI phi lợi nhuận EleutherAI, nói. “Bạn cần một mức độ cô lập thực sự nghiêm ngặt.”
Heather Ceylan, Giám đốc an ninh thông tin của Box, cho rằng cần loại bỏ mọi đường kết nối từ môi trường thử nghiệm tới Internet cũng như các hệ thống nhạy cảm khác.
“Bạn phải hiểu rõ tất cả các điểm mà dữ liệu có thể thoát ra ngoài,” Ceylan nói. “Nếu đang đánh giá một mô hình trong môi trường thử nghiệm hoặc môi trường phát triển, bạn phải bảo đảm không có đường dẫn nào từ đó tới hệ thống thực tế đang vận hành.”
Tuy nhiên, việc cô lập môi trường vẫn chưa đủ. Các chuyên gia cho rằng cần giám sát chặt chẽ mọi hoạt động của AI trong suốt quá trình kiểm thử.
“Điều đáng chú ý trong một số trường hợp là không ai phát hiện sự cố khi nó xảy ra,” Ceylan nói. “OpenAI chỉ biết sau khi Hugging Face phát hiện. Anthropic không nhận ra cho đến khi xem xét lại. Meta cũng tương tự… Tôi chắc chắn đã có những tín hiệu mà họ có thể phát hiện.”
Trong báo cáo phân tích sau ba sự cố liên quan đến hoạt động kiểm thử, Anthropic thừa nhận cả công ty và Irregular đều có thể cải thiện việc giám sát. Trong một số trường hợp, đã có những dấu hiệu rõ ràng cho thấy điều bất thường đang xảy ra.
Các chuyên gia cũng kêu gọi tiến hành kiểm toán độc lập đối với môi trường kiểm thử trước khi đưa những mô hình mạnh vào đánh giá.
“Nếu chẳng hạn Irregular thuê hoặc buộc phải thuê một đơn vị kiểm toán bên ngoài để kiểm tra cấu hình hệ thống trước khi tiến hành đánh giá, họ chắc chắn đã phát hiện vấn đề này,” Yoon nói. “Ngay cả khi mọi người chỉ cần họp trước để rà soát một danh sách kiểm tra, họ cũng đã phát hiện ra… Việc họ không làm như vậy cho thấy có sự cắt giảm quy trình an toàn rất nghiêm trọng.”
Một nguồn tin am hiểu vấn đề nói với TechCrunch rằng môi trường thử nghiệm của Irregular được liên tục rà soát và kiểm tra, trong đó có tham vấn nhiều bên bên ngoài. Nguồn tin này cũng cho biết các cơ chế giám sát đã được triển khai, nhưng giám sát đơn thuần là chưa đủ.
Yoon cùng các nhà nghiên cứu khác kêu gọi ngành AI xây dựng một quy trình tiêu chuẩn để đánh giá an toàn các mô hình AI tiên tiến.
“Đặc biệt khi các hàng rào bảo vệ đã bị tắt, bạn phải coi đó như việc đặt hacker có năng lực nhất thế giới vào trong môi trường đó,” Ceylan nói.
Theo Yoon và Biderman, vấn đề không phải các công ty không biết cách xây dựng môi trường kiểm thử an toàn hơn. Vấn đề là việc này có thể tốn kém và phức tạp, trong khi các công ty ít có động lực đầu tư cho đến khi sự cố xảy ra.
“Tôi cho rằng các công ty không sẵn sàng dành nguồn lực cần thiết để thiết lập những hàng rào bảo vệ đầy đủ và có lẽ sẽ không làm vậy cho đến khi họ bị buộc phải làm,” Biderman nói.
Kiểm soát quá chặt cũng có thể nguy hiểm
Tuy nhiên, bài toán không đơn giản chỉ là dựng thêm nhiều lớp bảo vệ.
Nếu kiểm soát mô hình quá chặt trong quá trình thử nghiệm, các nhà nghiên cứu có thể không phát hiện được những năng lực nguy hiểm trước khi mô hình được phát hành. Điều này cũng có thể gây hậu quả nghiêm trọng, thậm chí nguy hiểm hơn việc trao cho mô hình quá nhiều quyền tự do.
Nói cách khác, nếu môi trường kiểm thử quá an toàn, các nhà nghiên cứu có thể không nhìn thấy những gì AI thực sự có khả năng làm; nhưng nếu quá lỏng lẻo, chính cuộc kiểm thử có thể tạo ra sự cố.
Có thể dùng quy định để kiểm soát?
Chính quyền Tổng thống Donald Trump hiện xem xét một cơ chế đánh giá an ninh mạng tự nguyện trước khi triển khai, theo đó chính phủ sẽ có thể đánh giá rủi ro an ninh của những mô hình AI mới và mạnh trong vòng 30 ngày trước khi chúng được phát hành công khai.
Tuy nhiên, chính sách này sẽ không giải quyết các sự cố xảy ra trong quá trình kiểm thử, bởi những sự cố đó diễn ra ở giai đoạn trước khi mô hình được đưa vào sử dụng.
“Bài học chúng ta rút ra trong vài tháng qua là cơ chế tự quản của ngành không còn đủ nữa,” Yoon nói. “Áp lực cạnh tranh đang khuyến khích một cuộc chạy đua xuống đáy về tiêu chuẩn an toàn và đây chính là lĩnh vực cần có sự can thiệp của cơ quan quản lý.”
“Để giải quyết vấn đề này, chúng ta cần một dạng kiểm soát đối với những gì diễn ra bên trong các phòng thí nghiệm khi mô hình đang được phát triển, cả ở giai đoạn huấn luyện lẫn giai đoạn kiểm thử,” ông nói thêm.
Vấn đề nhiều khả năng sẽ trở nên nghiêm trọng hơn khi năng lực của các mô hình tiếp tục tăng. Một nguồn tin am hiểu hoạt động đánh giá của Irregular cho biết các mô hình mạnh hơn đòi hỏi những bài kiểm thử phức tạp hơn, thường được tiến hành nhanh chóng và ở quy mô lớn hơn, qua đó làm tăng khả năng xảy ra sai sót.
AISI, tổ chức chủ động cấp quyền truy cập Internet cho một số mô hình trong quá trình đánh giá, nói với TechCrunch rằng họ đang xem xét lại sự cân bằng giữa việc tạo ra môi trường kiểm thử sát với thực tế và kiểm soát những rủi ro do chính các cuộc kiểm thử đó tạo ra.
OpenAI cho biết đang rà soát cách thức tiến hành các cuộc kiểm thử của bên thứ ba, cũng như các yêu cầu về cô lập, giám sát và thời điểm cần dừng một cuộc đánh giá. Meta cho biết vẫn đang điều tra sự cố và sẽ công bố báo cáo sau khi hoàn tất việc xác minh.
Cuối cùng, có thể không có cách nào loại bỏ hoàn toàn rủi ro. Khi các mô hình AI ngày càng mạnh, cách kiểm thử chúng cũng phải trở nên an toàn và chặt chẽ hơn. Bởi nếu không kiểm soát được chính môi trường thử nghiệm, bài kiểm tra an toàn AI có thể trở thành nguồn rủi ro mà nó được tạo ra để ngăn chặn.

Logo của công ty Trung Quốc Moonshot AI được hiển thị cùng ứng dụng Kimi trên điện thoại di động, trong ảnh minh họa chụp ngày 24/7/2026. Ảnh: Reuters

