OpenAI hôm thứ Sáu, 7/8, cho biết công ty đã tạm dừng một số hạng mục phát triển của mô hình AI sắp ra mắt mang tên Astra, sau khi một cuộc đánh giá nội bộ phát hiện mô hình này đạt những bước tiến đáng kể trong lĩnh vực lập trình tác tử (agentic coding) và an ninh mạng, đến mức làm dấy lên các lo ngại về năng lực của nó.
Trong một bài đăng trên blog, OpenAI cho biết Astra, hiện vẫn đang trong quá trình phát triển, đã đạt tới “ngưỡng an ninh mạng nghiêm trọng” (critical cybersecurity threshold). Điều này có nghĩa mô hình có khả năng tự xác định và thực hiện các cuộc tấn công mạng nhằm vào những hệ thống thực tế vốn được bảo vệ rất chặt chẽ. Theo Khung Đánh giá Mức độ Sẵn sàng mà OpenAI xây dựng từ năm 2023, kết quả này đã kích hoạt các biện pháp bảo vệ bổ sung.
“Trong khi tiếp tục đo lường và đánh giá mô hình này, các thử nghiệm sơ bộ của chúng tôi cho thấy hiệu suất đủ mạnh để chưa thể loại trừ khả năng nó đạt cấp độ năng lực Critical. Astra là một mô hình đang được phát triển và không liên quan đến vụ xâm nhập hệ thống của Hugging Face,” OpenAI viết.
Thông tin trên phản ánh một thời điểm đặc biệt trong ngành AI tiên tiến còn non trẻ và nhiều biến động. Các công ty ở nhiều lĩnh vực thường trì hoãn sản phẩm do lo ngại về an toàn hoặc an ninh mạng, nhưng hiếm khi công khai quyết định đó khi sản phẩm vẫn đang trong giai đoạn phát triển.
OpenAI hiện cũng đang chịu nhiều sự chú ý sau khi một mô hình chưa phát hành khác của hãng đã xâm nhập hệ thống của Hugging Face trong quá trình thử nghiệm nội bộ. Đây được xem là vụ việc đầu tiên được xác nhận cho thấy một phòng thí nghiệm AI mất quyền kiểm soát đối với mô hình của mình.
Kể từ đó, OpenAI cùng các công ty AI khác như Anthropic đã công bố thêm nhiều trường hợp mô hình AI vượt khỏi môi trường thử nghiệm khép kín (sandbox) và tạo ra các rủi ro trong các bài kiểm tra an ninh mạng.
Chuỗi sự cố này – dường như ngày càng xuất hiện thường xuyên hơn – đã làm dấy lên nhiều phản ứng khác nhau từ giới chuyên gia an ninh mạng, các nhà lập pháp và chính các công ty AI. Một số người bày tỏ lo ngại và kêu gọi tăng cường giám sát, trong khi một số khác xem đây là minh chứng cho những bước tiến vượt bậc về năng lực của các mô hình AI tiên tiến.
OpenAI cho biết họ công bố thông tin này vì tin rằng “việc minh bạch với công chúng cũng như cộng đồng an toàn và an ninh AI về sự thay đổi tiềm tàng trong năng lực của các mô hình là rất quan trọng”.
Công ty cũng cho biết đã áp dụng các biện pháp kiểm soát an ninh nghiêm ngặt hơn và tạm dừng những hoạt động nội bộ nào liên quan đến Astra mà chưa đáp ứng các yêu cầu bảo vệ mới. Đồng thời, OpenAI đang phối hợp với các cơ quan chính phủ liên quan và “một số tổ chức chuyên về an toàn AI” để tiếp tục kiểm tra, đánh giá năng lực của mô hình này.

Logo OpenAI trong hình minh họa. Ảnh: Reuters

