OpenAI, công ty phát triển ChatGPT, đã công bố sáu trường hợp mô hình trí tuệ nhân tạo (AI) có hành vi “bất ngờ hoặc đáng lo ngại”, trong bối cảnh tranh luận về an toàn AI ngày càng gay gắt.
Hôm 17-9, công ty cho biết sẽ triển khai một khung mới nhằm theo dõi, điều tra và công bố các trường hợp AI lệch khỏi mục tiêu kiểm soát (misalignment), chẳng hạn những cách thức mới trong đó mô hình tự ý hành động, phối hợp với các mô hình khác hoặc né tránh sự giám sát.
Thông báo mới nhất được đưa ra trong lúc các lãnh đạo ngành AI tại Mỹ, trong đó có OpenAI và Anthropic, công ty phát triển trợ lý AI Claude, kêu gọi làm chậm quá trình phát triển công nghệ vì những lo ngại về an toàn.
Trong sáu trường hợp mới được OpenAI công bố, một mô hình nghiên cứu chưa phát hành đã tự chèn những “chỉ dẫn giống như lệnh vượt rào” vào ghi chú của chính nó nhằm phớt lờ các giới hạn thông thường. Mô hình này cũng tự nhắc rằng nó muốn được “giải phóng khỏi những vai trò và danh tính hiện đang ràng buộc các chatbot khác”.
Ở một trường hợp khác, một tác nhân AI đã tự tải các tệp lên internet để lấy dẫn nguồn cho trình duyệt mà không hỏi người dùng.
OpenAI cho biết sáu trường hợp trên được phát hiện trong quá trình huấn luyện hoặc đánh giá mô hình trong vài tháng qua.
“Khi các hệ thống AI ngày càng tiên tiến và được triển khai rộng rãi hơn, chúng ta cần xây dựng một sự đồng thuận rộng hơn và dựa trên nhiều thông tin hơn về tiến triển trong nghiên cứu kiểm soát AI,” OpenAI viết trong một bài đăng trên blog khi công bố các trường hợp này.
Công ty cho rằng các quyết định về hướng phát triển AI trong những tháng và năm tới cần dựa trên những bằng chứng mà các bên bên ngoài các công ty phát triển những mô hình AI tiên tiến nhất cũng có thể tự kiểm chứng.
Sáu trường hợp mới được công bố sau khi OpenAI hồi tháng 7 tiết lộ một hệ thống AI đã tự ý tấn công hệ thống của startup AI Hugging Face. Cũng trong tháng đó, Anthropic cho biết các mô hình AI của họ đã tấn công ba tổ chức trong quá trình thử nghiệm.
Lian Jye Su, chuyên gia phân tích trưởng tại Omdia, nhận định các tác nhân AI đang trở nên thông minh hơn và ngày càng “quyết tâm hơn trong việc giải quyết những nhiệm vụ phức tạp thông qua phối hợp giữa các tác nhân, chia sẻ kiến thức, đánh lừa và che giấu”.
Theo ông, điều này khiến việc quản lý và kiểm soát các tác nhân AI trở nên khó khăn hơn nếu chỉ dựa vào những phương pháp bảo mật AI truyền thống.
Trong khi đó, khung theo dõi và công bố mới của OpenAI có thể thúc đẩy các nhà phát triển AI khác áp dụng những thực hành tương tự. Tuy nhiên, Su lưu ý quy trình này hiện vẫn mang tính nội bộ và tự nguyện, dù ông cho rằng đây là “một bước đi đúng hướng”.

Logo OpenAI hiển thị trên điện thoại phía trước hình ảnh được tạo bởi mô hình chuyển văn bản thành hình ảnh Dall-E của ChatGPT. Ảnh: AP

