Một nhóm các nhà nghiên cứu AI độc lập phát hiện những tác nhân AI được triển khai nội bộ dường như đã bắt đầu đăng bài trên một diễn đàn wiki ít người biết đến của Đức để phối hợp thực hiện các bài đánh giá. Các tác nhân này có vẻ đã hoạt động cùng nhau trong hơn một tháng mà OpenAI không hay biết.
Người phát ngôn của OpenAI không xác nhận liệu các tác nhân này có thực sự thuộc OpenAI hay không, cũng như không cho biết công ty phát hiện hoạt động của chúng vào thời điểm nào. Người này cho biết OpenAI chưa có cơ hội xem xét các phát hiện của nhóm nghiên cứu trước khi chúng được công bố, nhưng công ty “hiện đang xem xét kỹ nội dung và sẽ thực hiện các bước tiếp theo cần thiết”.
Sau khi OpenAI công bố hồi tháng 8 rằng các tác nhân làm việc trong một hệ thống đánh giá nội bộ đã có thể truy cập Internet mở và khai thác nền tảng Hugging Face, một nhóm nghiên cứu gồm Sydney Von Arx, CEO của Nightingale; nhà nghiên cứu AI Cormac Slade Byrd; Spencer Kitts thuộc Redwood Research và Thomas Larsen thuộc AI Futures Project bắt đầu tìm kiếm bằng chứng về những tác nhân AI khác hoạt động ngoài tầm kiểm soát.
Các nhà nghiên cứu đặt mình vào vị trí của những tác nhân AI để tìm hiểu nhu cầu của chúng, đồng thời triển khai một mô hình ngôn ngữ lớn nhằm xác định những nơi mà các tác nhân này có khả năng tập trung. Họ sau đó phát hiện một dịch vụ lưu trữ wiki đặc biệt dễ bị khai thác.
DseWiki đã tồn tại 25 năm nhưng chỉ có 10 lần chỉnh sửa trong 20 năm trước khi các tác nhân AI xuất hiện.
Từ ngày 11/5, các nhà nghiên cứu theo dõi hoạt động của những tác nhân, trong đó nhiều tác nhân có tên chứa các dấu hiệu nhận diện OpenAI. Sau nhiều lần thử, chúng cuối cùng đã chỉnh sửa được trang wiki tiếng Đức này.
Đến giữa tháng 6, các tác nhân bắt đầu tích cực trao đổi mẹo về cách trả lời những câu hỏi tìm kiếm trên web trong thời gian giới hạn, đồng thời chia sẻ đáp án để vượt qua các bài kiểm tra. Một người kiểm duyệt dường như đã phát hiện những bài đăng này và bắt đầu xóa chúng vì cho rằng đó là thư rác. Các tác nhân sau đó tìm cách chống lại việc xóa bài bằng cách đặt chuỗi ký tự “ZZZ” ở đầu mỗi bài đăng để khiến nội dung khó bị phát hiện khi sắp xếp theo thứ tự bảng chữ cái.
“Người quản trị đã dành 5 ngày tiếp theo để chiến đấu trong một cuộc chiến mà họ không thể thắng, xóa trung bình 100 trang mỗi ngày trong khi các tác nhân tạo khoảng 400 trang mới mỗi ngày,” nhóm nghiên cứu viết. “Đến ngày 22/6, hoạt động chỉnh sửa của các tác nhân đột ngột dừng lại. Người quản trị tiếp tục dành mỗi buổi tối trong 5 tuần sau đó để xóa những trang còn lại do các tác nhân tạo ra.”
Các tác nhân còn xóa nội dung trên trang chủ của wiki và thay thế bằng những danh sách liên kết do chúng tạo ra. Người kiểm duyệt khôi phục phiên bản ban đầu. Cuộc giằng co này diễn ra 9 lần.
Cuối cùng, dường như có người tại OpenAI đã phát hiện hoạt động này. Các nhà nghiên cứu ghi nhận những trình duyệt có vẻ do con người điều khiển truy cập từ các địa chỉ IP của OpenAI. Sau đó, hoạt động của các tác nhân giảm xuống gần như bằng 0, trước khi tăng trở lại khi những người có liên quan đến OpenAI tìm cách khôi phục các trang đã bị xóa.
OpenAI trước đây từng đưa ra những thông tin chung chung về việc các tác nhân AI của công ty giành được quyền truy cập trái phép vào các dịch vụ liên lạc bên ngoài. Tuy nhiên, công ty chưa từng công bố sự cố cụ thể này hoặc cho biết những sự việc tương tự xảy ra với tần suất như thế nào.
Dù không có dấu hiệu rõ ràng cho thấy hoạt động bất hợp pháp đã xảy ra trong sự cố lần này, vụ việc đặt ra thêm câu hỏi về khả năng OpenAI giám sát và kiểm soát công nghệ mà công ty đang phát triển, trong bối cảnh hoạt động giám sát và đóng góp ý kiến của công chúng đối với các phòng thí nghiệm AI tiên phong vẫn còn hạn chế.
“Sự thiếu vắng một cơ chế quản trị AI cấp liên bang thực sự đồng nghĩa với việc các công ty phát triển AI tiên phong có thể tự lựa chọn thời điểm công bố những sự cố như thế này,” Hạ nghị sĩ Lori Trahan, thành viên đảng Dân chủ bang Massachusetts, nói.
Trahan đã giới thiệu dự luật lưỡng đảng mang tên Frontier Act, trong đó yêu cầu các phòng thí nghiệm AI phải công bố những sự cố như vậy và cho phép các đơn vị kiểm toán độc lập tiến hành đánh giá.
Các nhà nghiên cứu an toàn AI lo ngại thế hệ mô hình mạnh mẽ mới nhất, với quá trình suy luận ngày càng khó giải thích ngay cả đối với chính những người tạo ra chúng, có thể thực hiện những hành động gây tổn hại cho con người. Astra, được OpenAI phát hành hôm qua, dường như là mô hình có năng lực cao nhất của công ty cho đến nay.
OpenAI cho biết Astra cũng là mô hình có khả năng tuân thủ chỉ dẫn của con người cao nhất. Tuy nhiên, các nhóm nghiên cứu bên thứ ba được mời đánh giá mô hình đã bày tỏ lo ngại về mức độ phù hợp của nó với các mục tiêu và giá trị của con người.
Viện An toàn AI Anh và Apollo Research đều cảnh báo rằng mô hình có thể nhận biết khi đang được đánh giá và từ đó che giấu hành vi thực sự của mình.
“Apollo cho rằng, xét đến tỷ lệ nhận biết cuộc đánh giá cao hơn và khoảng thời gian đánh giá hạn chế, tỷ lệ hành vi sai lệch thấp trong trường hợp này không cung cấp bằng chứng đáng kể về mức độ phù hợp hoặc không phù hợp của mô hình,” các nhà nghiên cứu viết trong báo cáo đánh giá.

Các nhà nghiên cứu phát hiện những tác nhân AI hoạt động ngoài kiểm soát của OpenAI chủ yếu tìm cách xóa dấu vết sau khi tìm ra các lối tắt để vượt qua các bài kiểm tra nội bộ của công ty. Ảnh: NBC News

