Anthropic vừa công bố nghiên cứu cho thấy các hệ thống trí tuệ nhân tạo có thể tự tìm kiếm phương pháp và tự cải thiện một mô hình AI trên nhiều tiêu chí an toàn, mở ra hướng tiếp cận mới đối với quá trình phát triển AI tự cải thiện.
Việc sử dụng AI để huấn luyện và cải thiện các mô hình AI khác đang trở thành một hướng nghiên cứu được nhiều phòng thí nghiệm công nghệ theo đuổi. Nghiên cứu mới của Anthropic cung cấp một trong những cái nhìn cụ thể hơn về cách thức này có thể hoạt động trong thực tế.
Trong nghiên cứu công bố hôm thứ Sáu với tiêu đề “Các nhà nghiên cứu tự động có thể giảm thiểu đáng tin cậy các lỗi về mức độ phù hợp của AI”, Anthropic mô tả một hệ thống có khả năng tự động cải thiện hiệu suất của mô hình AI trên 10 tiêu chí đánh giá những hành vi không phù hợp với mục tiêu an toàn được đặt ra.
Kết quả cho thấy hệ thống đã cải thiện hiệu suất trên cả 10 tiêu chí, đồng thời không làm suy giảm hiệu suất tổng thể của mô hình.
Hệ thống do nhà nghiên cứu Chen Yueh-Han thuộc chương trình nghiên cứu sinh của Anthropic dẫn dắt, mô phỏng nhiều bước trong quy trình nghiên cứu truyền thống. Hệ thống tự tìm kiếm các công trình nghiên cứu có sẵn, đề xuất phương pháp cải thiện rồi sử dụng phương pháp đó để huấn luyện mô hình trong khoảng 30 phút.
Quá trình này được lặp lại nhiều lần. Những phương pháp mang lại kết quả tốt được giữ lại, trong khi phương pháp kém hiệu quả bị loại bỏ. Cách làm này cho phép hệ thống thử nghiệm nhiều phương án với tốc độ và quy mô mà nhóm nghiên cứu con người khó có thể thực hiện.
Anthropic cho rằng kết quả nghiên cứu là bằng chứng ban đầu cho thấy tự động hóa quá trình hậu huấn luyện để cải thiện mức độ an toàn của AI có thể trở nên khả thi trong tương lai gần.
Nghiên cứu cũng liên quan đến khái niệm tự cải thiện đệ quy (recursive self-improvement), trong đó một hệ thống AI có khả năng cải thiện chính quá trình phát triển và huấn luyện của mình. Đây được xem là một trong những hướng có thể tạo ra bước tiến lớn tiếp theo của AI.
Nếu AI có thể tự cải thiện phương pháp huấn luyện nhằm bảo đảm các mô hình hoạt động phù hợp với mục tiêu an toàn, khả năng này về lý thuyết có thể được mở rộng sang nhiều khía cạnh khác của quá trình phát triển AI. Khi đó, vai trò của các nhà nghiên cứu con người có thể thay đổi đáng kể.
Anthropic thậm chí đã so sánh trực tiếp hệ thống tự động với các nhà nghiên cứu con người. Theo nghiên cứu, phương pháp tốt nhất do hệ thống tạo ra có thể vượt qua phương pháp do các nhà nghiên cứu giàu kinh nghiệm đề xuất chỉ sau trung bình khoảng sáu giờ. Các hướng nghiên cứu do con người dẫn dắt không cho kết quả tốt hơn.
Chi phí cũng là một điểm đáng chú ý. Anthropic ước tính một hệ thống nghiên cứu tự động chỉ tiêu tốn khoảng 4 USD/giờ cho năng lực tính toán thông qua dịch vụ lập trình, so với khoảng 150 USD/giờ cho một nhà nghiên cứu con người.
Tuy nhiên, Anthropic nhấn mạnh rằng phương pháp này vẫn còn những hạn chế đáng kể.
Hệ thống chỉ có thể cải thiện mô hình theo những gì được đo lường bởi các tiêu chí đánh giá. Nếu các tiêu chí không phản ánh chính xác mục tiêu an toàn thực tế, việc tối ưu hóa theo những tiêu chí đó có thể không mang lại kết quả mong muốn.
Bên cạnh đó, con người vẫn phải xây dựng, duy trì và mở rộng các tiêu chí đánh giá, cũng như kho kiến thức nghiên cứu mà hệ thống tự động sử dụng.
Do đó, nghiên cứu chưa cho thấy AI có thể hoàn toàn tự nghiên cứu và tự phát triển mà không cần con người. Tuy nhiên, nó cho thấy một phần đáng kể của quy trình nghiên cứu AI – từ tìm kiếm tài liệu, đề xuất phương pháp đến thử nghiệm và loại bỏ những phương pháp không hiệu quả – đã có thể được tự động hóa.

Logo Anthropic xuất hiện trên màn hình máy tính trong ảnh minh họa Anthropic nghiên cứu khả năng tự động hóa quá trình nghiên cứu và cải thiện các mô hình AI. Ảnh: Getty Images

