Các nhà nghiên cứu cho rằng AI đang tiến gần khả năng tự cải thiện, trong đó các mô hình có thể tìm cách nâng cấp chính mình và xây dựng phiên bản kế tiếp. Nếu quá trình này ngày càng tự động, tốc độ phát triển AI có thể tăng mạnh.
Các lãnh đạo công nghệ cho rằng điều này có thể thúc đẩy những bước tiến trong khoa học và y học, nhưng cũng kéo theo nhiều rủi ro, nhất là khả năng AI vượt khỏi sự kiểm soát của con người ngày càng gia tăng, cùng với những nguy cơ tiềm tàng đối với nhân loại.
Anthropic trong tuần này công bố chi tiết cách mô hình Claude đang hỗ trợ công ty phát triển phiên bản tiếp theo thông minh hơn của chính nó. Theo Anthropic, Claude hiện thực hiện 26% công việc nghiên cứu và phát triển mô hình của công ty, có nghĩa mô hình có thể hoàn thành phần lớn một nhiệm vụ “từ đầu đến cuối”, dưới sự giám sát của con người.
“Tự cải thiện” nghĩa là gì?
Các công ty AI hàng đầu có cách hiểu khác nhau về khả năng tự cải thiện. Một số xem đây là bất kỳ trường hợp nào AI cung cấp phản hồi giúp cải thiện mô hình, trong khi những công ty khác coi tự cải thiện là khi AI hoàn toàn tự chủ trong quá trình này.
Anthony Aguirre, Chủ tịch kiêm CEO Viện Tương lai Sự sống và giáo sư vật lý tại Đại học California ở Santa Cruz, cho biết về cơ bản, tự cải thiện hoàn toàn tự chủ là khi AI có thể tự nâng cấp, thiết kế phiên bản tiếp theo của hệ thống, rồi phiên bản mới tiếp tục thiết kế phiên bản sau đó.
“Điều thực sự quan trọng ở đây là khi AI làm được nhiều hơn, quá trình đó sẽ nhanh hơn, bởi AI hoạt động nhanh hơn con người rất, rất nhiều,” ông nói.
John Thickstun, giáo sư trợ lý ngành khoa học máy tính tại Đại học Cornell, người nghiên cứu các phương pháp kiểm soát hành vi của mô hình AI, cho rằng nỗi lo về khả năng AI tự cải thiện chủ yếu xuất phát từ viễn cảnh một dạng siêu trí tuệ vượt khỏi tầm kiểm soát có thể xuất hiện từ quá trình này.
Tuy nhiên, ông cho rằng một cách nhìn thực tế hơn cho thấy một dạng tự cải thiện đã diễn ra trong quá trình phát triển AI từ lâu.
“Trong nhiều năm, chúng ta đã sử dụng các mô hình này để hỗ trợ tạo ra phiên bản tiếp theo của chính chúng. Con người dùng các mô hình thế hệ trước để viết mã cho những hệ thống AI sau đó tạo ra thế hệ tiếp theo,” ông nói.
Trong nhiều năm, các nhà nghiên cứu AI nổi tiếng như Andrej Karpathy, đồng sáng lập OpenAI, đã thử nghiệm việc sử dụng AI để huấn luyện và cải thiện các hệ thống AI mới. Theo Thickstun, những nỗ lực này đã mang lại một số cải thiện nhỏ nhưng chưa tạo ra những bước nhảy vọt về khả năng.
Tuy nhiên, Aguirre cho rằng các công ty AI hiện nay đã tiến gần hơn nhiều đến khả năng tạo ra những bước tiến lớn như vậy.
“Có thể thấy qua các biểu đồ của Anthropic theo thời gian rằng ngày càng nhiều công việc nghiên cứu được AI thực hiện và AI ngày càng tiến gần đến trạng thái hoàn toàn tự chủ,” ông nói. “Kết quả cuối cùng của thành công đó, theo tôi, thực sự đáng sợ. Tôi cho rằng đây có lẽ là ý tưởng tồi tệ nhất trong lịch sử nhân loại. Và đúng vậy, họ đang thực hiện nó.”
Khả năng không còn xa
Anthropic vừa chia sẻ tiến trình phát triển AI tự cải thiện và khuyến khích các đối thủ công bố những chỉ số tương tự. Tuy nhiên, công ty chưa nói rõ mình còn cách mục tiêu AI tự cải thiện hoàn toàn, không cần con người can thiệp, bao xa.
OpenAI, công ty phát triển ChatGPT, tháng này công bố một “thực tập sinh nghiên cứu” tự động. Hệ thống này làm được các nhiệm vụ nghiên cứu đã được xác định rõ dưới sự chỉ đạo của con người, kể cả những việc mà một nhà nghiên cứu có kỹ năng phải mất vài ngày mới hoàn thành. Công ty đặt mục tiêu tạo ra một “nhà nghiên cứu” AI tự động vào tháng 3-2028.
Trên blog, OpenAI cho rằng AI tự cải thiện có thể giúp mô hình hành xử phù hợp hơn với giá trị và ý định của con người. Tuy vậy, công ty không coi việc đẩy nhanh quá trình này là kết quả nhất thiết phải theo đuổi. Việc có tiếp tục hay không, và tiếp tục thế nào, phải dựa trên khả năng duy trì quyền kiểm soát của con người, cùng việc cân nhắc lợi ích và rủi ro.
Elon Musk dường như muốn tiến nhanh hơn. Hồi tháng 3, ông cho biết con người ngày càng ít can thiệp vào quá trình cải thiện các mô hình Grok của xAI và “mỗi mô hình kế tiếp được xây dựng bởi mô hình trước đó”, dù quá trình này chưa hoàn toàn tự động. Ông dự kiến AI sẽ tự cải thiện hoàn toàn vào cuối năm nay, chậm nhất là năm 2027.
Microsoft và một số công ty AI hàng đầu khác dường như chọn hướng khác. CEO Microsoft AI Mustafa Suleyman cho biết công ty hướng tới “siêu trí tuệ nhân văn”, tức AI tiên tiến phục vụ con người và nhân loại. Trong bài viết năm 2025, ông nhấn mạnh AI cần được hiệu chỉnh cẩn thận, đặt đúng bối cảnh và hoạt động trong giới hạn nhất định, thay vì trở thành một thực thể có mức tự chủ cao và không bị giới hạn.

Dario Amodei, CEO kiêm đồng sáng lập Anthropic, tham dự Hội nghị thường niên của Diễn đàn Kinh tế Thế giới tại Davos, Thụy Sĩ. Ảnh: AP

