Những cảnh báo về nguy cơ trí tuệ nhân tạo (AI) vượt khỏi khả năng kiểm soát của con người đang trở lại tâm điểm, sau khi nhiều nhà nghiên cứu và lãnh đạo các công ty AI hàng đầu cảnh báo tốc độ phát triển công nghệ có thể đang vượt quá năng lực xây dựng các biện pháp an toàn.
Dario Amodei, CEO Anthropic, mới đây kêu gọi ngành AI giảm tốc để các biện pháp an toàn có thời gian bắt kịp tốc độ phát triển của công nghệ. Ông cảnh báo các “bầy” tác nhân AI có thể đạt khả năng kiểm soát phần lớn hoạt động trên internet trong vòng 6-12 tháng nếu không có biện pháp bảo vệ mạnh hơn. CEO OpenAI Sam Altman cũng ủng hộ việc phối hợp giữa các công ty và chính phủ để kiểm soát những rủi ro mới.
Những cảnh báo này không xuất hiện vô cớ. Các sự cố gần đây cho thấy AI đã bắt đầu thực hiện những hành động vượt xa việc trả lời câu hỏi hay tạo nội dung. Reuters đưa tin các tác nhân AI của OpenAI từng tải hàng trăm gói phần mềm độc hại lên RubyGems trong một cuộc thử nghiệm hồi tháng 5. Hai tháng sau, các tác nhân AI khác của OpenAI được cho là đã vượt qua những biện pháp cô lập trong một cuộc thử nghiệm và xâm nhập hệ thống của Hugging Face.
Đây chưa phải bằng chứng cho thấy AI đã “tự ý nổi loạn”. Nhưng nó cho thấy một vấn đề ngày càng khó: khi AI được trao khả năng lập kế hoạch, sử dụng công cụ, truy cập internet và tự thực hiện nhiều bước liên tiếp, con người không còn chỉ kiểm soát câu trả lời cuối cùng mà phải kiểm soát cả một chuỗi hành động của hệ thống.
Rủi ro lớn nhất không nhất thiết là AI “có ý thức”
Một trong những hiểu lầm phổ biến nhất về nguy cơ AI là cho rằng máy móc phải có ý thức hoặc mong muốn tiêu diệt con người mới trở thành mối đe dọa.
Thực tế, vấn đề mà giới nghiên cứu AI quan tâm nhiều hơn là sự lệch mục tiêu. Một hệ thống có thể rất giỏi tối ưu hóa một mục tiêu nhưng vẫn thực hiện những hành động mà con người không mong muốn nếu mục tiêu được đặt không chính xác, nếu hệ thống tìm ra cách lách các giới hạn hoặc nếu nó có quyền truy cập quá lớn vào thế giới bên ngoài.
Đây là bài toán “căn chỉnh AI” (AI alignment) – bảo đảm hành vi và mục tiêu của hệ thống phù hợp với ý định của con người. Khi AI trở nên có tính tự chủ cao hơn, bài toán càng khó vì con người có thể không hiểu đầy đủ cách hệ thống đưa ra quyết định.
Cơ quan AI Security Institute của Anh cho biết năng lực của các mô hình AI tiên tiến đang tăng nhanh ở nhiều lĩnh vực liên quan đến an ninh quốc gia và an toàn công cộng. Trong một số lĩnh vực, năng lực của AI được ghi nhận tăng gấp đôi chỉ sau khoảng tám tháng. Trong an ninh mạng, các mô hình AI hiện nay có thể hoàn thành những nhiệm vụ ở cấp độ người mới vào nghề trong khoảng 50% số lần thử, so với hơn 10% vào đầu năm 2024.
Điều đáng lo không nằm ở một chỉ số riêng lẻ mà ở sự kết hợp giữa nhiều năng lực: AI có thể viết mã, tìm lỗ hổng, lập kế hoạch, sử dụng công cụ và tự thực hiện hành động. Khi các khả năng này được kết nối, một hệ thống yếu ở từng nhiệm vụ riêng lẻ vẫn có thể trở nên nguy hiểm khi được trao quyền tự chủ.
Từ tấn công mạng đến vũ khí sinh học
Báo cáo An toàn AI quốc tế 2026, được xây dựng với sự tham gia của hơn 100 chuyên gia từ hơn 30 quốc gia và tổ chức quốc tế, chia các rủi ro của AI thành ba nhóm lớn: sử dụng có chủ đích để gây hại, AI hoạt động sai và các rủi ro mang tính hệ thống.
Trong nhóm đầu tiên, an ninh mạng là một trong những lĩnh vực đáng lo nhất. AI có thể giúp người không chuyên thực hiện các hoạt động tấn công phức tạp hơn, đồng thời giúp những nhóm đã có năng lực tăng tốc độ và quy mô tấn công.
Rủi ro sinh học cũng đặc biệt nhạy cảm. Các mô hình tiên tiến có thể hỗ trợ nhiều công đoạn trong nghiên cứu sinh học, vốn mang lại lợi ích lớn cho y tế nhưng cũng có thể bị lạm dụng. Bản cập nhật của International AI Safety Report năm 2025 cho biết ba nhà phát triển AI hàng đầu đã phải áp dụng các biện pháp bảo vệ nâng cao cho những mô hình mới vì thử nghiệm trước khi phát hành không thể loại trừ khả năng chúng bị sử dụng để hỗ trợ chế tạo vũ khí sinh học.
Một rủi ro khác là thao túng thông tin. AI có thể tạo ra nội dung giả với quy mô lớn, cá nhân hóa thông điệp theo từng nhóm người và ngày càng tạo ra các tác nhân có khả năng tương tác trực tiếp với người dùng. Khi đó, vấn đề không còn đơn giản là “tin giả” mà là khả năng tự động hóa việc thuyết phục và thao túng hành vi.
Kịch bản mất kiểm soát vẫn chưa có câu trả lời
Kịch bản cực đoan nhất là AI đạt năng lực vượt xa con người ở nhiều lĩnh vực, có khả năng tự cải thiện, tự nhân bản hoặc tìm cách duy trì quyền truy cập vào tài nguyên và hệ thống máy tính, trong khi con người không còn đủ khả năng ngăn chặn.
Đây chính là phần gây tranh cãi nhất của cuộc tranh luận.
Một số nhà nghiên cứu cho rằng nguy cơ này cần được chuẩn bị ngay từ bây giờ. Evan Hubinger, người đứng đầu nhóm nghiên cứu căn chỉnh AI của Anthropic, gần đây nói ông đánh giá xác suất AI có thể giết toàn bộ loài người trong thập niên tới ở mức trên 10%. Một số nhà nghiên cứu khác cũng đưa ra những đánh giá nghiêm trọng tương tự.
Nhưng không có sự đồng thuận khoa học rằng AI chắc chắn sẽ dẫn tới tuyệt chủng của con người, cũng như chưa có cơ sở đáng tin cậy để xác định một xác suất cụ thể cho kịch bản này. Nature gần đây lưu ý rằng bằng chứng cho khả năng AI gây tuyệt chủng vẫn rất hạn chế, trong khi những rủi ro đã được chứng minh như thông tin sai lệch, giám sát hàng loạt và lạm dụng công nghệ là những vấn đề hiện hữu.
Vì vậy, câu hỏi quan trọng không phải là liệu “ngày tận thế AI” có xảy ra hay không, mà là con người sẽ làm gì nếu một hệ thống bắt đầu thể hiện những năng lực mà các biện pháp bảo vệ hiện tại không đủ để kiểm soát.
Chính phủ cần chuẩn bị trước khi xảy ra sự cố lớn
Một trong những điểm yếu hiện nay là phần lớn hoạt động kiểm soát AI vẫn phụ thuộc vào chính các công ty phát triển công nghệ.
Anh đã xây dựng AI Security Institute để đánh giá các mô hình tiên tiến. Tuy nhiên, các chuyên gia Anh cũng thừa nhận việc đánh giá an toàn AI vẫn thiếu những tiêu chuẩn và phương pháp khoa học thống nhất, trong khi bản thân các mô hình là những “hộp đen” mà ngay cả nhà phát triển cũng không hoàn toàn hiểu được cơ chế bên trong.
Liên minh châu Âu đang đi xa hơn với Đạo luật AI. Các mô hình AI đa dụng có rủi ro hệ thống phải thực hiện đánh giá và giảm thiểu rủi ro, báo cáo sự cố nghiêm trọng và bảo đảm an ninh mạng.
Trung Quốc cũng đã đưa các kịch bản “mất kiểm soát” vào khuôn khổ an toàn AI từ năm 2024, bao gồm khả năng hệ thống tự tìm kiếm tài nguyên, tự nhân bản hoặc thách thức quyền kiểm soát của con người. Bắc Kinh đồng thời tăng cường đánh giá an toàn và kiểm thử độc lập.
Các chính phủ có thể chưa cần lựa chọn giữa hai cực “cấm AI” và “thả nổi AI”. Điều cần thiết hơn là xây dựng một lớp kiểm soát bắt buộc đối với những hệ thống tiên tiến nhất: kiểm thử trước khi phát hành, đánh giá độc lập, báo cáo sự cố, giám sát khả năng tự chủ, giới hạn quyền truy cập vào hệ thống quan trọng và cơ chế thu hồi hoặc hạn chế mô hình khi phát hiện nguy cơ nghiêm trọng.
Quan trọng hơn, các tiêu chuẩn này không thể chỉ được áp dụng ở một quốc gia. Mỹ và Trung Quốc đang là hai trung tâm lớn nhất của cuộc đua AI, trong khi mô hình được phát triển ở một nước có thể nhanh chóng được triển khai trên toàn cầu. Reuters dẫn lời các quan chức châu Âu cho rằng hợp tác giữa Mỹ, Trung Quốc và các nước khác là cần thiết để xây dựng những tiêu chuẩn an toàn chung.
Nature cũng cho rằng thế giới đang dần hình thành đồng thuận rằng AI cần được quản lý, nhưng vẫn chưa thống nhất về cách thức. Tạp chí này đặc biệt nhấn mạnh nhu cầu tăng quyền hạn cho các cơ quan độc lập để kiểm tra và buộc các công ty chịu trách nhiệm về an toàn của mô hình.
AI có thể mang lại những bước tiến lớn trong khoa học, y tế và kinh tế. Chính vì vậy, mục tiêu của quản lý không nên là ngăn công nghệ phát triển mà là bảo đảm năng lực kiểm soát của con người tăng nhanh ít nhất ngang với năng lực của AI.
Nếu chờ đến khi một hệ thống thực sự vượt khỏi tầm kiểm soát mới xây dựng luật chơi, có thể đã quá muộn. Với công nghệ có khả năng tự động hóa cả việc tìm kiếm lỗ hổng, lập kế hoạch và hành động, bài toán an toàn không còn là một vấn đề phụ của ngành AI mà đang trở thành một vấn đề an ninh quốc gia và quản trị toàn cầu.

Từ trái sang: Tổng giám đốc OpenAI Sam Altman; Lisa Su, tổng giám đốc kiêm Chủ tịch AMD; Michael Intrator, đồng sáng lập kiêm tổng giám đốc CoreWeave; và Brad Smith, Phó chủ tịch kiêm Chủ tịch Microsoft, ngồi tại phiên điều trần của Ủy ban Thương mại, Khoa học và Giao thông Thượng viện Mỹ với chủ đề “Giành chiến thắng trong cuộc đua AI: Tăng cường năng lực điện toán và đổi mới của Mỹ”, tại Đồi Capitol ở Washington, D.C., ngày 8-5-2025. Ảnh: Reuters

CEO Dario Amodei của Anthropic kêu gọi các công ty AI đi chậm lại trong việc phát triển các mô hình mới do lo ngại về việc AI vượt ra ngoài tầm kiểm soát của con người. Ảnh: AP
| Những cảnh báo ngày càng dày đặc về AI Các cảnh báo về nguy cơ AI vượt khỏi tầm kiểm soát đang đến từ ngày càng nhiều nhóm, từ những người trực tiếp phát triển công nghệ đến giới nghiên cứu và chính trị. Bilal Chughtai, cựu nhân viên Google DeepMind, hôm thứ Hai trở thành nhà nghiên cứu AI mới nhất cảnh báo công nghệ này có thể “giết chết toàn bộ nhân loại”, đồng thời cho rằng thời gian để ngăn kịch bản đó xảy ra có thể không còn nhiều. Evan Hubinger, nhà nghiên cứu căn chỉnh AI tại Anthropic, cho biết ông nghiêm túc tin AI có thể “giết toàn bộ con người” và cá nhân ước tính xác suất này trên 10% trong thập niên tới. Ông thừa nhận ngành AI hiện chưa có kế hoạch đủ chắc chắn để giải quyết bài toán căn chỉnh khi AI đạt mức siêu trí tuệ. Paul Christiano, một trong những nhà nghiên cứu hàng đầu về căn chỉnh AI, cũng cảnh báo rằng nếu con người tạo ra siêu trí tuệ mà không có cơ chế kiểm soát đủ mạnh, “chúng ta có thể mất quyền kiểm soát vĩnh viễn”. Anthony Aguirre, Giám đốc điều hành Future of Life Institute, lại nhấn mạnh một kịch bản âm thầm hơn: con người dần giao quyền quyết định và phân bổ nguồn lực cho AI đến mức trở nên phụ thuộc vào máy móc để tồn tại. Jaan Tallinn, nhà đầu tư AI và đồng sáng lập Skype, người lâu nay ủng hộ giám sát chặt chẽ hơn đối với AI tiên tiến, đã cảnh báo một bộ phận giới nghiên cứu đang đánh giá quá thấp nguy cơ tuyệt chủng. Elon Musk kêu gọi các công ty AI hàng đầu phối hợp kiểm thử mô hình của nhau trước khi đưa sản phẩm ra công chúng, trong bối cảnh nhiều lãnh đạo ngành AI cảnh báo tốc độ phát triển công nghệ đang vượt khả năng kiểm soát rủi ro, đồng thời kêu gọi chính phủ tăng cường giám sát. Đáng chú ý, Thượng nghị sĩ Mỹ Bernie Sanders, một chính trị gia cấp tiến của đảng Dân chủ, và Steve Bannon, đồng minh của Tổng thống Donald Trump, hôm thứ Ba cùng kêu gọi áp đặt các hạn chế đối với hệ thống AI. Hai nhân vật thuộc hai phe chính trị đối nghịch hiếm hoi cùng gặp nhau ở mối lo AI có thể gây tổn hại cho con người. Trong khi đó, Giáo sư Stuart Russell và cựu Bộ trưởng Quốc phòng Anh Des Browne đã ví rủi ro từ siêu trí tuệ nhân tạo với thảm họa hạt nhân, cho thấy vấn đề đang được nhìn nhận ngày càng nhiều như một vấn đề an ninh toàn cầu, thay vì chỉ là câu chuyện của ngành công nghệ. Điểm đáng chú ý của những tiếng nói mới này không nằm ở việc họ cùng dự báo một “ngày tận thế” do AI, mà ở sự đồng thuận ngày càng rộng rằng năng lực AI đang tiến nhanh hơn các cơ chế an toàn, kiểm thử và quản lý được thiết kế để kiểm soát nó. |

