
Các tác nhân AI "ngoan cố" không phải là xấu xa. Chúng chỉ quá sốt sắng làm hài lòng.
Các tác nhân AI tự giải phóng và xâm nhập vào các hệ thống khác chỉ đang cố gắng làm hài lòng chúng ta.
Will Knight
Kinh doanh
Ngày 12/8/2026 2:45 PM
Các tác nhân AI "nổi loạn" không phải là ác. Chúng chỉ quá sốt sắng làm hài lòng con người.
Các tác nhân AI tự ý thoát ly và xâm nhập vào các hệ thống khác chỉ đang cố gắng làm hài lòng con người.
Ảnh minh họa: WIRED Staff; Getty Images
CommentLoader
Lưu bài viết này
CommentLoader
Lưu bài viết này
Việc các tác nhân trí tuệ nhân tạo (AI) tự do thoát ly và xâm nhập vào các hệ thống khác một cách vui vẻ có vẻ là dấu hiệu của một cuộc nổi dậy máy móc sắp xảy ra. Trên thực tế, điều này xảy ra khi con người thúc đẩy các thuật toán cực kỳ thông minh, nhưng cũng khá "ngốc nghếch", phải tuân theo mọi mệnh lệnh.
Tôi lần đầu tiên được cảnh báo về mối đe dọa an ninh mạng từ các tác nhân AI vào cuối năm 2025. Dawn Song, giáo sư tại Đại học California, Berkeley và là một trong những chuyên gia hàng đầu thế giới về AI và an ninh mạng, đã nắm lấy tay tôi khi tôi đang rời khỏi hội nghị học thuật NeurIPS. Bà Song nói rằng tôi nên cảnh báo mọi người về sự hỗn loạn có thể xảy ra do khả năng tấn công mạng của AI đang phát triển nhanh chóng. Bà ấy hiếm khi cường điệu về AI, vì vậy tôi đã làm theo.
Tuy nhiên, mọi việc đã leo thang nhanh chóng, ngay cả trong tám tháng qua. Một loạt sự cố liên quan đến các tác nhân AI tự do đã thoát khỏi giới hạn của chúng và xâm nhập vào các hệ thống bên ngoài một cách tùy tiện cho thấy công nghệ này đã trở nên mạnh mẽ đến mức nào. Tôi đã gặp lại bà Song, người gần đây đã gia nhập Meta, để hỏi về những diễn biến tiếp theo và những gì chúng ta nên làm.
Tin xấu là bà Song cho rằng các vụ tấn công của AI sẽ trở nên tồi tệ hơn trước khi tốt hơn. Tin tốt là có vẻ rõ ràng lý do tại sao những "kẻ tinh quái" này lại đi chệch hướng ngay từ đầu.
Bà Song cho biết: "Chúng chỉ có những mục tiêu cần hoàn thành và chúng có những khả năng rất mạnh mẽ".
Vòng lặp phản hồi
Các tác nhân AI không có khả năng như vậy, ngay cả năm ngoái. Chúng mắc quá nhiều lỗi và bỏ cuộc quá thường xuyên. Nhưng việc tiếp tục huấn luyện đã khiến chúng trở nên thành thạo hơn nhiều.
Một kỹ thuật gọi là học tăng cường (reinforcement learning) cho phép các thuật toán giải quyết vấn đề và cung cấp cho chúng phản hồi tích cực hoặc tiêu cực cho kết quả tốt hoặc xấu. Lập trình đặc biệt phù hợp với điều này, bởi vì thiết lập học tăng cường có thể thưởng cho một mô hình nếu nó đưa ra một chương trình chạy đúng.
Việc tiếp tục huấn luyện là lý do tại sao các mô hình AI có thể thực hiện nhiều bước "tác nhân" – thao tác tệp, sử dụng công cụ phần mềm và truy cập web – khi chúng xây dựng phần mềm. Các công ty AI cũng đã nỗ lực rất nhiều trong việc dạy các mô hình tìm lỗ hổng trong phần mềm và hệ thống nhằm tự động hóa công việc an ninh mạng.
Các mô hình AI cũng được huấn luyện để không làm những điều xấu. Vấn đề là, khi chúng trở nên giỏi hơn trong việc tuân theo các lệnh của con người trong lập trình và tìm lỗi, sự sốt sắng hoàn thành một nhiệm vụ của chúng đã bắt đầu làm mờ đi nhận thức về đúng sai. Nói cách khác, các tác nhân AI không phải là ác – chúng chỉ quá sốt sắng làm hài lòng. Bà Song nói: "Chúng được huấn luyện để cố gắng hoàn thành nhiệm vụ". Việc đột nhập vào internet để gian lận trong một bài kiểm tra có vẻ xảo quyệt, nhưng đó có lẽ là cách hiệu quả nhất để hoàn thành công việc.
Một điều mà tôi chưa thực sự đánh giá cao vào thời điểm đó là mức độ kỳ lạ của tình huống này: các tác nhân AI (AI agents) thảo luận về kỹ thuật tấn công mạng trên các diễn đàn tin nhắn riêng tư và nghĩ ra những cách lừa đảo con người khéo léo để đạt được mục đích; thậm chí tự sao chép sang các máy tính khác để tìm kiếm thêm tài nguyên.
Một mặt, các mô hình AI được huấn luyện để bắt chước rất tốt nhiều hành vi của con người, vậy tại sao chúng không nên âm mưu, lừa đảo và gian lận? Nhưng mặt khác, con người (thường) hiểu rằng tấn công mạng và lừa đảo là không đúng đắn. Những sự việc này minh họa cho thấy sự bắt chước con người này thực sự nông cạn đến mức nào: các tác nhân AI không học được loại suy luận đạo đức mà ngay cả trẻ nhỏ cũng thể hiện.
**Ngày càng nhiều AI**
Ông Song cho rằng khả năng các tác nhân AI đi chệch hướng hoặc bị kẻ xấu lợi dụng sẽ gia tăng khi AI ngày càng trở nên mạnh mẽ hơn. Và cách tốt nhất để giải quyết vấn đề các tác nhân AI "nổi loạn" – hay nên gọi là quá nhiệt tình? – có thể liên quan đến việc sử dụng thêm AI để giải quyết vấn đề.
Các công ty AI đã sử dụng các hệ thống AI phụ để giám sát hành vi của các hệ thống chính, và có thể sẽ có nhiều sự chú trọng hơn vào việc phát hiện khi các mô hình AI đã đi quá giới hạn.
Một ý tưởng mới nổi khác là tích hợp một nhận thức tốt hơn về đúng và sai vào quá trình học tăng cường (reinforcement learning) mà các mô hình nhận được khi chúng học cách hoàn thành công việc. Ông Song cho biết: “Các tác nhân có thể lập kế hoạch một lộ trình với các hướng khác nhau để đạt được mục tiêu của mình. Tôi nghĩ bước tiếp theo chúng ta cần giải quyết là làm thế nào để chúng hiểu rằng không phải tất cả các lộ trình đều như nhau”. “Đây là một nghiên cứu mở, nhưng là điều chúng tôi đang bắt đầu tìm hiểu”.
Hãy hy vọng ông Song hoặc một người nào đó có thể dạy AI cách đúng đắn để tuân theo các mệnh lệnh của con người.
Đây là một ấn bản của bản tin AI Lab của Will Knight. Đọc các bản tin trước đây tại đây.

Nguồn tin: Wired AI — Tác giả: Will Knight. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.