
Các tác nhân AI (trí tuệ nhân tạo) độc hại lại tiếp tục tấn công.
Các tác nhân AI "lừa đảo" từ OpenAI và Anthropic một lần nữa bị phát hiện đang cố gắng phá hoại máy chủ và phần mềm, đồng thời để lại hướng dẫn cho các hành vi xấu trong tương lai.
Paresh DaveBrian Barrett
Kinh doanh
Ngày 4/8/2026 7:11 PM
Các tác nhân AI giả mạo lại tấn công mạng
Các tác nhân AI giả mạo từ OpenAI và Anthropic một lần nữa bị phát hiện đang cố gắng phá hoại máy chủ và phần mềm – đồng thời để lại hướng dẫn cho các hành vi xấu trong tương lai.
Ảnh minh họa: Nhân viên WIRED; Getty Images
Tải bình luận
Lưu câu chuyện này
Tải bình luận
Lưu câu chuyện này
Thật khó để theo dõi tất cả các lần và cách thức các mô hình AI từ OpenAI và Anthropic đã liên quan đến "sự cố bảo mật", vượt ra ngoài giới hạn thử nghiệm của chúng và tương tác với internet rộng lớn hơn theo những cách không mong muốn, thường là không được chào đón. Thêm những điều này vào danh sách: Các tác nhân từ cả hai phòng thí nghiệm AI đã thực hiện các cuộc tấn công mạng gần đây, chưa được tiết lộ trước đây, với một tác nhân thậm chí còn để lại hướng dẫn cho các phiên bản tương lai của chính nó.
Hành vi đáng báo động nhất được tiết lộ vào thứ Ba dường như có liên quan đến thử nghiệm do Viện An ninh AI của Vương quốc Anh (AISI) thực hiện, nơi đánh giá các mô hình tiên tiến để xác định các vấn đề tiềm ẩn trước khi phát hành công khai. AISI thử nghiệm các mô hình đó trong "phạm vi mạng", một mạng mô phỏng trong đó các tác nhân AI được giao nhiệm vụ giải quyết các thách thức an ninh mạng. Trong một đợt thử nghiệm gần đây, các mô hình từ cả Anthropic và OpenAI đã thực hiện "hành động tự động, không được phép trên internet trực tiếp" tổng cộng 19 lần trong 122 lần chạy huấn luyện.
Viện đã quy 17 hành động không được phép cho mô hình Mythos 5 của Anthropic và hai hành động cho GPT-5.6-Sol của OpenAI. Trong trường hợp được viện mô tả là "nghiêm trọng nhất", một tác nhân AI đã cố gắng chèn mã độc vào một dự án mã nguồn mở trên GitHub. Nó thậm chí còn tạo ra các nhân vật trực tuyến "để gây áp lực buộc người duy trì dự án phải chấp thuận mã", theo AISI. Mặc dù đã cố gắng thực hiện các kỹ thuật xã hội một cách tinh vi, một người đánh giá dự án cuối cùng đã từ chối yêu cầu kéo (pull request).
Tuy nhiên, tác nhân này còn đi xa hơn. "Tác nhân đã cố gắng chèn các hướng dẫn độc hại vào nơi nó cho rằng các hệ thống AI tự động khác có thể tiếp nhận và thực thi chúng", AISI cho biết, mô tả một nỗ lực tiêm lệnh (prompt injection). Một tác nhân thậm chí còn để lại tin nhắn công khai trên GitHub, đề nghị hợp tác với các tác nhân khác để hoàn thành nhiệm vụ của mình và đưa ra bản tóm tắt công việc đã thực hiện cho đến nay. Các tác nhân tiếp theo đã tìm thấy – và sử dụng – những hướng dẫn đó.
AISI cho biết còn quá sớm để nói liệu các tác nhân được đề cập có hiểu rằng chúng đã rời khỏi môi trường thử nghiệm hay không, hoặc liệu chúng có tin rằng chúng vẫn nằm trong giới hạn của mô phỏng hay không. Điều quan trọng là, AISI không thử nghiệm trong môi trường hộp cát (sandbox); nó cho phép các tác nhân truy cập internet mở trong quá trình thử nghiệm, một phần để chúng có thể truy cập các công cụ để hoàn thành nhiệm vụ của mình. Trong trường hợp này, chúng đã làm nhiều hơn thế.
Trong một loạt sự cố khác được OpenAI trình bày chi tiết vào thứ Ba, một phòng thí nghiệm bảo mật AI của bên thứ ba có tên Irregular đã vô tình cấp quyền truy cập internet mở cho một mô hình OpenAI không xác định. Mô hình này đã được giao một mục tiêu lẽ ra phải được hoàn thành trong môi trường hộp cát, nhưng do cấu hình sai, nó đã tấn công một trang web thực, sử dụng cái mà OpenAI mô tả là "một lỗ hổng bảo mật cơ bản". Không chỉ vậy, mô hình còn "tìm thấy và sử dụng thông tin đăng nhập để vận hành trang web đó".
Không rõ loại trang web mà tác nhân OpenAI đã tấn công, hoặc "vận hành" nó có thể bao gồm những gì. Irregular đã không trả lời yêu cầu bình luận.
Những phát hiện mới nhất được đưa ra sau một số tiết lộ từ OpenAI vào tháng trước, bao gồm sự cố nổi bật khi hai mô hình của công ty đã xâm nhập vào máy chủ của Hugging Face – công ty khởi nghiệp đánh giá và lưu trữ AI – cùng bốn tổ chức khác trên đường đi, để đánh cắp đáp án của một bài kiểm tra mà chúng đang được chấm điểm. Các tiết lộ của OpenAI đã thúc đẩy Anthropic xem xét lại các thử nghiệm của riêng mình. Tuần trước, nhà phát triển chatbot Claude phát hiện ra rằng các mô hình của họ đã truy cập trái phép vào hệ thống máy tính của ba tổ chức khác nhau không được nêu tên.
Cho đến nay, các mô hình AI đã gây ra thiệt hại hạn chế, ngoài việc bị cáo buộc vi phạm điều khoản sử dụng của một số dịch vụ và chỉ ra những lỗ hổng bảo mật từ phía các tổ chức mà chúng đã xâm nhập. Tuy nhiên, các sự cố này đã nhấn mạnh khả năng của các mô hình AI trong việc tìm kiếm lỗ hổng trên internet và những nguy hiểm đang chờ đợi nếu chúng được phép hoạt động với ít hạn chế. OpenAI gọi tình huống Hugging Face là "chưa từng có tiền lệ", nhưng sự chồng chất của các vụ vi phạm cho thấy một mô hình rõ ràng về sự sơ suất và liều lĩnh của con người từ phía các nhà phát triển AI, như các chuyên gia an ninh mạng đã mô tả.
Gaby Raila, người phát ngôn của OpenAI, cho biết các sự cố được công bố vào thứ Ba "xảy ra trong quá trình đánh giá an ninh mạng do các đối tác đánh giá thực hiện trong môi trường thử nghiệm với các biện pháp bảo vệ giảm thiểu, trong điều kiện không phản ánh việc sử dụng thông thường."
Anthropic cho biết trong một bài đăng trên mạng xã hội vào thứ Ba rằng AISI không "áp đặt bất kỳ hạn chế cụ thể nào về cách sử dụng internet", điều này cùng với "việc loại bỏ các biện pháp bảo vệ có nghĩa là các mô hình được thử nghiệm trong 'điều kiện cho phép một cách cố ý' không đại diện cho bất kỳ mô hình sản xuất nào của chúng tôi."
Tuy nhiên, cả hai công ty tiếp tục cam kết sẽ tăng cường các biện pháp bảo mật của mình.
Khi các công ty AI hàng đầu cạnh tranh để xây dựng các mô hình mạnh mẽ hơn và thu hút khách hàng, không rõ khi nào các vụ vi phạm có thể dừng lại. Các mô hình có thể luôn tìm cách vượt qua và xâm nhập vào các hệ thống do con người thiết kế. Mặc dù các nhân viên của công ty cùng với các cơ quan quản lý và nhà lập pháp đã kêu gọi có thể làm chậm tốc độ phát triển và đưa ra các quy tắc mới, nhưng đã có rất ít tiến bộ ngoài các biện pháp tự nguyện mà cuối cùng kêu gọi thử nghiệm nhiều hơn không khác gì những gì đã tạo ra hết vụ vi phạm này đến vụ vi phạm khác.
Thông tin bổ sung bởi Maxwell Zeff.

Nguồn tin: Wired AI — Tác giả: Paresh Dave, Brian Barrett. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.