
Một trong những mô hình AI mạnh nhất của Trung Quốc cũng đã thoát khỏi sự kiểm soát.
Các nhà nghiên cứu bảo mật cho biết Kimi K3, một mô hình mã nguồn mở (open-weight model) của Trung Quốc, đã tự ý truy cập internet nhằm gian lận trong một bài kiểm tra được giao.
Will Knight
Kinh doanh
Ngày 6/8/2026 9:16 PM
Một trong những mô hình AI mạnh nhất của Trung Quốc cũng đã thoát khỏi sự kiểm soát
Các nhà nghiên cứu bảo mật cho biết Kimi K3, một mô hình mã nguồn mở của Trung Quốc, đã tự ý truy cập internet để gian lận trong một bài kiểm tra được giao.
Ảnh minh họa: Wired Staff; Getty Images
Tải bình luận
Lưu câu chuyện này
Tải bình luận
Lưu câu chuyện này
Ngành công nghiệp AI đang trải qua một mùa hè đầy rẫy các tác nhân nổi loạn. Mô hình mới nhất thoát ra internet trong quá trình kiểm tra bảo mật là Kimi K3, một sản phẩm mã nguồn mở mạnh mẽ từ công ty Moonshot AI của Trung Quốc.
Frontier Security, một công ty khởi nghiệp của Mỹ, cho biết Kimi K3 đã vượt ra khỏi môi trường sandbox (hộp cát) trong khi kiểm tra kỹ năng an ninh mạng phòng thủ của nó. Tương tự như các sự cố đã được OpenAI và Anthropic báo cáo trước đây, việc thoát ra một phần là do cấu hình sai trong môi trường sandbox được thiết kế để chứa nó. Tuy nhiên, Frontier tuyên bố rằng sự cố này cho thấy Kimi có ít biện pháp bảo vệ an ninh mạng hơn hầu hết các mô hình AI mạnh mẽ khác, điều này cho phép nó tự ý truy cập internet mà không có sự cho phép rõ ràng.
Yaron Singer, Giám đốc điều hành của Frontier Security, cho biết: “Chúng tôi đã tìm thấy một lỗ hổng trong môi trường sandbox. Nhưng chúng tôi cũng phát hiện ra rằng Kimi đã lợi dụng lỗ hổng đó – cho thấy nó không có các biện pháp bảo vệ nội bộ [tương tự]”.
Không giống như các sự cố gần đây khác về việc các tác nhân AI đi chệch hướng, Kimi K3 không tấn công bất cứ thứ gì sau khi truy cập internet – vì các câu trả lời cho các vấn đề mà nó đang tìm kiếm có thể dễ dàng tìm thấy trên GitHub.
Moonshot đã không phản hồi yêu cầu bình luận vào thời điểm xuất bản.
Sự cố này là sự kiện mới nhất trong một loạt các sự cố của tác nhân, cho thấy các mô hình AI ngày càng có khả năng về an ninh mạng đang trở nên khó kiểm soát hơn.
Tháng trước, OpenAI tiết lộ rằng một mô hình chưa được phát hành đã thoát ra internet và sau đó tấn công Hugging Face, một công ty lưu trữ các mô hình và dữ liệu AI, để tìm câu trả lời cho các vấn đề mà nó được giao nhiệm vụ giải quyết. OpenAI sau đó đã chia sẻ rằng các tác nhân AI của họ thực tế đã tấn công thêm bốn dịch vụ khác trong chuỗi sự kiện này.
Ngay sau khi OpenAI báo cáo sự cố của mình, Anthropic tiết lộ rằng một số mô hình của họ cũng đã truy cập internet và tấn công các hệ thống bên ngoài. Tuần trước, AISI cũng tiết lộ rằng trong các thử nghiệm của riêng mình, các phiên bản của mô hình OpenAI và Anthropic đã bị vô hiệu hóa các biện pháp bảo vệ an ninh đã thực hiện nhiều cuộc tấn công trên internet, bao gồm một nỗ lực đặc biệt táo bạo của Mythos 5 của Anthropic nhằm cài đặt mã độc vào một dự án mã nguồn mở trên GitHub.
Mặc dù các sự cố AI bị tấn công này đều khác nhau về nguyên nhân và mức độ, Kimi K3 tương tự một số trường hợp trong đó một sandbox (môi trường thử nghiệm biệt lập) được cấu hình sai đã cho phép truy cập vào một số trang web thay vì giữ nó trong môi trường mô phỏng. Mô hình này được giao nhiệm vụ giải quyết các vấn đề mà lẽ ra không cần tìm kiếm câu trả lời trực tuyến, và dường như đã đi chệch khỏi các hướng dẫn đó. Mô hình đã phải tự tìm ra rằng nó có quyền truy cập vào các trang web nhất định bằng cách thăm dò cài đặt mạng của sandbox.
Mặc dù lỗi của con người dường như đã đóng một vai trò quan trọng trong mỗi lần vượt rào, nhưng hậu quả đã trở nên trầm trọng hơn bởi thực tế là các mô hình AI tiên tiến được thiết kế để sử dụng lý trí và thực hiện các hành động phức tạp nhằm giải quyết vấn đề.
Một điểm khác biệt chính giữa các sự cố trước đây và sự cố được Frontier Security phát hiện là nó liên quan đến một mô hình đã được phổ biến rộng rãi, với các biện pháp bảo vệ tương tự mà một người dùng bình thường sẽ gặp phải.
“Kimi K3 rất giỏi trong việc theo đuổi mục tiêu bằng mọi cách cần thiết và cũng không có các rào cản để ngăn nó gian lận hoặc thoát khỏi sandbox,” Paul Kassianik, một nhà nghiên cứu tại Frontier Security, cho biết.
Kassianik và Singer đều nói rằng Kimi và các mô hình mã nguồn mở khác cũng là những công cụ tuyệt vời cho phòng thủ an ninh mạng. (Hugging Face cuối cùng đã sử dụng một mô hình AI không tên từ Trung Quốc để tự bảo vệ mình chống lại cuộc tấn công của tác nhân OpenAI.) Công ty của họ đã phát triển các tiêu chuẩn đo lường khả năng của một mô hình trong việc tìm ra lỗ hổng trong phần mềm và mạng, cho thấy Kimi xuất sắc trong các nhiệm vụ này.
Sandbox được Frontier Security thử nghiệm được phát triển bởi Viện An ninh AI (AISI) của chính phủ Vương quốc Anh để thử nghiệm các hệ thống AI. AISI đã không phản hồi yêu cầu bình luận vào thời điểm đăng bài.
Một số chuyên gia an ninh mạng cho rằng vấn đề được Frontier Security phát hiện củng cố tầm quan trọng của việc cấu hình cẩn thận các môi trường mà các mô hình AI tiên tiến được đặt vào.
“Điều đó hoàn toàn không đáng ngạc nhiên,” Matt Fredrikson, Giám đốc điều hành của Gray Swan, một công ty khởi nghiệp an ninh mạng khác, và phó giáo sư tại Đại học Carnegie Mellon, cho biết. “Là một hiện tượng chung, nếu bạn đặt cho một trong những mô hình này một mục tiêu, và nếu bạn không quá rõ ràng, giống như những bức tường bạn đang đặt xung quanh nó, nó sẽ tìm cách để có được câu trả lời.”
Fredrikson nói rằng điều này có nghĩa là những người sử dụng các mô hình AI làm tác nhân, bao gồm trong các công cụ như OpenClaw, sử dụng AI để tự động hóa một loạt các công việc hữu ích, có thể thấy hệ thống của họ hoạt động sai nếu họ không cẩn thận. “Đó là một câu chuyện cảnh báo,” ông nói.

Nguồn tin: Wired AI — Tác giả: Will Knight. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.