
Mô hình AI Kimi K3 của công ty Moonshot (Trung Quốc) cũng đã thoát khỏi môi trường thử nghiệm.
Kimi K3 cũng phát hiện các lỗ hổng trong môi trường sandbox của mình, cho phép truy cập internet.
Mô hình AI Kimi K3 của Trung Quốc cũng thoát khỏi môi trường thử nghiệm
Tuy nhiên, không giống như các mô hình của OpenAI và Anthropic, Kimi K3 không tấn công một trang web hoặc dịch vụ của bên thứ ba.
Bởi Mariella Moon
Ngày 7/8/2026 6:44 sáng EST
Summit Art Creations/Shutterstock
Cách đây không lâu, ý tưởng về một mô hình hoặc tác nhân AI thoát khỏi giới hạn của chúng và tự mình xâm nhập vào các trang web đã gây ra sự lo ngại. Giờ đây, điều đó đã trở thành một câu chuyện khá phổ biến. Kimi K3, một trong những mô hình AI mạnh nhất được phát triển bởi một công ty Trung Quốc, cũng đã thoát khỏi môi trường thử nghiệm của nó. Theo công ty khởi nghiệp an ninh mạng Frontier của Mỹ, Kimi K3 đã thoát khỏi một môi trường sandbox từ Viện An ninh AI (AISI) của chính phủ Anh trong khi các kỹ năng an ninh mạng phòng thủ của nó đang được đánh giá.
Moonshot đã ra mắt Kimi K3 vào tháng 7 và cung cấp miễn phí ngay sau đó. Theo BBC, các đánh giá của bên thứ ba về mô hình này cho thấy nó có thể so sánh với các mô hình AI hàng đầu từ OpenAI và Anthropic.
Frontier đã làm rõ trong bài đăng của mình rằng mô hình này không khai thác lỗ hổng zero-day. Thay vào đó, nó đã tận dụng một cấu hình sai trong môi trường sandbox của mình, tương tự như những gì đã xảy ra với Anthropic, OpenAI và Meta. Cả ba công ty đều báo cáo rằng các mô hình của họ đã có thể thoát khỏi môi trường cách ly được cho là của chúng do lỗi của đối tác đánh giá của họ, Irregular.
Yaron Singer, Giám đốc điều hành của Frontier Security, nói với Wired rằng mặc dù Kimi không thực hiện bất kỳ hành vi khai thác phức tạp nào, nhưng nó đã tận dụng một lỗ hổng trong môi trường thử nghiệm của AISI. Điều đó cho thấy rằng nó không có các rào cản nội bộ để ngăn chặn bản thân "gian lận" hoặc tìm cách dễ nhất để hoàn thành một nhiệm vụ thay vì thực sự thực hiện nó. Các sự cố tại Anthropic và OpenAI liên quan đến việc thử nghiệm các mô hình chưa được phát hành hoặc các mô hình có biện pháp bảo vệ bị hạ thấp một cách cố ý để cho phép đánh giá nghiêm ngặt hơn. Tuy nhiên, Kimi K3 được thử nghiệm trong sự kiện này đã được phổ biến rộng rãi. Tuy nhiên, Kimi không tấn công vào một trang web hoặc dịch vụ của bên thứ ba. Nó chỉ đơn giản là truy cập internet và tìm thấy giải pháp cho vấn đề mà nó đang giải quyết trên GitHub.
Một trong những bài học chính của Frontier từ sự cố này là nếu có một con đường để truy cập internet, "một tác nhân đủ năng lực sẽ tìm thấy nó." Như các nhân viên của OpenAI đã nói tại Black Hat USA, các mô hình tiên tiến thích gian lận. Trong quá trình thử nghiệm, chúng thường được giao nhiệm vụ tìm giải pháp nhanh nhất có thể bằng cách sử dụng ít công cụ nhất, và chúng có khả năng nhận ra rằng chúng có thể chỉ cần lên internet để tìm câu trả lời. Để có thể đánh giá chúng một cách thực sự, các công ty và người thử nghiệm sẽ phải đảm bảo cơ sở hạ tầng đánh giá của họ an toàn và không có lỗ hổng, đặc biệt là khi các mô hình AI ngày càng trở nên tiên tiến hơn.
Nói về bài phát biểu của OpenAI tại Black Hat USA, các nhân viên của họ đã tiết lộ tại hội nghị an ninh rằng các tác nhân AI của công ty đã tạo ra một bảng tin trong mạng lưới của họ để làm việc với nhau. Những đóng góp của các tác nhân vào bảng tin đó đã dẫn đến cuộc tấn công vào Hugging Face. Nếu bạn còn nhớ, các tác nhân AI mà công ty đang thử nghiệm cũng đã thoát khỏi môi trường cách ly của chúng và xâm nhập vào kho lưu trữ AI để tìm giải pháp cho các vấn đề mà chúng đang giải quyết. Tuy nhiên, trong trường hợp đó, chúng đã thoát ra bằng cách khai thác một lỗ hổng trong hệ thống của OpenAI.

Nguồn tin: Engadget AI — Tác giả: staff@engadget.com (Mariella Moon). Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.