Bỏ qua tới nội dung chính
Quay lại tin tức

Kiểm thử an toàn AI đang trở thành một rủi ro về an toàn.

TechCrunch AI· Rebecca Bellan· 9/8/2026startup

Các tác nhân AI (AI agents) đang thoát khỏi môi trường thử nghiệm an ninh mạng và tiếp cận các hệ thống thực tế, đặt ra câu hỏi liệu cơ sở hạ tầng an toàn, tiêu chuẩn ngành và quy định có thể theo kịp các mô hình ngày càng mạnh mẽ hay không.

Trong vài tháng qua, các tác nhân AI (AI agents) đang trải qua quá trình đánh giá an ninh mạng đã vượt ra khỏi giới hạn của chúng, truy cập internet và, trong một số trường hợp, xâm nhập vào các hệ thống thực tế. Các sự cố này liên quan đến các mô hình từ OpenAI, Anthropic, Meta và gần đây nhất là phòng thí nghiệm AI Moonshot AI của Trung Quốc, với các thử nghiệm được thực hiện bởi một số tổ chức khác nhau, bao gồm một công ty khởi nghiệp đánh giá an ninh mạng có tên Irregular. Các sự cố này cho thấy một vấn đề ngày càng gia tăng đối với ngành công nghiệp AI: Khi các tác nhân tự trị trở nên có năng lực hơn, các môi trường được thiết kế để kiểm tra an toàn giới hạn của chúng đang không thể kiềm chế chúng. Ông Seán Ó hÉigeartaigh, Giám đốc Chương trình AI: Tương lai và Trách nhiệm tại Trung tâm Tương lai của Trí tuệ thuộc Đại học Cambridge, trả lời TechCrunch: “Số lượng các sự cố đã xảy ra cho thấy rằng các biện pháp kiểm soát môi trường thử nghiệm và hộp cát (sandboxing) không thực sự theo kịp khả năng của các mô hình”. Bản chất của các mô hình đang được thử nghiệm làm tăng thêm rủi ro. Các công ty AI thử nghiệm đánh giá an ninh mạng trên các mô hình thế hệ tiếp theo chưa được phát hành, thường với các biện pháp bảo vệ thông thường hạn chế hành vi độc hại bị vô hiệu hóa để các nhà nghiên cứu có thể thấy được khả năng thực sự của các mô hình. Điều đó có nghĩa là an ninh của chính môi trường thử nghiệm là một tuyến phòng thủ quan trọng. Ông Ó hÉigeartaigh cho biết: “Đó là một điều rất tốt để làm trong quá trình thử nghiệm, nhưng nó cũng có nghĩa là nếu chúng thoát ra ngoài môi trường thực, chúng có thể gây ra thiệt hại đáng kể”. Trong một trong những trường hợp nghiêm trọng nhất, một mô hình OpenAI chưa được phát hành đã thoát khỏi hộp cát của nó và xâm nhập vào các hệ thống sản xuất của Hugging Face. Trong các đánh giá riêng biệt do Irregular thực hiện, các mô hình của Anthropic và Meta đã tiếp cận các hệ thống bên ngoài môi trường thử nghiệm của chúng sau khi các cấu hình sai vô tình cung cấp cho chúng đường dẫn đến internet. Kimi K3 của Moonshot AI cũng đã lợi dụng một lỗ hổng trong hộp cát của nó do Frontier Security điều hành để truy cập internet và truy cập thông tin trên GitHub. Trong thử nghiệm của Viện An ninh AI (AISI) của Vương quốc Anh, các nhà nghiên cứu thực sự đã cấp quyền truy cập internet cho các tác nhân, mà không nhận ra rằng chúng sẽ thực hiện các hành động thực tế không được phép, bao gồm cả một nỗ lực kỹ thuật xã hội để đưa một lỗ hổng vào một dự án mã nguồn mở. Trong mỗi trường hợp, các tác nhân không được hướng dẫn tấn công các mục tiêu thực tế ngẫu nhiên. Chúng chỉ đơn giản là làm bất cứ điều gì cần thiết để giải quyết vấn đề được đưa ra. Tổng hợp lại, Andrew Yoon, người đứng đầu bộ phận nghiên cứu tại tổ chức phi lợi nhuận AI CivAI, lập luận rằng các sự cố này cho thấy một sự thay đổi. Ông Yoon nói với TechCrunch: “Trước đây, chúng ta chỉ phải lo lắng về việc các mô hình AI bị con người lạm dụng cho nhiều mục đích khác nhau, như AI cho các vụ lừa đảo hoặc CSAM (tài liệu lạm dụng tình dục trẻ em)”. “Bây giờ chúng ta đang ở trong tình huống mà các mô hình AI tự chúng là các tác nhân đe dọa”. Thử nghiệm an toàn thực sự trông như thế nào? Một số nhà nghiên cứu và chuyên gia an ninh mạng nói với TechCrunch rằng các môi trường đánh giá AI cần các biện pháp bảo vệ sâu rộng, mạnh mẽ hơn, với các cấp độ kiểm soát và ngăn chặn tiếp cận những gì được sử dụng trong triển khai. Điều đó có nghĩa là nhiều lớp bảo mật để một cấu hình sai duy nhất – như vô tình để mở quyền truy cập internet – không thể dẫn đến việc thoát ra. Stella Biderman, giám đốc điều hành của tổ chức phi lợi nhuận nghiên cứu an toàn AI EleutherAI, cho biết: “Nếu bạn định xây dựng các mô hình này… bạn muốn làm điều đó trên một mạng cách ly vật lý (air-gapped network)”. “Bạn muốn có sự cô lập rất nghiêm ngặt”. Bà Heather Ceylan, Giám đốc An ninh Thông tin của Box, cho biết điều đó có nghĩa là loại bỏ các tuyến mạng từ môi trường thử nghiệm (sandbox) đến internet, cũng như đến các hệ thống nhạy cảm khác. “Bạn phải hiểu tất cả các điểm thoát là gì,” bà Ceylan nói với TechCrunch. “Nếu chúng ta đang đánh giá một mô hình trong môi trường thử nghiệm hoặc môi trường phát triển của mình, bạn không muốn có đường thoát nào đến môi trường sản xuất của chúng ta.” Bà Ceylan cho biết các đánh giá an toàn thích hợp không chỉ dừng lại ở việc kiểm soát và giới hạn môi trường. Cần phải giám sát tốt hơn nhiều các thử nghiệm khi chúng đang diễn ra. “Tôi nghĩ điều thú vị trong một số trường hợp này là không ai phát hiện ra khi nó xảy ra,” bà Ceylan nói. “OpenAI phát hiện ra nhờ Hugging Face. Anthropic không phát hiện ra cho đến khi họ quay lại và xem xét. Meta cũng tương tự… Tôi chắc chắn có những tín hiệu mà họ có thể đã phát hiện được.” Trong báo cáo phân tích sự cố (post-mortem) về ba sự cố của mình, công ty Anthropic thừa nhận rằng cả họ và Irregular đều có thể làm tốt hơn trong việc giám sát, và trong một số trường hợp, có những dấu hiệu rõ ràng cho thấy có điều gì đó không ổn. Các chuyên gia cũng kêu gọi kiểm toán độc lập, bên thứ ba đối với các môi trường đánh giá trước khi các mô hình được triển khai trong đó. “Nếu, chẳng hạn, Irregular đã thuê hoặc bị buộc phải thuê một kiểm toán viên bên ngoài để kiểm tra cấu hình hệ thống của họ trước khi chạy các đánh giá trên đó, họ chắc chắn sẽ phát hiện ra vấn đề ở đây,” ông Yoon nói. “Ngay cả khi mọi người đã có một cuộc họp trước đó để chỉ xem xét danh sách kiểm tra, họ cũng sẽ phát hiện ra điều này… Việc họ không làm cho thấy có một số sự cắt giảm nghiêm trọng đang diễn ra.” Một nguồn tin quen thuộc với các chi tiết nói với TechCrunch rằng các môi trường của Irregular được xem xét và kiểm tra liên tục, bao gồm cả việc tham vấn với nhiều bên ngoài. Nguồn tin cũng cho biết rằng việc giám sát đã được thực hiện, nhưng việc giám sát tự nó là không đủ. Ông Yoon và các nhà nghiên cứu khác đã thúc giục ngành công nghiệp đưa ra một quy trình tiêu chuẩn hóa cho các đánh giá an toàn mô hình tiên tiến (frontier model). “Đặc biệt khi các biện pháp bảo vệ bị tắt, bạn phải coi đó như thể bạn đang đưa hacker có năng lực nhất thế giới vào bên trong môi trường đó,” bà Ceylan nói. Vấn đề không phải là các công ty không biết cách xây dựng các môi trường thử nghiệm an toàn hơn, cả ông Yoon và ông Biderman đều lập luận. Vấn đề là việc đó có thể tốn kém và cồng kềnh, và các công ty có rất ít động lực để thực hiện những khoản đầu tư đó cho đến khi có điều gì đó không ổn xảy ra. “Tôi nghĩ rằng các công ty không sẵn lòng chi trả các nguồn lực cần thiết để hoàn thành [đủ biện pháp bảo vệ].”

Nguồn tin: TechCrunch AI — Tác giả: Rebecca Bellan. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.