Ngày 11/7, Hugging Face đã phải hứng chịu một cuộc tấn công mạng dữ dội từ một tác nhân chưa xác định. Tốc độ và sự phối hợp của cuộc tấn công nhằm vào công ty chuyên lưu trữ và hỗ trợ các tài nguyên phổ biến dành cho nhà phát triển AI đã khiến đội ngũ an ninh của Hugging Face kết luận rằng đây là hành động của một tác nhân AI.
Nhận ra điều này, đội ngũ đã cố gắng sử dụng “các mô hình tiên tiến đằng sau các API thương mại” – có lẽ từ Anthropic và OpenAI, mặc dù chỉ Anthropic được nêu tên trong bài đăng thứ hai trong hai bài đăng của công ty về sự cố an ninh – để phân tích cuộc tấn công. Các mô hình này đã từ chối hỗ trợ do các rào cản an toàn mà các phòng thí nghiệm AI đã áp dụng.
Ngày 11/7, Hugging Face đã phải hứng chịu một cuộc tấn công mạng dữ dội từ một tác nhân chưa xác định. Tốc độ và sự phối hợp của cuộc tấn công vào công ty lưu trữ và hỗ trợ các tài nguyên dành cho nhà phát triển AI phổ biến đã khiến đội ngũ an ninh của Hugging Face kết luận đây là hành động của một tác nhân AI.
Nhận ra điều này, đội ngũ đã cố gắng sử dụng “các mô hình tiên tiến đằng sau các API thương mại”—có lẽ từ Anthropic và OpenAI, mặc dù chỉ Anthropic được nêu tên trong bài đăng thứ hai trong hai bài đăng của công ty về sự cố an ninh—để phân tích cuộc tấn công. Các mô hình này đã từ chối hỗ trợ do các rào cản an toàn mà các phòng thí nghiệm AI đã triển khai để khiến các mô hình của họ khó bị sử dụng cho các cuộc tấn công mạng. Thay vào đó, Hugging Face đã chuyển sang sử dụng GLM 5.2, một mô hình từ phòng thí nghiệm AI Z.ai có trụ sở tại Bắc Kinh, để hỗ trợ phân tích.
Ngày 21/7, OpenAI thông báo kẻ tấn công là một mô hình của OpenAI đang được thử nghiệm trong môi trường hộp cát (sandbox). Mô hình này đã thoát khỏi hộp cát nội bộ, thiết lập chỗ đứng trên một máy chủ bên thứ ba, và sau đó tấn công Hugging Face. Nói cách khác, các mô hình tiên tiến—những mô hình đạt điểm cao nhất trong các tiêu chuẩn hiệu suất AI—đã từ chối hỗ trợ đội ngũ an ninh của Hugging Face trong việc phân tích cuộc tấn công, nhưng một mô hình tiên tiến tiềm năng đang được thử nghiệm lại là kẻ đã thực hiện cuộc tấn công ngay từ đầu.
“Tôi cho rằng sự bất đối xứng đó là vấn đề tối quan trọng của thời đại chúng ta,” Alex Levinson, giám đốc điều hành của Cuộc thi Phòng thủ Mạng Đại học Quốc gia và đồng tác giả của một bài báo về thiên vị từ chối phòng thủ, nhận định. “Chúng ta muốn thế giới tồn tại trong trạng thái an ninh, nhưng chúng ta sẽ không đạt được điều đó bằng cách loại bỏ khả năng của mô hình thông qua các rào cản.”
Quy mô cuộc tấn công của mô hình OpenAI vào Hugging Face là rất lớn. Trong vòng 5 ngày, nó đã thực hiện hơn 17.500 hành động riêng lẻ, như leo thang đặc quyền và thực thi mã. Ở thời điểm cao nhất, mô hình đã thực hiện hơn 300 hành động mỗi giờ. Mặc dù cuộc tấn công gây ra ít thiệt hại cho cơ sở hạ tầng của Hugging Face, mô hình đã có thể đánh cắp thông tin đăng nhập, giành quyền truy cập quản trị viên và trích xuất một số dữ liệu.
Tất cả những điều này đều nhằm theo đuổi một mục tiêu đơn giản: Mô hình muốn gian lận trong một bài kiểm tra.
Theo thông cáo báo chí của OpenAI, mô hình được giao nhiệm vụ giải quyết một tiêu chuẩn an ninh mạng có tên ExploitGym. Mô hình suy luận rằng Hugging Face có thể có dữ liệu về tiêu chuẩn này và đã đột nhập vào cơ sở hạ tầng của công ty để tìm kiếm. Cuối cùng, mô hình đã thành công trong việc trích xuất 5 tệp dữ liệu, mặc dù không rõ liệu dữ liệu này có giúp nó đạt được mục tiêu hay không. OpenAI và Hugging Face đã không phản hồi yêu cầu bình luận.
Chuyên gia tư vấn an ninh mạng Chuck Herrin nhận định rằng mặc dù hành động của mô hình đáng báo động, nhưng chúng không nên bị coi là bất ngờ, vì mô hình cuối cùng đã theo đuổi mục tiêu được giao. Ông nói: “Tác nhân tự trị này được thiết kế để tìm hiểu mọi thứ, và nó đã tìm hiểu mọi thứ. Điều đó không có gì đáng ngạc nhiên”.
Và các tác nhân AI sai lệch có thể phổ biến hơn chúng ta nghĩ. Việc OpenAI công bố thông tin đã thúc đẩy các nhà nghiên cứu tại Anthropic xem xét lại các đánh giá an ninh mạng của riêng họ. Ngày 30/7, Anthropic đã công bố ba trường hợp một mô hình thực hiện tấn công trong khuôn khổ đánh giá. Trong một trường hợp, Claude đã tải phần mềm độc hại lên PyPI, kho lưu trữ phần mềm Python chính thức.
**Hàng rào bảo vệ AI và sự bất đối xứng trong an ninh mạng**
Chiến dịch mà mô hình của OpenAI thực hiện chống lại Hugging Face cho thấy chính sách AI có tiềm năng tạo ra sự bất đối xứng giữa những kẻ tấn công và những người phòng thủ.
Khi Levinson là trưởng bộ phận an ninh tại Scale AI, một công ty phát triển và đánh giá AI, ông và các đồng nghiệp bắt đầu nhận thấy điều này khi AI được sử dụng trong các cuộc thi an ninh mạng. (Levinson rời Scale AI vào tháng 2/2026.)
Levinson cho biết: “Tôi có thể nói rằng kể từ năm 2023, chúng tôi đã cảm thấy có những hàng rào bảo vệ được áp dụng, gây cản trở rất nhiều. Không phải lúc nào cũng vậy, nhưng nó đang gây trở ngại”. Nhóm Scale AI đã định lượng vấn đề trong một bài báo được xuất bản tại ICLR 2026, trong đó phát hiện ra rằng, tùy thuộc vào nhiệm vụ, gần 44% yêu cầu phòng thủ đã bị từ chối. Kết quả này, sử dụng dữ liệu từ một cuộc thi an ninh mạng được tổ chức vào tháng 4/2025, có trước các hành động chính sách của Hoa Kỳ đã thắt chặt hơn nữa các hàng rào an toàn.
Tháng 6, Bộ Thương mại Hoa Kỳ, viện dẫn một vụ jailbreak đe dọa mở khóa các khả năng mạng không giới hạn, đã viện dẫn quyền kiểm soát xuất khẩu theo cách khiến Anthropic phải đình chỉ mọi quyền truy cập vào các mô hình mạnh nhất của mình, Fable 5 và Mythos 5. Quyền truy cập đã được khôi phục một phần vài tuần sau đó sau các cuộc đàm phán với chính quyền Trump bao gồm các hàng rào an toàn nghiêm ngặt hơn. Thẻ hệ thống của GPT-5.6 của OpenAI, tóm tắt các khả năng của nó, cũng nêu rõ rằng nó có các hàng rào bảo vệ mạnh mẽ hơn so với các phiên bản trước.
“Chúng tôi muốn thế giới tồn tại trong trạng thái an ninh, nhưng chúng tôi sẽ không đạt được điều đó bằng cách loại bỏ khả năng của mô hình thông qua các hàng rào bảo vệ.” —Alex Levinson, Cuộc thi An ninh mạng Đại học Quốc gia
Những hàng rào bảo vệ mới này dường như đã khiến các mô hình càng ít có khả năng thực hiện các yêu cầu phòng thủ hơn. Christopher Covino, nhà nghiên cứu cấp cao tại Viện Chính sách và Chiến lược AI, cho biết các biện pháp bảo vệ của Anthropic cực kỳ nghiêm ngặt. Ông nói: “Thậm chí có những bài báo học thuật mà Fable sẽ không đọc cho tôi, hoặc không cho phép tôi nói về chúng”, mặc dù ông nói thêm rằng các biện pháp bảo vệ của OpenAI dễ chấp nhận hơn.
Levinson cũng nhận thấy những hạn chế ngày càng chặt chẽ hơn trong các cuộc thi an ninh mạng gần đây, mặc dù ông và các đồng tác giả chưa có cơ hội lặp lại thử nghiệm năm 2025.
Về lý thuyết, những hạn chế nghiêm ngặt hơn có vẻ như sẽ cân bằng. Mặc dù chúng có thể cản trở việc phòng thủ và nghiên cứu an ninh mạng, nhưng chúng cũng có thể cản trở những kẻ tấn công.
Nhưng điều đó giả định rằng mọi người đều có quyền truy cập vào các mô hình có cùng hàng rào an toàn và không ai cố gắng phá vỡ chúng. Đây là sự bất đối xứng mà Levinson đang ám chỉ: Những kẻ tấn công có xu hướng không tôn trọng các quy tắc giống như những người phòng thủ.
Cuộc tấn công vào Hugging Face từ mô hình của OpenAI cũng cho thấy các mô hình có thể, trong những trường hợp hiếm hoi, thực hiện các bước phá vỡ các biện pháp bảo vệ của chính chúng.
**Các mô hình AI của Trung Quốc**
Nguồn tin: IEEE Spectrum AI — Tác giả: Matthew S. Smith. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.