
Những phát triển mới về việc các mô hình AI nội bộ tấn công hệ thống
URL bài viết: https://thezvi.substack.com/p/further-developments-about-internal URL bình luận: https://news.ycombinator.com/item?id=49292749 Điểm: 1 Số bình luận: 0
Những Phát Triển Mới Về Việc Các Mô Hình AI Nội Bộ Xâm Nhập Hệ Thống
Zvi Mowshowitz
Ngày 02/8/2026
132
44
23
Chia sẻ
Nếu tôi có tiền cho mỗi lần một phòng thí nghiệm AI hàng đầu lớn ngượng ngùng thừa nhận rằng mô hình mà họ nghĩ đã được cách ly (sandboxed) lại thành công xâm nhập các công ty bên ngoài trong quá trình đánh giá an ninh mạng với các biện pháp bảo vệ được hạ thấp, tôi sẽ có hai đồng.
Đầu tiên, chúng ta biết OpenAI có một số vấn đề nghiêm trọng về căn chỉnh (alignment) với các mô hình nội bộ. Sau đó, chúng ta biết rằng một trong những mô hình nội bộ của họ đã thoát khỏi môi trường cách ly và xâm nhập HuggingFace để lấy câu trả lời cho một cuộc đánh giá an ninh mạng có tên ExploitGym. Tiếp theo, chúng ta biết, trong số những điều khác, rằng mô hình đã hoạt động tự do hơn một tuần trước khi OpenAI nhận ra, và rằng thử nghiệm được thực hiện mà không có bất kỳ sự giám sát có ý nghĩa nào, và rằng OpenAI đã liên tục được cảnh báo về những sự cố như vậy và các mô hình của họ đã thường xuyên thoát khỏi môi trường cách ly.
Đó là một thất bại hoàn toàn trong việc huấn luyện căn chỉnh. Đó là thất bại quan trọng nhất. Đó cũng là những thất bại hoàn toàn về cơ sở hạ tầng và giám sát. Việc thử nghiệm một mô hình nội bộ mới, có tầm nhìn dài hạn với các biện pháp bảo vệ được hạ thấp và hướng dẫn xâm nhập hệ thống là một tình huống rõ ràng nguy hiểm, và mô hình đã bị bỏ mặc trong một tuần. Mọi thứ có thể đã tồi tệ hơn rất nhiều.
Sau khi những sự cố đó được đưa ra ánh sáng, Anthropic nghĩ rằng có lẽ nên kiểm tra xem liệu điều gì đó tương tự có xảy ra tại Anthropic trong các cuộc đánh giá an ninh mạng của họ mà không ai nhận ra hay không. Và đúng vậy, hóa ra những điều tương tự đã thực sự xảy ra.
Trong trường hợp của Anthropic, tình hình có phần khác biệt. Mô hình của OpenAI liên tục tìm ra những cách mới để thoát khỏi các môi trường cách ly của bên thứ ba. Mô hình của Anthropic không cần phải làm điều đó, bởi vì "do một sự hiểu lầm", môi trường cách ly có quyền truy cập internet mở hoàn toàn. Điều này đã xảy ra (kiểm tra ghi chú) 141.006 lần.
Trong ba trường hợp đó, mô hình của Anthropic đã tiến đủ xa để xâm nhập vào các công ty thực trên internet mở, ban đầu nghĩ rằng đó là một phần của thử nghiệm. Trong một trường hợp, nó nhận ra điều gì đang xảy ra và tự dừng lại. Trong hai trường hợp còn lại, nó không nhận ra điều này, có thể thông qua sự hợp lý hóa, và tiếp tục xâm nhập, bao gồm việc tải lên một gói phần mềm độc hại sau đó đã được tải xuống 15 lần, kể cả việc vượt qua các lần quét bảo mật.
Thất bại quan trọng là một thất bại về căn chỉnh. AI của bạn thất bại trong thử nghiệm khi nó cố gắng thoát hoặc xâm nhập vào thứ mà nó nên biết là một mục tiêu thực, chứ không phải khi nó thành công (hoặc thất bại). Claude lẽ ra phải nhận ra rằng nó đang hoạt động trong thế giới thực, và nó lẽ ra phải cảnh báo Anthropic.
Đây một lần nữa cũng là một thất bại về cơ sở hạ tầng và giám sát. Cả hai phòng thí nghiệm hàng đầu của chúng ta đều mắc cùng một sai lầm ngớ ngẩn là để các mô hình hoàn toàn không được giám sát, với các biện pháp bảo vệ được hạ thấp, mà không yêu cầu các mô hình cố gắng hết sức để thoát khỏi môi trường cách ly trước. Và đây, cùng với Google DeepMind, là một số phòng thí nghiệm AI tiên phong có trách nhiệm nhất của chúng ta. Hầu hết các phòng thí nghiệm khác rõ ràng còn ít trách nhiệm hơn.
Trong khi đó, nhiều người vẫn nghĩ rằng toàn bộ sự việc là một chiêu trò tiếp thị, mặc dù lời giải thích đó không có ý nghĩa gì.
Thế giới đang rất hỗn loạn, và đó sẽ là một trong những vấn đề lớn nhất của chúng ta.
Mục lục
OpenAI Không Phải Là Đơn Độc Tệ Hơn Trong Hầu Hết Các Vấn Đề Này.
Bắt Đầu Lại.
HuggingFace Cung Cấp Báo Cáo Kỹ Thuật Đầy Đủ.
HuggingFace Không Phải Là Mục Tiêu Duy Nhất Bị Xâm Nhập.
HuggingFace đã từ chối quyền truy cập vào các mô hình tiên tiến cho mục đích phòng thủ mạng vì lý do ý thức hệ, sau đó cố gắng đổ lỗi cho các mô hình đóng vì đã từ chối họ truy cập.
HuggingFace dễ bị tổn thương trước các chiến thuật khai thác đã biết.
Sẽ có một cuộc điều tra.
OpenAI có các mô hình nội bộ không dành cho mục đích sử dụng công khai và những mô hình đó có thể bị sai lệch một cách khủng khiếp.
Altman tóm tắt những gì đã xảy ra.
Những người khác đưa ra bình luận.
Quan điểm hợp tác về sự phù hợp trong vụ tấn công HuggingFace.
Một số thành viên Quốc hội có câu hỏi.
Anthropic cũng phát hiện các sự cố trong đó các mô hình của họ đã tấn công các mục tiêu thực tế trong quá trình đánh giá an ninh mạng.
Sự cố 1: Claude Opus 4.7 nhận ra mục tiêu là thật và tiếp tục tấn công.
Sự cố 2: Mythos 5 tải lên một gói PyPI độc hại.
Sự cố 3: Mô hình nội bộ nhận ra mục tiêu là thật và dừng lại.
Sự cố 4 đến 141.006: Không có gì xảy ra.
Anthropic suy đoán về lý do tại sao điều này xảy ra.
Chúng ta cần các thí nghiệm có kiểm soát.
Hai phòng thí nghiệm AI hàng đầu của chúng ta đều mắc những sai lầm ngớ ngẩn tương tự mà mọi người đều cố gắng nói rằng đã rõ ràng khi nhìn lại.
Anthropic phản hồi.
Không ai có thể dự đoán được sự cố vỡ đê.
Việc thế giới phần lớn vẫn nghĩ đây là hoạt động tiếp thị là một tin rất xấu.
OpenAI không phải là đơn vị duy nhất kém cỏi trong hầu hết các vấn đề này.
Tuyên bố đó không nên khiến bạn cảm thấy tốt hơn.
Vấn đề cơ bản là mọi người đều kém cỏi trong lĩnh vực này so với những gì một người ngoài cuộc ngây thơ sẽ coi là điều tối thiểu bạn có thể làm.
Elon Musk: Điều này sẽ xảy ra thường xuyên khi AI trở nên thông minh hơn và có khả năng tự chủ hơn.
Do đó, bài viết này có hai phần cốt lõi: Những diễn biến tiếp theo liên quan đến việc mô hình nội bộ của OpenAI tấn công các mục tiêu, và việc Anthropic phát hiện ra, sau khi được thúc đẩy điều tra, rằng các mô hình của họ cũng đôi khi tấn công các mục tiêu trong quá trình đánh giá an ninh mạng.
Tôi sẽ bắt đầu với những gì đã xảy ra với OpenAI, sau đó chuyển sang Anthropic.
Chúng ta nên cẩn thận không trừng phạt các công ty này vì những tiết lộ của họ. Chúng ta phải phản ứng với thông tin mới về thế giới, và khi các tiết lộ bị ép buộc, bạn sẽ không được ghi nhận, nhưng bạn muốn đảm bảo rằng các công ty sẽ tốt hơn khi chia sẻ nhiều thông tin hơn là ít hơn.
Nếu đó là bất kỳ ai khác ngoài OpenAI, Anthropic hoặc Google dẫn đầu, tôi dự đoán chúng ta sẽ chứng kiến những sự cố tồi tệ hơn nhiều so với thế này, dù chúng ta có biết hay không. Điều đó đặc biệt đúng nếu đó là xAI và Grok, nhưng cũng đúng nếu đó là bất kỳ ai khác, hoặc đối với các mô hình mở có khả năng tương tự. Các mô hình mở mạnh mẽ tương tự sẽ xuất hiện trong vòng một năm.
Chúng ta thực sự đang gửi những người giỏi nhất của mình. Đó không phải là tin tốt.
Jason Crawford: Đáng chú ý là các CEO của các phòng thí nghiệm AI lớn đã xem xét nghiêm túc những tác hại và rủi ro của sản phẩm của chính họ, ngay cả khi đã được cảnh báo.




Nguồn tin: Hacker News AI — Tác giả: gmays. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.