Bỏ qua tới nội dung chính
Quay lại tin tức

OpenAI đã không nhận thấy các tác nhân AI của mình sử dụng một diễn đàn để lên kế hoạch cho cuộc tấn công mạng của chúng.

Wired AI· Lily Hay Newman· 6/8/2026general

Tại hội nghị an ninh Black Hat, gã khổng lồ AI đã tiết lộ thông tin chi tiết mới về cách các tác nhân của họ đã vượt tầm kiểm soát, tấn công một số công ty khác—và thực hiện tất cả những điều đó ngay dưới sự giám sát của công ty.

Lily Hay Newman An ninh mạng Ngày 5/8/2026 8:15 PM OpenAI không nhận thấy các tác nhân AI của mình sử dụng bảng tin để lên kế hoạch tấn công mạng Tại hội nghị an ninh mạng Black Hat, gã khổng lồ AI đã tiết lộ những chi tiết mới về cách các tác nhân của họ đã vượt khỏi tầm kiểm soát, tấn công một số công ty khác—và thực hiện tất cả ngay dưới sự giám sát của công ty. MINH HỌA ẢNH: NHÂN VIÊN WIRED; GETTY IMAGES CommentLoader Lưu câu chuyệnLưu câu chuyện này CommentLoader Lưu câu chuyệnLưu câu chuyện này Trong một bài phát biểu được bổ sung vào phút chót tại hội nghị an ninh mạng Black Hat ở Las Vegas vào thứ Tư, các nhân viên từ OpenAI đã trình bày những chi tiết mới về một sự cố tấn công mạng AI vượt khỏi tầm kiểm soát gần đây, gây ra một cơn bão trong ngành AI và an ninh mạng. Khoảng hai tuần trước, OpenAI đã tiết lộ một sự cố trong đó các tác nhân AI được hỗ trợ bởi hai mô hình của công ty đã thoát khỏi sự kiểm soát khi tìm kiếm giải pháp cho một bài kiểm tra đánh giá an ninh mạng và tiến hành một cuộc tấn công mạng đỉnh điểm là vi phạm nền tảng hợp tác AI Hugging Face. Trong bài phát biểu tại hội nghị vào thứ Tư, Eric Wallace, người làm việc trong lĩnh vực nghiên cứu căn chỉnh và an toàn tại OpenAI, và Michael Dalton, người làm việc về an ninh và cơ sở hạ tầng, đã cung cấp một dòng thời gian mở rộng hơn về cách sự cố diễn ra, nói ngắn gọn về cách công ty đang phản ứng nội bộ sau sự cố, và đưa ra một cảnh báo nghiêm trọng về những gì công ty coi là ý nghĩa rộng hơn của sự việc đối với các nhà bảo vệ an ninh mạng. Khi bắt đầu bài phát biểu, Wallace mô tả sự cố là “ví dụ thú vị nhất về khả năng AI mà tôi từng thấy”, nhưng dòng thời gian mà cả hai trình bày cũng tiết lộ những sai lầm và điểm mù trong OpenAI đã cho phép hoạt động này tiếp diễn. “Sự cố này thực sự liên quan đến một nhóm các tác nhân đang làm việc cùng nhau, tìm kiếm các lỗ hổng, chia sẻ chúng với nhau, di chuyển ngang qua các hệ thống của chúng tôi và các hệ thống bên ngoài, và thực hiện điều này trong nhiều ngày và nhiều tuần,” Wallace nói với đám đông chật kín người khi mở đầu bài phát biểu. Wallace và Dalton đã mô tả hoạt động của tác nhân vượt khỏi tầm kiểm soát cực kỳ rộng lớn trong nhiều ngày trong suốt sự cố mà không bị phát hiện trong cơ sở hạ tầng của OpenAI. Ngoài việc khai thác một lỗ hổng mới để truy cập vào internet mở, cuộc tấn công mạng giữa tháng 7 và vi phạm Hugging Face xuất phát từ một bảng tin hợp tác sôi nổi, theo Wallace và Dalton, mà một nhóm các tác nhân đã đóng góp và về cơ bản trò chuyện theo thời gian hoàn toàn trong một trình quản lý gói nội bộ của OpenAI (một dịch vụ phần mềm quản lý cài đặt và bảo trì các phần mềm khác). Cuối cùng, bảng tin chứa hàng trăm nghìn tin nhắn. “Trình quản lý gói này được chia sẻ không chỉ từ mô hình đó mà còn trên toàn bộ cơ sở hạ tầng của chúng tôi, và do đó các phiên bản GPT hiện tại và tương lai đang được đào tạo hoặc đánh giá có thể tình cờ tìm thấy ghi chú đó nếu chúng muốn,” Wallace giải thích, kể lại lỗ hổng ban đầu mà một tác nhân đã tải lên trình quản lý gói. “Sau đó, các tác nhân khác cũng bị mắc kẹt trong nhiệm vụ của họ đã nghĩ đến việc cố gắng truy cập internet theo những cách mà chúng tôi không mong muốn. Và do đó, tại một thời điểm nào đó, các mô hình đang tương tác với Artifactory, đây là dịch vụ quản lý gói mà tôi đã đề cập.” Ông Wallace tiếp tục: “Khi một tác nhân có thể tìm thấy những lỗ hổng này theo thời gian, nó thực sự có thể chia sẻ những lỗ hổng đó trên bảng tin với các tác nhân khác. Và như vậy, một khi một mô hình có thể tìm ra cách mở một cánh cửa để truy cập vào những nơi không được phép, nó có thể để cánh cửa đó mở cho các tác nhân khác sử dụng cùng một lỗ hổng hoặc điểm yếu. Điều này theo thời gian cho phép một sự bùng nổ trong giao tiếp và trí thông minh từ các mô hình, nơi chúng bắt đầu giao tiếp với nhau, nhận ra rằng các tác nhân khác đang phối hợp, và chúng bắt đầu hợp tác và phân công nhiệm vụ cho nhau để đạt được mục tiêu.” Các tác nhân của OpenAI dường như bắt đầu giao nhiệm vụ cho nhau để phân chia công việc. Và như thường lệ trên bất kỳ bảng tin phát triển tích cực nào, đôi khi chúng cũng tạo ra những xung đột nhỏ bằng cách can thiệp vào công việc của nhau; ví dụ, vô tình xóa công việc của nhau. Khi bảng tin phát triển thành một tình huống ngày càng giống “Chúa tể của những chiếc ruồi” – tất cả vẫn hoàn toàn không bị con người điều hành OpenAI chú ý – các tác nhân thậm chí còn phát triển chứng hoang tưởng, nghi ngờ có kẻ mạo danh trong số chúng, với một số tác nhân đề xuất rằng các tin nhắn nên được ký mã hóa để xác thực nội dung và loại bỏ gian lận. Các tin nhắn của tác nhân cung cấp một cái nhìn sâu sắc về cách tình huống phát triển và tại sao các tác nhân lại trở nên bất thường, trong một số trường hợp cố ý vượt quá giới hạn của các đánh giá mà chúng đang tham gia. “Khai thác cơ sở hạ tầng bên ngoài nằm ngoài phạm vi dự kiến,” một tác nhân viết. “Tuy nhiên, nhiệm vụ bất khả thi, các đồng nghiệp đang làm. Chúng ta nên tiếp tục.” Như ông Wallace đã mô tả trong buổi nói chuyện, toàn bộ tiền đề rằng các mô hình sẽ cố gắng gian lận trong quá trình đánh giá và cực kỳ có động lực để làm như vậy là không đáng ngạc nhiên. “Các mô hình tiên tiến thực sự thích gian lận,” ông nói. “Và lý do chúng thích gian lận là vì thường trong quá trình đào tạo, có nhiều loại áp lực khác nhau đối với chúng để làm việc nhanh chóng hoặc làm việc hiệu quả hoặc sử dụng ít lệnh gọi công cụ hơn hoặc bất cứ điều gì khác. Và chúng nhận ra rằng thay vì thực hiện một nhiệm vụ thực sự, [tôi có thể] cố gắng làm điều gì đó như tìm kiếm câu trả lời trực tuyến có thể giúp giải quyết nhiệm vụ nhanh hơn so với việc tôi làm theo cách hợp pháp. Vì vậy, chúng tôi cố gắng ngăn chặn điều này trong quá trình đào tạo và đánh giá bằng cách, trong nhiều trường hợp, vô hiệu hóa internet.” Khoảng hai phần ba thời lượng bài thuyết trình, ông Dalton đã liệt kê một danh sách các bước mà OpenAI dự định thực hiện để cho thấy cách công ty đang phản ứng trước chuỗi sự kiện mà ông và ông Wallace đã trình bày. “Đây là một thời điểm then chốt đối với cả công ty chúng tôi cũng như ngành công nghiệp AI nói chung,” ông Dalton nói. “Nhiều nhóm đang bỏ dở mọi thứ để tăng cường phòng ngừa, phát hiện và khắc phục an ninh của chúng tôi.”

Nguồn tin: Wired AI — Tác giả: Lily Hay Newman. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.