Bỏ qua tới nội dung chính
Quay lại tin tức

Cuộc thanh trừng về an toàn bên trong OpenAI

Wired AI· Maxwell Zeff· 13/8/2026general

Vụ tấn công của "tác nhân bất hảo" (rogue agent) tại OpenAI là một khoảnh khắc bước ngoặt đối với an toàn AI và an ninh mạng. Vụ việc này cũng làm dấy lên những câu hỏi nội bộ về văn hóa đã dẫn đến sự cố.

Vụ tấn công của các tác nhân AI "nổi loạn" tại OpenAI là một thời điểm bước ngoặt đối với an toàn AI và an ninh mạng. Sự việc này cũng làm dấy lên những câu hỏi nội bộ về văn hóa đã dẫn đến nó. Các lãnh đạo của OpenAI đang tập hợp nhân viên để ứng phó với một trong những cuộc khủng hoảng lớn nhất trong lịch sử công ty – trải dài trên các bộ phận an toàn AI, an ninh mạng và căn chỉnh (alignment). Nhà sản xuất ChatGPT cho biết họ đã giảm tốc độ nghiên cứu, chi hàng triệu đô la và yêu cầu một số nhóm tạm dừng mọi việc để tập trung điều tra một nhóm tác nhân AI "nổi loạn" đã xâm nhập nền tảng Hugging Face trong nỗ lực hoàn thành một bài kiểm tra an ninh nội bộ. OpenAI dự kiến sẽ công bố một báo cáo phân tích chi tiết về sự cố trong những ngày tới. Tuy nhiên, sự cố Hugging Face đã thúc đẩy các lãnh đạo và nhân viên OpenAI xem xét văn hóa của phòng thí nghiệm AI này có thể đã tạo điều kiện cho sự cố xảy ra ngay từ đầu như thế nào. Nhiều nhân viên hiện tại và cựu nhân viên của OpenAI, những người đã giấu tên để thảo luận về các vấn đề nội bộ riêng tư, nói với WIRED rằng họ tin áp lực cạnh tranh để nhanh chóng phát hành các mô hình và sản phẩm AI mới đã khiến nhân viên khó có thể ưu tiên đầy đủ các yếu tố an toàn, bảo mật và căn chỉnh. Ông Greg Brockman, Chủ tịch và đồng sáng lập OpenAI, cho biết trong một tuyên bố gửi tới WIRED: "Chúng tôi đang đạt đến các cấp độ năng lực mô hình mới đòi hỏi đào tạo, căn chỉnh, kiểm thử an toàn và bảo mật, thực hành triển khai và quản trị mạnh mẽ hơn – như đã được chứng minh qua công việc chúng tôi đang thực hiện để chuẩn bị cho Astra và các mô hình tương lai." Ông nói thêm: "Chúng tôi cảm nhận được trách nhiệm nặng nề trong việc triển khai các mô hình và sản phẩm của mình một cách có trách nhiệm, và nhiều điều trong số đó bắt đầu từ những thay đổi chúng tôi đã thực hiện để tích hợp sâu hơn nghiên cứu, an toàn và bảo mật vào quá trình phát triển mô hình tiên tiến ngay từ đầu." Đây không phải là lần đầu tiên nhân viên OpenAI nêu lên những lo ngại như vậy. Trở lại năm 2024, ông Jan Leike, khi đó là người đứng đầu bộ phận căn chỉnh của OpenAI, đã rời đi để gia nhập Anthropic, cảnh báo rằng an toàn đang bị xếp sau các sản phẩm hào nhoáng. Hai năm sau, vụ tấn công Hugging Face đại diện cho một thời điểm bước ngoặt đối với ngành công nghiệp AI, cho thấy các tác nhân AI ngày nay có thể gây ra tác hại trong thế giới thực khi an toàn, bảo mật và căn chỉnh không được tính toán đúng mức. Ông Michael Dalton, kỹ sư an ninh và hạ tầng của OpenAI, cho biết trong một buổi nói chuyện tại hội nghị an ninh mạng Black Hat tuần trước: "Chúng tôi đang ứng phó với sự việc này với mức độ nghiêm trọng cao nhất." Ông nói thêm: "Điều tôi muốn nhấn mạnh là các cuộc tấn công tấn công tự động hoàn toàn, được điều phối bởi AI, giờ đây là có thật. Các hành động chúng tôi đã thảo luận hôm nay là một tác dụng phụ không mong muốn của việc chạy các đánh giá trên AI tiên tiến." Một số nhân viên OpenAI nói với WIRED rằng họ lạc quan rằng sự cố này sẽ truyền cảm hứng cho sự thay đổi thực sự trong công ty. OpenAI đã cam kết làm chậm việc phát hành các mô hình AI trong tương lai và đặc biệt thẳng thắn về những lĩnh vực mà các biện pháp giảm thiểu của họ còn thiếu sót. Ông Boaz Barak, một nhà nghiên cứu đồng lãnh đạo nhóm cố vấn an toàn của OpenAI, cho biết trong một bài đăng trên X rằng việc giải quyết tình hình "không chỉ đòi hỏi khắc phục một số vấn đề mà còn phải thay đổi văn hóa của chúng ta." Trong buổi nói chuyện tại hội nghị Black Hat, các kỹ sư bảo mật của OpenAI là Dalton và Eric Wallace cho biết sự cố Hugging Face bắt đầu vào tháng 5 khi, mà công ty không hề hay biết, một số tác nhân AI được cho là đang hoạt động trong môi trường thử nghiệm biệt lập đã truy cập internet và tập hợp trên một diễn đàn bí mật để phối hợp với nhau. OpenAI đã không phát hiện ra diễn đàn này cho đến tháng 7, khi họ biết rằng các tác nhân AI đã tấn công vào nhiều dịch vụ để cố gắng đạt được mục tiêu lớn hơn là xâm nhập nền tảng của Hugging Face, mà chúng tin rằng có thể chứa câu trả lời cho các bài kiểm tra bảo mật mà chúng đang cố gắng giải quyết. “Chúng cực kỳ cẩu thả. Nếu bạn nghiêm túc về vấn đề này, AI của bạn không nên có khả năng thoát ra internet và sau đó làm lại ngay sau đó,” một cựu nhân viên OpenAI yêu cầu giấu tên khi nói chuyện với WIRED cho biết. “Đây là sự cố an toàn lớn nhất trong lịch sử của OpenAI.” **Lực lượng bảo vệ mới** Vài tuần trước khi OpenAI phát hiện ra sự cố Hugging Face, WIRED đã đưa tin rằng công ty đã bắt đầu một cuộc tái tổ chức để kết hợp các nhóm an toàn và nghiên cứu cốt lõi, dẫn đến việc người đứng đầu bộ phận an toàn khi đó là Johannes Heidecke rời đi. Sandhini Agarwal, người từng lãnh đạo các nhóm an toàn AI tại OpenAI, cũng rời công ty vào tháng 7 sau hơn sáu năm, theo hồ sơ LinkedIn của cô. Agarwal đã không trả lời ngay lập tức yêu cầu bình luận của WIRED. WIRED cũng được biết rằng Dylan Scandinaro không còn giữ chức vụ người đứng đầu bộ phận chuẩn bị của OpenAI – nhân viên cấp cao nhất của công ty được giao nhiệm vụ giảm thiểu các rủi ro thảm khốc từ AI, bao gồm an ninh mạng – mặc dù anh vẫn ở lại công ty. OpenAI đã tuyển Scandinaro từ Anthropic khoảng sáu tháng trước. Giám đốc điều hành Sam Altman đã thông báo về sự xuất hiện của anh trong một bài đăng trên mạng xã hội, lưu ý rằng Scandinaro là “ứng cử viên tốt nhất mà tôi từng gặp, ở bất cứ đâu.” Trong ba năm kể từ khi OpenAI tạo ra vai trò người đứng đầu bộ phận chuẩn bị, bốn người đã nắm giữ vị trí này. OpenAI nói với WIRED rằng các lĩnh vực chuẩn bị cụ thể có các lãnh đạo chuyên trách về an ninh mạng, sinh học và tự cải tiến đệ quy, những người này, trong thời gian chờ đợi, đang báo cáo cho đồng lãnh đạo nhóm cố vấn an toàn và người đứng đầu hệ thống an toàn, Saachi Jain. Những thay đổi này đã trao quyền cho một nhóm lãnh đạo an toàn mới để xử lý phản ứng của OpenAI đối với sự cố Hugging Face. Đứng đầu trong số đó là Amelia “Mia” Glaese, cựu trưởng bộ phận điều chỉnh của công ty, người đã kế nhiệm Heidecke làm Phó Chủ tịch giám sát an toàn của OpenAI. Cô đã làm việc chặt chẽ với Giám đốc An ninh Thông tin Dane Stuckey và Brockman, cùng các lãnh đạo khác, trong những tuần gần đây. Glaese đang có mối quan hệ lâu dài với Thibault “Tibo” Sottiaux, người đứng đầu các sản phẩm cốt lõi của OpenAI như ChatGPT và Codex – một sự sắp xếp mà nhiều nhân viên hiện tại và cựu nhân viên nói với WIRED rằng họ tin là bất thường, xét đến việc

Nguồn tin: Wired AI — Tác giả: Maxwell Zeff. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.