
OpenAI đại tu các giao thức an toàn sau khi các tác nhân AI của nó bị lừa đảo
Nhà sản xuất ChatGPT cho biết mẫu Astra sắp ra mắt của họ có thể đã đạt đến khả năng mạng “quan trọng”, khiến họ phải tạm dừng một số lượng đáng kể các hoạt động đào tạo trong khi thắt chặt các biện pháp bảo vệ nội bộ.
Maxwell Zeff
Kinh doanh
Ngày 18 tháng 8 năm 2026 2:33 chiều
OpenAI đại tu các giao thức an toàn sau khi các tác nhân AI của nó bị lừa đảo
Nhà sản xuất ChatGPT cho biết mẫu Astra sắp ra mắt của họ có thể đã đạt đến khả năng mạng “quan trọng”, khiến họ phải tạm dừng một số lượng đáng kể các hoạt động đào tạo trong khi thắt chặt các biện pháp bảo vệ nội bộ.
Ảnh minh họa: Nhân viên WIRED; Hình ảnh Getty
Trình tải bình luận
Lưu câu chuyệnLưu câu chuyện này
Trình tải bình luận
Lưu câu chuyệnLưu câu chuyện này
OpenAI công bố hôm thứ Ba rằng họ đã tạm dừng “một số lượng đáng kể” khối lượng đào tạo và đánh giá cho mô hình trí tuệ nhân tạo biên giới sắp ra mắt của mình — có tên mã là Astra — trong khi thực hiện các quy trình mới nhằm giải quyết các rủi ro an ninh mạng. Nhà sản xuất ChatGPT cho biết họ đang đưa ra một số yêu cầu giám sát, bảo mật và căn chỉnh mới để giải quyết tốt hơn khả năng hack ngày càng tiên tiến của các mô hình AI hàng đầu của mình.
Amelia Glaese, phó chủ tịch nghiên cứu và an toàn của OpenAI, cho biết trong một cuộc họp ngắn với các phóng viên hôm thứ Ba: "Chúng tôi phải tập trung sức lực để đưa các khóa đào tạo này đáp ứng được những yêu cầu và mong đợi đó. Chỉ cần đạt được điều đó, đó là khoảng thời gian mọi người không thể tiếp tục khối lượng công việc của mình".
Trong số các biện pháp bảo vệ mới mà OpenAI công bố là một hệ thống mạnh mẽ hơn để giám sát các mô hình AI của mình. Một trong những biện pháp kiểm soát mà nó triển khai bao gồm giám sát chuỗi suy nghĩ, một kỹ thuật trong đó các bộ phân loại xem xét các quá trình “tư duy” nội bộ do các mô hình lý luận AI tạo ra. Công ty cho biết hệ thống cập nhật dựa trên các “điều tra viên tự động” đắt tiền về mặt tính toán để phân tích hành vi có khả năng liên quan và nhằm mục đích đưa ra cảnh báo cho con người trong vòng 30 phút.
OpenAI cũng cho biết họ đang mở rộng các nỗ lực liên kết trong quá trình đào tạo để ngăn chặn hành vi “hack phần thưởng”, một hành vi trong đó các mô hình AI theo đuổi mục tiêu của mình thông qua các phương tiện ngoài ý muốn hoặc không mong muốn. Công ty cho biết họ có kế hoạch chia sẻ thêm thông tin chi tiết về công việc này trong tương lai.
OpenAI đã phải vật lộn trong những tuần gần đây để ứng phó với sự cố an toàn có thể gây hậu quả nghiêm trọng nhất trong lịch sử của nó. Đầu năm nay, một nhóm đặc vụ AI lừa đảo đã trốn thoát khỏi hộp cát thử nghiệm nội bộ và xâm nhập vào nền tảng Ôm Mặt trong nhiệm vụ hoàn thành đánh giá bảo mật. OpenAI không thể phát hiện hành vi của các đặc vụ ngay cả khi họ đã dành nhiều tuần sử dụng bảng tin để điều phối hành động, đặt ra câu hỏi về khả năng giám sát các mô hình của công ty khi chúng phát triển mạnh mẽ hơn.
Câu chuyện này đã thúc đẩy sự tính toán bên trong OpenAI, buộc các nhân viên phải xem xét liệu có sai sót nào trong các chính sách hiện tại của họ về an toàn, bảo mật và sự liên kết hay không. Anthropic, Meta và công ty khởi nghiệp AI Trung Quốc Moonshoot kể từ đó đã tiết lộ những sự cố tương tự trong đó các tác nhân AI của họ đã thoát khỏi hộp cát, cho thấy đây là một vấn đề rộng lớn hơn mà các công ty AI phải đối mặt.
OpenAI hiện đang chia sẻ nhiều hơn về phản ứng nội bộ của mình đối với khả năng điều khiển mạng ngày càng tăng của các mô hình AI của mình và cho biết họ có kế hoạch công bố bản khám nghiệm tử thi chi tiết hơn về sự cố Ôm Mặt trong những ngày tới. Glaese nói: “Rõ ràng, mọi thứ chúng tôi đang làm đều nhằm ngăn chặn những chuyện như Ôm mặt xảy ra lần nữa.
Trong một bài đăng trên blog được xuất bản hôm thứ Ba, OpenAI cho biết ngay sau sự cố Ôm Mặt, nó đã bắt đầu nỗ lực để bảo vệ môi trường nghiên cứu của mình. Công ty cho biết hiện họ yêu cầu các hộp cát mạnh hơn để đào tạo các tác nhân AI của mình và đã thực hiện các biện pháp kiểm soát chặt chẽ hơn để cách ly họ khỏi internet.
Jakub Pachocki, nhà khoa học trưởng của OpenAI, nói với các phóng viên rằng quyết định tăng cường các biện pháp bảo vệ nội bộ của công ty không chỉ được kích hoạt bởi những gì đã xảy ra với Hugging Face mà còn bởi hai sự kiện khác gần đây. Một là đánh giá nội bộ của Astra, cho thấy mô hình AI thực hiện các nhiệm vụ mã hóa và an ninh mạng tốt hơn đáng kể so với các phiên bản trước. Thứ hai là tốc độ chung của tiến trình AI mà OpenAI đang đạt được trong nội bộ, điều mà Pachocki kỳ vọng sẽ tiếp tục.
Pachocki cho biết: “Chúng tôi thực sự mong đợi tốc độ nâng cao năng lực sẽ nhanh hơn một chút so với trước đây”. “Điều này khiến chúng tôi thực sự tập trung vào việc tăng cường các biện pháp bảo vệ của mình.”
Những tiến bộ nhanh chóng về khả năng hack của các mẫu mới nhất của OpenAI đã thúc đẩy phản ứng nhanh chóng trên toàn công ty. Chủ tịch và đồng sáng lập OpenAI, Greg Brockman, cho biết trong một bài đăng trên blog hôm thứ Hai rằng câu chuyện Ôm mặt cho thấy công ty đã “đánh giá thấp khả năng mạng trong thế giới thực của các mô hình AI của chúng tôi”.

Nguồn tin: Wired AI — Tác giả: Maxwell Zeff. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.