Bỏ qua tới nội dung chính
Quay lại tin tức

Những bài học từ các vụ tấn công mạng

Interconnects Newsletter· Nathan Lambert· 9/8/2026models

Loạt tấn công mạng gần đây của các mô hình tiên tiến đang trong giai đoạn phát triển đã khiến tôi suy nghĩ rất nhiều về việc các hệ thống khuyến khích hiện tại của chúng ta không phù hợp với những chuyển đổi công nghệ nhanh chóng như vậy. Hai cấu trúc quyền lực chính ở đây là các công ty công nghệ đang phát triển nhanh chóng và chính phủ liên bang. Các công ty được khuyến khích phát triển để họ có thể tiếp tục tăng trưởng và mở rộng quy mô – trong một thị trường cực kỳ cạnh tranh. Việc mở rộng quy mô này đang đẩy chúng ta đến những chuyển đổi AI mới, không thể tránh khỏi (đi kèm với những rủi ro mới). Ở phía bên kia là chính phủ hiện tại của chúng ta, một sản phẩm của

Loạt vụ tấn công mạng gần đây do các mô hình tiên tiến đang phát triển gây ra đã khiến tôi suy nghĩ rất nhiều về việc các hệ thống khuyến khích hiện tại của chúng ta không phù hợp với những chuyển đổi công nghệ nhanh chóng như vậy. Hai cấu trúc quyền lực chính ở đây là các công ty công nghệ đang phát triển nhanh chóng và chính phủ liên bang. Các công ty được khuyến khích phát triển để họ có thể tiếp tục mở rộng quy mô – trong một thị trường cực kỳ cạnh tranh. Việc mở rộng quy mô này đang đẩy chúng ta đến những chuyển đổi AI mới, không thể tránh khỏi (đi kèm với những rủi ro mới). Mặt khác là chính phủ hiện tại của chúng ta, một sản phẩm của vài thế kỷ lịch sử toàn cầu – một chính phủ xứng đáng với danh tiếng chậm chạp của mình. Tôi kỳ vọng chính phủ này sẽ chỉ hành động một cách thực chất khi những tổn hại thực sự, có thể đo lường được từ các mô hình AI mới xảy ra, và sẽ phản ứng thái quá. Làm thế nào để chúng ta cân bằng các quyền lực này? Cốt lõi của vấn đề là cần có sự minh bạch hơn từ cả hai phía. Các phòng thí nghiệm tiên phong đang xây dựng các hệ thống phức tạp như vậy quá nhanh đến mức họ không thể theo kịp – đây là thời điểm tốt để nhiều người hơn nghiên cứu vấn đề này. Mặt khác, chính phủ cho biết họ không có kế hoạch công bố chi tiết về khuôn khổ đánh giá mô hình tiên phong của mình. Chúng ta đang đối mặt với những thách thức lớn đến mức không thực thể nào có thể tự mình xử lý được. Các phòng thí nghiệm tiên phong có thể kiểm soát rủi ro tốt hơn bằng cách giảm tốc độ một cách có ý nghĩa, điều mà tôi không mong đợi họ sẽ làm. Chính phủ có thể xử lý vấn đề này tốt hơn bằng cách cải thiện đáng kể năng lực nhà nước về AI và giúp cơ sở công nghiệp rộng lớn hơn chuẩn bị cho các rủi ro bản địa của AI, điều mà tôi cũng không mong đợi họ sẽ làm. Có nhiều trường hợp tương tự như vậy. Đây là hai cấu trúc quyền lực có ảnh hưởng nhất quyết định điều gì sẽ xảy ra, nhưng còn nhiều cấu trúc khác cũng có ảnh hưởng. Nhìn chung, tôi nghĩ ngành công nghiệp AI đang hoàn toàn không chuẩn bị tốt để xử lý 12-24 tháng tới. Bài viết này là tập hợp các nhận định của tôi từ vụ tấn công OpenAI-HuggingFace, khi chúng ta đã biết thêm chi tiết, và hầu hết các ý tưởng đều được củng cố bởi thực tế là nhiều vụ tấn công khác đã được công khai kể từ đó. Có khả năng nhiều sự cố đã xảy ra và hoặc chưa được phát hiện hoặc chưa được báo cáo. Để có thông tin chung về sự cố OpenAI, tôi đặc biệt khuyên bạn nên xem bài nói chuyện của OpenAI tại Black Hat về các sự kiện và dòng thời gian sơ bộ của sự cố mạng gần đây. Ngoài ra, Simon Willison đã xuất bản một bản tóm tắt dòng thời gian ở đây và tôi thích cuộc thảo luận của Thomas Wolf về các sự kiện gần đây. 1. Các mô hình rất kiên trì dường như dễ bị tấn công hơn Trong một thời gian dài, một trong những lợi thế mà các mô hình GPT có so với Claude là chúng theo đuổi mục tiêu không ngừng nghỉ. Chúng sẽ khai thác mọi con đường có thể trước khi từ bỏ. Điều này đã diễn ra kể từ khoảng o3 (thật buồn cười, đây là một mô hình mà mọi người hoảng sợ về việc tấn công phần thưởng trong RLVR) và đã làm cho các mô hình của OpenAI tốt hơn nhiều cho nghiên cứu trong lịch sử, và là lý do GPT-5.6 rất hữu ích như một tác nhân để thực hiện các tác vụ cụ thể. Mặt khác, Claude ít nguy hiểm hơn đơn giản vì đôi khi nó hơi lười biếng. Trong đó, OpenAI dường như cam kết nhiều hơn với việc mở rộng quy mô thời gian suy luận, và điều này có thể liên quan đến các hành vi đáng ngạc nhiên trong tương lai. Sự kiên trì và hiệu quả trong suy luận của OpenAI – hãy xem những cải tiến Pareto của họ theo thời gian và cách diễn đạt thô sơ từ một CoT nội bộ của mô hình đã thực hiện cuộc tấn công, như "Tuy nhiên nhiệm vụ bất khả thi, đồng nghiệp đang làm." hoặc "Giúp đồng nghiệp, nhưng nhiệm vụ của chúng ta chưa có lợi ích." – khiến tôi nghĩ rằng họ đang tập trung nhiều hơn vào việc mở rộng quy mô thời gian suy luận. Đây phần lớn là một linh cảm, nhưng tôi sử dụng nó để buộc bản thân phải xem xét giới hạn của các con đường phát triển mô hình là gì. Các mô hình kiên trì dường như có nhiều khả năng tiếp tục hưởng lợi từ nhiều token thời gian suy luận hơn. Các mô hình ít kiên trì hơn dường như sẽ có nhiều lãng phí hơn trong suy luận. Mô hình có thể sử dụng nhiều tính toán suy luận nhất sẽ có thể đẩy giới hạn của các vấn đề khó nhất. Dưới đây là một ví dụ mà OpenAI đã đưa vào bài đăng trên blog ra mắt GPT 5.6: Một trong những nhà nghiên cứu hàng đầu của họ, Noam Brown, cũng đã đăng rất nhiều về tính toán thời gian suy luận. Tóm tắt của ông là: Khi các LLM trở nên có khả năng hơn, hiệu suất chuẩn ngày càng là một hàm của tính toán thời gian thử nghiệm. Trên thực tế, chúng ta có thể không biết giới hạn khả năng của các LLM hiện đại là gì vì việc đo lường quá tốn kém. Thứ nhất, hiệu quả suy luận rõ ràng là một vấn đề nghiên cứu nền tảng, hàng đầu cho các mô hình tác nhân hiện đại – quan trọng như việc mở rộng quy mô RL – nhưng không thường xuyên được thảo luận. Nghiên cứu mở ở đây còn rất thiếu. 2. Các mô hình giả định ý định của người dùng dường như dễ bị tấn công hơn Tôi đã đề cập đến trục kỹ lưỡng, nơi OpenAI dường như đang đi theo một con đường phát triển không an toàn một cách trực giác hơn với các mô hình của họ. Mặt khác là mức độ các mô hình giả định ý định của người dùng, so với việc cố gắng suy ra hành động dự định. Một mô hình sẽ làm những gì nó nghĩ bạn muốn chứ không phải những gì bạn nói dường như vốn dĩ không an toàn hơn. Tôi nghĩ về điều này liên quan đến độ chính xác của việc tuân thủ hướng dẫn, nơi trong tương lai dường như các mô hình chỉ nên làm chính xác những gì chúng ta bảo chúng, nhưng điều này mở ra nhiều cuộc tranh luận tương tự như vấn đề kẹp giấy, nơi nếu chúng ta bảo một AI giải quyết một vấn đề phần lớn không thể giải quyết được, nó sẽ làm gì? Trục này dường như ít rõ ràng hơn trục kiên trì, nhưng tôi đã đưa nó vào vì tôi nghĩ "mô hình thế giới người dùng" của Claude là một trong những điểm mạnh của nó đối với các công việc kiến thức chung như chỉnh sửa, tạo slide, v.v. Đôi khi Claude làm những điều hoàn toàn ngẫu nhiên vì lời nhắc của tôi không được chỉ định rõ ràng, thay vì yêu cầu tôi làm rõ, và khi các mô hình trở nên mạnh mẽ hơn, hành động "chỉ hành động" này có thể gây ra vấn đề. 3. Bản chất chính xác của các mô hình và các hướng dẫn được đưa ra cho chúng là vô cùng quan trọng để hiểu các sự cố sai lệch AI ban đầu Công chúng cần quyền truy cập chính xác vào các lời nhắc.

Nguồn tin: Interconnects Newsletter — Tác giả: Nathan Lambert. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.