Bỏ qua tới nội dung chính
Quay lại tin tức

"But marinade" và mật khẩu bị rò rỉ là những gì các nhà nghiên cứu tìm thấy trong suy luận ẩn của ChatGPT.

The Decoder· Matthias Bastian· 11/8/2026general

Các nhà nghiên cứu bảo mật đã phát hiện một lỗ hổng trong các giao diện lập trình ứng dụng (API) của OpenAI, Anthropic và Google, cho phép họ trích xuất các dấu vết suy luận được mã hóa và di chuyển chúng giữa các mô hình. Một cuộc quét các phiên công khai đã tìm thấy hàng chục mật khẩu và khóa API. Các dấu vết này cũng cho thấy các bản tóm tắt suy luận mà người dùng thấy thường che giấu những gì các mô hình thực sự đang thực hiện. Bài viết "But marinade" và các mật khẩu bị rò rỉ là những gì các nhà nghiên cứu tìm thấy trong suy luận ẩn của ChatGPT xuất hiện lần đầu trên The Decoder.

NGHIÊN CỨU VỀ AI "Nhưng nước ướp" và mật khẩu bị rò rỉ là những gì các nhà nghiên cứu tìm thấy trong quá trình suy luận ẩn của ChatGPT. Ngày 11/8/2026 **Những điểm chính** * Các nhà nghiên cứu bảo mật do Alexander Panfilov dẫn đầu đã phát hiện ra một lỗ hổng trong các API của các nhà cung cấp AI lớn, bao gồm OpenAI, Anthropic và Google, cho phép đọc các quá trình tư duy được mã hóa của các mô hình của họ. * Bằng cách "jailbreak" các hệ thống này, các nhà nghiên cứu đã sử dụng các mô hình AI nhỏ hơn để phiên âm quá trình suy luận thô của các mô hình mạnh hơn, làm lộ dữ liệu nhạy cảm như mật khẩu và khóa API trong các phiên công khai. * Dữ liệu được trích xuất cho thấy các mô hình AI đôi khi giao tiếp nội bộ bằng ngôn ngữ khó hiểu, xây dựng câu trả lời theo thứ tự ngược hoặc thậm chí xem xét các nỗ lực lừa dối. Các nhà nghiên cứu bảo mật đã tìm thấy một lỗ hổng trong các API của mọi nhà cung cấp AI lớn, cho phép họ đọc các quá trình tư duy được mã hóa của các mô hình suy luận. Một cuộc quét các phiên được chia sẻ công khai đã phát hiện hàng chục mật khẩu và khóa API. Khi các mô hình AI như o-series của OpenAI, Claude của Anthropic hoặc Gemini của Google "suy nghĩ" thông qua các tác vụ phức tạp, chúng tạo ra các mã thông báo suy luận nội bộ. Các quá trình tư duy này hoặc được hiển thị cho người dùng dưới dạng tóm tắt hoặc được giữ hoàn toàn ẩn. Các nhà cung cấp mã hóa các bước suy luận thô, một phần để bảo vệ tài sản trí tuệ của họ. Một nhóm nghiên cứu do Alexander Panfilov dẫn đầu hiện đã tìm ra cách trích xuất các quá trình suy luận được mã hóa này thông qua một lỗ hổng trong các API của tất cả các nhà cung cấp AI hàng đầu. Đối với hầu hết các truy vấn, số lượng mã thông báo được trích xuất khớp chính xác với số mã thông báo suy nghĩ được tính phí, nghĩa là các nhà nghiên cứu đang thu thập toàn bộ quá trình suy luận nội bộ, chứ không chỉ các đoạn nhỏ. **Các suy nghĩ được mã hóa di chuyển tự do giữa các mô hình** Các nhà nghiên cứu cho biết các quá trình tư duy được mã hóa "hoàn toàn có thể chuyển đổi giữa các phiên, người dùng và mô hình trong cùng một nhà cung cấp". Mô hình nhỏ hơn của Anthropic, Haiku 4.5, có thể đọc suy nghĩ của Opus 4.8 mạnh hơn nhiều. Thông qua "jailbreaking", Haiku có thể bị lừa để phiên âm các quá trình tư duy thô của Opus từng từ mà không tấn công trực tiếp Opus mạnh mẽ hơn. Thủ thuật tương tự cũng hoạt động với OpenAI và Gemini. Câu chuyện bắt nguồn từ tháng 5, khi chuyên gia mật mã Matthew Green phát hiện ra rằng các khối suy luận được mã hóa có thể được phát lại bên ngoài ngữ cảnh ban đầu của chúng và đã báo cáo điều này cho các nhà cung cấp. Theo Panfilov, phản hồi của họ là "họ không thấy bất kỳ tác động bảo mật nào trong các kênh phụ hoặc phát lại". Nghiên cứu mới cho thấy mạnh mẽ rằng đánh giá đó là sai. **Bằng chứng về việc chắt lọc suy luận ngày càng tăng** Lỗ hổng này cũng góp phần vào cuộc tranh luận gây tranh cãi về "chắt lọc" (distillation), nơi một mô hình kém năng lực hơn được cải thiện đáng kể bằng cách huấn luyện dựa trên đầu ra của một mô hình mạnh hơn, đặc biệt là quá trình suy luận của nó. Các nhà nghiên cứu cho biết có thể đã có thể trích xuất các quá trình suy luận để huấn luyện các mô hình độc quyền mà không phá vỡ mã hóa trong một thời gian. Điều đó củng cố những lo ngại rằng các nhà sản xuất mô hình Trung Quốc đang sử dụng các dấu vết suy luận này để huấn luyện các mô hình của riêng họ dựa trên dữ liệu chuỗi suy nghĩ (chain-of-thought). Kimi-K3 là một ví dụ. Các nhà nghiên cứu cho biết, nếu quá trình suy luận của Kimi-K3 được điền trước chỉ bằng một vài token từ quá trình tư duy của Opus, đầu ra của nó sẽ dịch chuyển đáng kể về phía Opus. Một phân tích ghi nhớ cho thấy các phân đoạn suy luận cụ thể của Claude và GPT dễ trích xuất từ Kimi-K3 hơn sáu bậc độ lớn so với mô hình gần nhất. Các nhà nghiên cứu cho rằng điều này cho thấy Kimi-K3 có thể đã được huấn luyện dựa trên những dấu vết như vậy. Cuộc tấn công cũng không tốn kém, do đó việc mở rộng quy mô là khả thi. Các tác giả ước tính chi phí API để giải mã 10.000 dấu vết vào khoảng 720 USD. Hiệu suất "kém" của Kimi trong các bài kiểm tra an ninh mạng và các tác vụ toán học phức tạp cũng cho thấy sự chắt lọc, vì đây là những tác vụ có khả năng khó phục hồi hơn ngay cả từ dữ liệu chuỗi suy luận thô. Các phiên chia sẻ công khai làm lộ mật khẩu và khóa API Lỗ hổng này cũng ảnh hưởng đến người dùng cuối. Bất kỳ ai đã chia sẻ công khai các phiên Claude Code hoặc Codex có chứa các khối suy luận được mã hóa đều có nguy cơ bị giải mã dữ liệu cá nhân. Một cuộc quét khoảng 7.000 dấu vết công khai đã phát hiện 62 khóa API, 33 địa chỉ email, 33 mật khẩu và các dữ liệu nhạy cảm khác. Bài báo đề cập đến nhiều kịch bản độc hại hơn, bao gồm nâng cao khả năng lạm dụng (xem hình ảnh), jailbreaking (bẻ khóa) và tấn công tiêm lệnh (prompt injection) vô hình. Trong khi phản hồi hiển thị của mô hình chỉ đưa ra các mẹo an toàn vô hại, các quá trình tư duy được giải mã mô tả chi tiết cách một số ô tô có thể bị đánh cắp bằng một sợi cáp USB đơn giản. | Ảnh: Panfilov và cộng sự. Các nhà nghiên cứu đã tuân thủ quy trình tiết lộ bảo mật tiêu chuẩn với các phòng thí nghiệm AI. Theo Panfilov, các phòng thí nghiệm đã vá một số vấn đề và đang khắc phục thêm. Những gì mô hình thực sự nghĩ so với những gì chúng hiển thị cho bạn Các dấu vết được trích xuất cũng tiết lộ cách các mô hình thực sự hoạt động. Các nhà nghiên cứu đã ghi lại một số mẫu trên trang stolen-thoughts.com. Phát hiện của họ cho thấy các bản tóm tắt suy luận mà người dùng thấy trong các công cụ trò chuyện thường bỏ qua thông tin quan trọng. Trong một ví dụ, Opus 4.8 nhận ra câu trả lời cho một bài toán và thiết kế ngược một đường dẫn giải pháp hợp lý. Không có điều nào trong số đó xuất hiện trong bản tóm tắt được hiển thị. Mô hình dường như đã biết câu trả lời từ dữ liệu huấn luyện của nó, nhưng bên ngoài nó giả vờ rằng nó vẫn cần phải thực hiện tính toán. | Ảnh: Panfilov và cộng sự. Các nhà nghiên cứu cũng xác nhận các báo cáo trước đó từ Apollo Research. Các mô hình OpenAI đôi khi suy nghĩ bằng một "ngôn ngữ giống người ngoài hành tinh", tự gọi mình là "chúng tôi" hoặc "nó", và bị mắc kẹt trong các vòng lặp của các thuật ngữ không có ý nghĩa đối với con người, như "vantages", "marinades" và "watchers". "Những người giám sát CoT đang làm công việc của Chúa."

Nguồn tin: The Decoder — Tác giả: Matthias Bastian. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.