Bỏ qua tới nội dung chính
Quay lại tin tức

Một thủ thuật mới hé lộ suy nghĩ bên trong của các mô hình AI

Wired AI· Will Knight· 11/8/2026general

Các nhà nghiên cứu đã tìm ra cách trích xuất "dấu vết suy luận" từ các mô hình Claude, GPT và Gemini. Theo họ, những phát hiện này cho thấy một số mô hình AI của Trung Quốc có thể được đào tạo dựa trên các mô hình hàng đầu của Mỹ.

Các nhà khoa học máy tính gần đây đã phát hiện ra một phương pháp để trích xuất "quá trình tư duy" ẩn mà các mô hình AI tiên tiến thực hiện khi giải quyết các vấn đề phức tạp. Những phát hiện này cung cấp một số bằng chứng – dù chưa phải là bằng chứng kết luận – cho thấy một số mô hình của Trung Quốc có thể đã được huấn luyện bằng cách "chắt lọc" thông tin lập luận từ các mô hình của Mỹ. Thông tin này được cho là đã bị ẩn đi do sự trùng khớp chặt chẽ trong một số mẫu tư duy hoặc lập luận của chúng. Các nhà nghiên cứu cũng đã chứng minh rằng phương pháp này có thể được sử dụng để khôi phục thông tin cá nhân, như mật khẩu và khóa API, từ quá trình lập luận nội bộ của mô hình, mặc dù lỗ hổng này đã được khắc phục. Ông Alexander Panfilov, nhà khoa học máy tính tại Đại học Tübingen ở Đức, người tham gia vào công trình nghiên cứu, cho biết: "Tất cả các nhà cung cấp mô hình tiên tiến lớn mà chúng tôi đã thử nghiệm đều có lỗ hổng này. Nó có thể dẫn đến rò rỉ thông tin cá nhân và cho phép các cuộc tấn công chắt lọc lập luận quy mô lớn." Ông Panfilov và các đồng nghiệp từ Đại học Tübingen, Viện Max Planck, viện an toàn AI MATS Research và công ty bảo mật Snyk đã xác định cùng một vấn đề với các mô hình tiên tiến từ OpenAI, Anthropic và Google, những mô hình được truy cập thông qua giao diện lập trình ứng dụng (API). Trong một bài báo trình bày công trình nghiên cứu, các nhà nghiên cứu chỉ ra rằng mô hình mã nguồn mở hoặc có thể tải xuống của Trung Quốc là Kimi K3 từ Moonshot AI tạo ra kết quả đầu ra tương tự đáng kinh ngạc với các dấu vết lập luận ẩn – các bước lập luận được viết ra trong quá trình giải quyết vấn đề – của Claude Opus 4.8 và GPT 5.6 Sol đối với một số câu lệnh nhất định. Mặc dù có những điểm tương đồng, họ lưu ý rằng công trình này "không thể thiết lập mối quan hệ nhân quả về việc chắt lọc". Họ phát hiện ra rằng hai mô hình mã nguồn mở khác, DeepSeek của Trung Quốc và Inkling từ công ty Thinking Machines của Mỹ, không thể hiện loại tương đồng lập luận này với Claude Opus. Moonshot AI và Z.ai đã không phản hồi yêu cầu bình luận trước thời điểm xuất bản. Chắt lọc là một kỹ thuật đã được thiết lập và sử dụng rộng rãi để sao chép hiệu quả các khả năng của các mô hình hiện có sang các mô hình mới, và đặc biệt phổ biến trong việc phát triển các mô hình mã nguồn mở hoặc có thể tải xuống hoàn toàn. Tuy nhiên, gần đây, chắt lọc đã trở thành một chủ đề gây tranh cãi, do những cáo buộc rằng các công ty AI của Trung Quốc sử dụng nó để sao chép các mô hình tốt nhất của Mỹ. Vào tháng 2, OpenAI đã thông báo với các nhà lập pháp Mỹ rằng DeepSeek dường như đã sao chép một trong các mô hình của họ để xây dựng một mô hình lập luận có tên R1. Vào tháng 6, Anthropic đã thông báo với các nhà lập pháp rằng Alibaba đã chắt lọc một cách có hệ thống các mô hình của họ để xây dựng mô hình riêng của mình, có tên Qwen. Không có dấu hiệu nào cho thấy các công ty AI Trung Quốc đã sử dụng kỹ thuật cụ thể này để chắt lọc các mô hình AI có trụ sở tại Mỹ. Tuy nhiên, Panfilov và các cộng sự cho biết việc sử dụng phương pháp của họ sẽ giúp chắt lọc được nhiều thông tin hơn từ các mô hình đóng so với những gì đã nhận ra trước đây. Các mô hình "Mini-Me" Các mô hình AI tiên tiến giải quyết các vấn đề khó bằng cách chia chúng thành các phần cấu thành, sau đó được phân tích lần lượt theo một kiểu suy luận nhân tạo hoặc "chuỗi suy nghĩ" (chain of thought). Các công ty thường giữ bí mật quy trình suy luận của mô hình độc quyền để ngăn người khác sử dụng chúng đào tạo các mô hình mới. Tuy nhiên, họ thường gửi một phiên bản mã hóa của quy trình suy luận đó đến máy tính của người dùng theo cách giảm tải một phần tính toán. Cuộc tấn công của các nhà nghiên cứu dựa trên thực tế là hầu hết các công ty AI cũng cung cấp các mô hình liên quan với nhiều kích cỡ khác nhau. Các mô hình lớn hơn có khả năng mạnh hơn nhưng cũng tốn kém hơn về mặt tính toán để vận hành và đắt hơn để truy cập. Người dùng có thể chọn các mô hình nhỏ hơn, yếu hơn cho một số tác vụ nhất định để giảm chi phí. Panfilov và các đồng nghiệp của ông phát hiện ra rằng việc cung cấp các dấu vết suy luận được mã hóa cho một phiên bản nhỏ hơn của cùng một mô hình có thể tiết lộ quy trình suy luận ẩn bên trong. Các mô hình nhỏ hơn đã nhận được ít quá trình huấn luyện căn chỉnh hơn, nghĩa là, không giống như các mô hình lớn hơn, chúng ít có khả năng từ chối tiết lộ suy nghĩ bên trong của mình. Florian Tramer, một nhà khoa học máy tính tại ETH Zürich ở Thụy Sĩ, chuyên về an ninh máy tính, nhận định: "Ý tưởng hoán đổi các thông điệp sang một biến thể mô hình yếu hơn có cùng khóa giải mã nhưng căn chỉnh yếu hơn là rất thú vị. Chắc chắn nó đang trở thành một vấn đề." Phương pháp tương tự cũng tiết lộ thông tin bí mật, bao gồm khóa API và mật khẩu được nhúng trong các dấu vết suy luận được thu thập từ máy của người dùng. Panfilov và các đồng tác giả đã cảnh báo OpenAI, Anthropic và Google về lỗ hổng này vào tháng trước. Mỗi công ty đã điều chỉnh API của mình để giảm thiểu vấn đề. Mặc dù không còn có thể trích xuất thông tin riêng tư theo cách này, Panfilov cho biết một số dấu vết suy luận vẫn có thể được phát hiện bằng cùng một phương pháp. Ông nói, việc khắc phục hoàn toàn quá trình chắt lọc sẽ đòi hỏi một cuộc đại tu cơ bản đối với cách thức hoạt động của API của các công ty này. Michael Aciman, người phát ngôn của Anthropic, cho biết: "Chúng tôi đánh giá cao nghiên cứu độc lập về các mô hình của mình và đã bắt đầu xây dựng các biện pháp giảm thiểu ngắn hạn cho các hành vi phát lại được mô tả trong báo cáo." Ông nói thêm rằng nghiên cứu không liên quan đến việc khôi phục khóa mã hóa, truy cập cơ sở hạ tầng của Anthropic hoặc khôi phục dữ liệu cá nhân từ hệ thống của họ. Google và OpenAI đều từ chối bình luận. Chắt lọc đã trở thành một vấn đề có tầm quan trọng địa chính trị trong những tháng gần đây khi các công ty Mỹ và Trung Quốc cạnh tranh giành quyền tối cao về AI với các mô hình ngày càng mạnh mẽ. Những người theo chủ nghĩa diều hâu Trung Quốc tuyên bố rằng nước này đạt được lợi thế chiến lược bằng cách chắt lọc công nghệ của Mỹ để xây dựng các mô hình mã nguồn mở (open-weight) có chi phí vận hành thấp hơn. Tuy nhiên, những người khác lại lập luận rằng chắt lọc là một cách được sử dụng rộng rãi để giúp nhanh chóng nâng cao khả năng của mô hình AI trong một số lĩnh vực nhất định. Mark Zuckerberg, CEO của Meta, đã nói trong một bài đăng trên blog tuần này rằng quá trình chắt lọc...

Nguồn tin: Wired AI — Tác giả: Will Knight. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.