Đánh cắp dấu vết suy luận từ các API LLM độc quyền
URL bài viết: https://arxiv.org/abs/2608.09867 URL bình luận: https://news.ycombinator.com/item?id=49254407 Điểm: 1 Bình luận: 0
Khoa học máy tính > Mật mã học và An ninh
arXiv:2608.09867 (cs)
[Đệ trình ngày 10/8/2026]
Tiêu đề: Đánh cắp dấu vết suy luận từ các API LLM độc quyền
Tác giả: Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko
Xem bản PDF của bài báo có tiêu đề "Đánh cắp dấu vết suy luận từ các API LLM độc quyền", của Alexander Panfilov và 7 tác giả khác
Xem PDF
Tóm tắt: Các nhà cung cấp mô hình ngôn ngữ lớn (LLM) hàng đầu hiện nay che giấu quá trình suy luận từng bước, hay chuỗi suy nghĩ (chain-of-thought), của mô hình nhằm bảo vệ tài sản trí tuệ và hạn chế rò rỉ thông tin. Thay vì lưu trữ các dấu vết này trên máy chủ, các nhà cung cấp trả chúng về máy khách dưới dạng các khối văn bản được mã hóa, mà máy khách sẽ gửi lại cùng với mỗi yêu cầu tiếp theo. Dựa trên nghiên cứu trước đây, chúng tôi đã xác định một lỗ hổng kiến trúc: các khối được mã hóa này hoàn toàn tương thích và có thể hoán đổi cho nhau giữa các phiên, người dùng và mô hình khác nhau trong hệ sinh thái của một nhà cung cấp. Chúng tôi khai thác tính tương thích này để phát triển một phương pháp phá mã (decryption jailbreak) có khả năng mở rộng. Bằng cách chèn một dấu vết suy luận được mã hóa từ một mô hình nhất định vào một mô hình yếu hơn và ít được bảo vệ hơn từ cùng nhà cung cấp, chúng tôi buộc mô hình đó giải mã và xuất dấu vết nguyên văn dưới dạng văn bản thuần túy, mà không cần trực tiếp phá mã mô hình mạnh hơn. Lỗ hổng này cho phép thực hiện bốn vectơ tấn công riêng biệt. Thứ nhất, nó phá vỡ các cơ chế chống chắt lọc (anti-distillation), cho phép kẻ tấn công trích xuất quá trình suy luận của một mô hình độc quyền, như chúng tôi đã chứng minh trên Anthropic, OpenAI và Google. Thứ hai, nó cho phép trích xuất dữ liệu riêng tư quy mô lớn. Các nhà phát triển thường chia sẻ nhật ký phiên công khai, không nhận thức được nội dung của các khối được mã hóa. Bằng cách giải mã 315.320 khối suy luận được thu thập từ các kho lưu trữ công khai, chúng tôi đã khôi phục 367 tạo phẩm Thông tin nhận dạng cá nhân (PII) và 182 thông tin xác thực. Thứ ba, nó vô tình tiết lộ thông tin nguy hiểm ẩn trong quá trình suy luận, ngay cả trong trường hợp đầu ra cuối cùng, hiển thị của mô hình từ chối an toàn một yêu cầu độc hại. Thứ tư, kẻ tấn công có thể lợi dụng lỗ hổng này để thực hiện các cuộc tấn công chèn lời nhắc (prompt injection) vô hình, nhúng các tải trọng độc hại hoàn toàn vào bên trong các khối được mã hóa để làm nhiễm độc các triển khai tác nhân (agentic rollouts) công khai. Sau khi tiết lộ có trách nhiệm, chúng tôi đề xuất các biện pháp giảm thiểu cụ thể về mật mã và cấp hệ thống để bảo mật quá trình suy luận phía máy khách.
Chủ đề:
Mật mã học và An ninh (cs.CR); Trí tuệ nhân tạo (cs.AI); Học máy (cs.LG)
Trích dẫn dưới dạng:
arXiv:2608.09867 [cs.CR]
(hoặc arXiv:2608.09867v1 [cs.CR] cho phiên bản này)
https://doi.org/10.48550/arXiv.2608.09867
DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)
Lịch sử đệ trình
Từ: Alexander Panfilov [xem email]
[v1]
Thứ Hai, 10/8/2026 17:24:50 UTC (16.346 KB)
Liên kết toàn văn:
Truy cập bài báo:
Xem bản PDF của bài báo có tiêu đề "Đánh cắp dấu vết suy luận từ các API LLM độc quyền", của Alexander Panfilov và 7 tác giả khác
Xem PDF
Nguồn TeX
xem giấy phép
Ngữ cảnh duyệt hiện tại:
cs.CR
< trước | tiếp theo >
mới | gần đây | 2026-08
Thay đổi để duyệt theo:
cs
cs.AI
cs.LG
Tham khảo & Trích dẫn
NASA ADS
Google Scholar
Semantic Scholar
xuất trích dẫn BibTeX
Đang tải...
Trích dẫn định dạng BibTeX
×
đang tải...
Dữ liệu được cung cấp bởi:
Đánh dấu
Công cụ thư mục
Công cụ thư mục và trích dẫn
Bibliographic Explorer Toggle
Bibliographic Explorer (Bibliographic Explorer là gì?)
Connected Papers Toggle
Connected Papers (Connected Papers là gì?)
Litmaps Toggle
Litmaps (Litmaps là gì?)
scite.ai Toggle
scite Smart Citations (Smart Citations là gì?)
Mã nguồn, dữ liệu, phương tiện
Mã nguồn, dữ liệu và phương tiện liên quan đến bài viết này
alphaXiv Toggle
alphaXiv (alphaXiv là gì?)
Links to Code Toggle
CatalyzeX Code Finder for Papers (CatalyzeX là gì?)
DagsHub Toggle
DagsHub (DagsHub là gì?)
GotitPub Toggle
Gotit.pub (GotitPub là gì?)
Huggingface Toggle
Hugging Face (Huggingface là gì?)
ScienceCast Toggle
ScienceCast (ScienceCast là gì?)
Bản trình diễn
Bản trình diễn
Replicate Toggle
Replicate (Replicate là gì?)
Spaces Toggle
Hugging Face Spaces (Spaces là gì?)
Spaces Toggle
TXYZ.AI (TXYZ.AI là gì?)
Các bài báo liên quan
Công cụ đề xuất và tìm kiếm
Link to Influence Flower
Influence Flower (Influence Flowers là gì?)
Core recommender toggle
CORE Recommender (CORE là gì?)
Tác giả
Địa điểm
Tổ chức
Chủ đề
Về arXivLabs
arXivLabs: Các dự án thử nghiệm với cộng đồng cộng tác viên
arXivLabs là một khuôn khổ cho phép các cộng tác viên phát triển và chia sẻ các tính năng arXiv mới trực tiếp trên trang web của chúng tôi.
Cả cá nhân và tổ chức làm việc với arXivLabs đều đã chấp nhận và tuân thủ các giá trị của chúng tôi về sự cởi mở, cộng đồng, sự xuất sắc và quyền riêng tư dữ liệu người dùng. arXiv cam kết với những giá trị này và chỉ làm việc với các đối tác tuân thủ chúng.
Bạn có ý tưởng cho một dự án sẽ mang lại giá trị cho cộng đồng arXiv? Tìm hiểu thêm về arXivLabs.
Những tác giả nào của bài báo này là người xác nhận? |
Tắt MathJax (MathJax là gì?)
Nguồn tin: Hacker News LLM — Tác giả: sbulaev. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.