Bỏ qua tới nội dung chính
Quay lại tin tức

Kỹ thuật lặp cho tham chiếu chéo: Khi RAG trả lời "xem Mục 7.2" thay vì câu trả lời thực tế

Towards Data Science· angela shi· 6/8/2026general

Trí tuệ Tài liệu Doanh nghiệp [Tập 1 Số 11] - Khi câu trả lời đầu tiên chỉ đến một vị trí khác trong tài liệu, quy trình sẽ lặp lại để tìm nạp ngữ cảnh được liên kết. Bài viết Kỹ thuật Vòng lặp cho Tham chiếu chéo: Khi RAG trả lời ‘xem Mục 7.2’ thay vì Câu trả lời Thực tế xuất hiện lần đầu trên Towards Data Science.

Mô hình ngôn ngữ lớn Kỹ thuật vòng lặp cho tham chiếu chéo: Khi RAG trả lời ‘xem Mục 7.2’ thay vì câu trả lời thực tế Enterprise Document Intelligence [Tập 1 #11] – Khi câu trả lời đầu tiên chỉ đến một vị trí khác trong tài liệu, quy trình sẽ lặp lại để tìm ngữ cảnh được liên kết Angela Shi Ngày 6/8/2026 23 phút đọc Chia sẻ Ảnh của Debby Hudson, qua Unsplash. Một quy trình RAG đưa ra câu trả lời sau: “giới hạn phụ áp dụng được định nghĩa trong Mục 7.2 của chính sách.” Bây giờ, hãy đọc nó với tư cách người dùng. Vâng… và? Mục 7.2 nói gì? Con số thực tế là bao nhiêu? Câu trả lời không sai, nó chỉ chưa hoàn chỉnh: đoạn văn được truy xuất chỉ đến câu trả lời thay vì chứa nó, và không có gì trong quy trình đi lấy nó. Hợp đồng, tiêu chuẩn và tài liệu đều chứa đầy các con trỏ nội bộ này; câu hỏi đặt ra là làm thế nào để theo dõi chúng một cách có hệ thống, thay vì hy vọng trang đúng đã được tìm nạp ngay từ lần đầu tiên. Bài viết này là một phần của Phần III của Enterprise Document Intelligence, một loạt bài xây dựng hệ thống RAG cấp doanh nghiệp từ bốn khối: phân tích tài liệu, phân tích câu hỏi, truy xuất và tạo. Nó xây dựng cách tiếp cận có hệ thống đó: bộ phân tích gắn cờ các tham chiếu một cách hiệu quả, quá trình tạo báo cáo các tham chiếu chưa được giải quyết và bộ điều phối lặp lại để tìm mục tiêu. Vị trí của bài viết này trong loạt bài: Bài viết 11 (tham chiếu chéo), trong Phần III – Hình ảnh của tác giả 📓 Tài liệu hướng dẫn có thể chạy được sẽ hướng dẫn bạn thực hiện vòng lặp hai bước: bạn chạy bước 1 trên tài liệu Attention, in các pending_references mà LLM gắn cờ trên trang 6, xem bộ giải quyết kết hợp “Bảng 3 hàng (E)” với sổ đăng ký đối tượng và thấy bước 2 hoàn thành. Trên GitHub: doc-intel/notebooks-vol1. Kho lưu trữ mã đồng hành công khai tại doc-intel/notebooks-vol1 – Hình ảnh của tác giả 1. Vị trí của các tham chiếu chéo trong mỗi khối Tham chiếu xảy ra tại thời điểm phân tích (tác giả tài liệu viết nó), tại thời điểm truy xuất (một đoạn chứa tham chiếu khớp với truy vấn) và tại thời điểm tạo (mô hình viết “xem Mục X” thay vì tìm nạp Mục X). Con trỏ có thể được giải quyết tại bất kỳ thời điểm nào trong ba thời điểm này và bị bỏ qua một cách âm thầm tại mỗi thời điểm. Cách khắc phục là một trường phản hồi trên đầu ra tạo gắn cờ một tham chiếu chưa được giải quyết, cộng với một bộ điều phối bắt tín hiệu, giải quyết tham chiếu dựa trên các bảng quan hệ của khối phân tích, truy xuất lại vùng được liên kết và chạy lại quá trình tạo với ngữ cảnh được liên kết hiện có. Điểm kiến trúc là bộ điều phối lặp lại trên các tín hiệu từ đầu ra có cấu trúc, không phải trên điểm tin cậy. Cơ chế tương tự được sử dụng trong Bài viết 10 cho chất lượng phân tích được sử dụng ở đây cho các tham chiếu. Bài viết 12 áp dụng nó cho một chiều thứ ba (hoàn chỉnh danh sách); Bài viết 13 (quy trình làm việc RAG) đặt tên rõ ràng cho mẫu và cho thấy cách các mẫu kết hợp. Phân tích là nơi các tham chiếu được khởi tạo, nhưng một cách hiệu quả. Các liên kết PDF gốc (loại bạn nhấp vào trong trình xem PDF) có sẵn miễn phí từ bộ phân tích và đi vào bảng cross_ref_df mà không tốn chi phí. Bất cứ điều gì ngoài đó, phát hiện biểu thức chính quy của “xem Mục 4.2”, gắn thẻ thuật ngữ, gắn cờ mệnh đề điều kiện, đều không được thực hiện trước. Từ vựng quá đa dạng (“cf.”, “xem”, “theo”, “như được định nghĩa trong”) và khối lượng quá lớn để trích xuất mọi thứ trước khi biết những gì sẽ cần. Việc phân tích câu hỏi không thay đổi. Câu hỏi của người dùng được phân tích thành question_df thông thường cùng với các vệ tinh (Điều 6). Các tham chiếu không yêu cầu một hình dạng câu hỏi mới. Việc truy xuất không thay đổi trong lần chạy đầu tiên. Nó chạy truy xuất tiêu chuẩn từ Điều 9 (các trang mục lục cộng với các trang từ khóa, được hợp nhất). Các tham chiếu tồn tại trong các đoạn văn ứng cử viên chưa được giải quyết. Việc tạo ra là nơi hợp đồng mới xuất hiện. Schema Pydantic bổ sung hai trường: một danh sách pending_references (các tham chiếu mà LLM phát hiện trong các ứng cử viên có vẻ sẽ thay đổi câu trả lời nếu được giải quyết) và một cờ answer_completeness (complete, references_unresolved, hoặc partial). Hai trường này là tín hiệu phản hồi. Bộ điều phối (decide.py từ Điều 13) đọc đầu ra có cấu trúc và quyết định liệu câu trả lời có thể gửi đi được hay cần chạy lần thứ hai. 2. Ví dụ đang chạy: “xem Bảng 3 hàng (E)” Ví dụ chạy trên bài báo Attention Is All You Need (Vaswani et al. 2017; giấy phép phân phối không độc quyền arXiv, được công bố trên trang tóm tắt arXiv; phiên bản v7), cùng tài liệu được sử dụng trong Điều 1. Các đường dẫn mã có thể chạy gọi các dịch vụ OpenAI được điều chỉnh bởi Điều khoản sử dụng của OpenAI. Câu hỏi: “Liệu các nhúng vị trí đã học có cho kết quả tương tự như các nhúng hình sin trong bài báo Transformer không?” Văn xuôi ở trang 6 (Mục 3.5 Mã hóa vị trí) đưa ra câu trả lời định tính (“hai phiên bản tạo ra kết quả gần như giống hệt nhau”) và bổ sung “xem Bảng 3 hàng (E)”. Các con số thực tế nằm ở trang 9. Với chính sách truy xuất top-1 (được bảo vệ trong mục 6), lần chạy đầu tiên tìm nạp trang 6 và bảng bị bỏ qua. Phần còn lại của bài viết trình bày các bước. Lần chạy 1 đánh dấu sự không đầy đủ; bộ điều phối kích hoạt Lần chạy 2; câu trả lời hội tụ được gửi đi kèm với nguồn gốc – Hình ảnh của tác giả 3. Lần chạy đầu tiên: quy trình chạy một lần 3.1 Phân tích cú pháp khởi tạo các tham chiếu một cách tiết kiệm Trình phân tích cú pháp từ Điều 5B (mô hình dữ liệu quan hệ) chạy trên PDF và tạo ra các bảng thông thường: line_df, page_df, toc_df, cộng với cross_ref_df. Điều 5 giới thiệu cross_ref_df (một hàng cho mỗi lần đề cập trong văn bản của một đối tượng được đặt tên); bài viết này mở rộng nó với một cột nguồn ghi lại những gì đã tạo ra mỗi hàng, và điền các hàng regex và LLM theo yêu cầu. cross_ref_df được điền vào thời điểm phân tích cú pháp chỉ chứa các tham chiếu miễn phí hoặc gần như miễn phí để trích xuất: các liên kết gốc PDF (được tạo bởi nhà sản xuất tài liệu bằng LaTeX \hyperref hoặc tính năng siêu liên kết của Word), các neo phần từ toc_df và các đối tượng được đặt tên (hình ảnh, bảng, phụ lục) mà trình phân tích cú pháp đã định vị. Bài báo Transformer có ít liên kết gốc. Những gì cuối cùng trong cross_ref_df sau khi phân tích cú pháp là cấu trúc.

Nguồn tin: Towards Data Science — Tác giả: angela shi. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.