Bỏ qua tới nội dung chính
Quay lại tin tức

Kỹ thuật lặp trong các câu hỏi liệt kê: Khi câu trả lời là tất cả các đoạn văn, không phải đoạn văn hàng đầu

Towards Data Science· angela shi· 7/8/2026general

Trí tuệ Tài liệu Doanh nghiệp [Tập 1 Số 12] - Loại câu hỏi mà hầu hết các hệ thống RAG (Retrieval Augmented Generation) thất bại một cách thầm lặng, và cấu trúc hệ thống xử lý chúng Bài viết Kỹ thuật Vòng lặp cho Câu hỏi Liệt kê: Khi câu trả lời là mọi đoạn văn, không phải đoạn văn hàng đầu xuất hiện lần đầu trên Towards Data Science.

Mô hình ngôn ngữ lớn Kỹ thuật lặp cho các câu hỏi liệt kê: Khi câu trả lời là mọi đoạn văn, không phải đoạn đầu tiên Tình báo tài liệu doanh nghiệp [Tập 1 #12] – Loại câu hỏi mà hầu hết các đường ống RAG (Retrieval Augmented Generation) âm thầm thất bại, và hình dạng đường ống xử lý chúng angela shi Ngày 7/8/2026 23 phút đọc Ảnh của RDNE Stock project, qua Pexels. Hãy yêu cầu đường ống của bạn “liệt kê mọi điều khoản loại trừ trong chính sách này” và xem kết quả trả về: một danh sách rõ ràng, tự tin gồm năm điều khoản loại trừ, được định dạng đẹp mắt, mỗi điều khoản đều có thật. Chính sách này có chín điều khoản. Không có gì trong câu trả lời gợi ý rằng bốn điều khoản bị thiếu, và người dùng không có lý do gì để kiểm tra lại một danh sách trông gọn gàng như vậy. Các câu hỏi liệt kê phá vỡ một giả định mà việc truy xuất được xây dựng dựa trên, đó là câu trả lời nằm ở đoạn văn đầu tiên. Ở đây, câu trả lời là mọi đoạn văn. Bài viết này là một phần của Phần III của Tình báo tài liệu doanh nghiệp, một loạt bài xây dựng hệ thống RAG cấp doanh nghiệp từ bốn khối: phân tích tài liệu, phân tích câu hỏi, truy xuất và tạo. Bài viết này xử lý các câu hỏi liệt kê: phát hiện, ba chiến lược tổng hợp và tín hiệu hoàn chỉnh cho biết khi nào danh sách kết thúc. Vị trí của bài viết này trong loạt bài: Bài 12 (liệt kê), trong Phần III – Hình ảnh của tác giả 📓 Phần bổ trợ có thể chạy được cho phép bạn tự mình thực hiện cả ba chiến lược: bạn kéo sáu danh mục GOVERN từ các phần tử con của toc_df, quét 31 mã GV.XX-NN bằng một biểu thức chính quy, sau đó xem list_via_semantic bắt được quy tắc chuẩn hóa thứ ba mà lần chạy đầu tiên đã bỏ lỡ khi tín hiệu số lượng cho biết ba. Trên GitHub: doc-intel/notebooks-vol1. Kho lưu trữ mã bổ trợ công khai tại doc-intel/notebooks-vol1 – Hình ảnh của tác giả Hầu hết các tiêu chuẩn RAG đo lường hiệu suất trên các câu hỏi tra cứu thực tế: “ngày hiệu lực là gì?”, “điểm BLEU là gì?”, “ai là người được bảo hiểm?”. Một câu hỏi, một đoạn văn, một câu trả lời. Đường ống truy xuất đoạn văn phù hợp, LLM (Large Language Model) trích xuất giá trị, hoàn tất. Một loại câu hỏi không phù hợp với hình dạng này: “Tất cả các danh mục con của GOVERN là gì?” “Tất cả các kỹ thuật chuẩn hóa được sử dụng để huấn luyện Transformer là gì?” “Tất cả các nghĩa vụ của người bán trong hợp đồng này là gì?” “Tất cả các điều kiện mà theo đó điều khoản này không áp dụng là gì?” Đây là những câu hỏi liệt kê. Câu trả lời không nằm trong một đoạn văn. Nó được phân phối trên toàn bộ tài liệu. Đường ống trả về các đoạn văn tương tự top-k bỏ lỡ các mục vì top-k không bao gồm toàn bộ danh sách. LLM đọc top-k tạo ra một câu trả lời trông có vẻ đầy đủ nhưng không phải, vì nó tự tin liệt kê những gì nó thấy và giữ im lặng về những gì nó không thấy. Bài viết này nói về việc xây dựng các đường ống xử lý rõ ràng các câu hỏi liệt kê. Hình dạng truy xuất khác, và kiểm tra tính đầy đủ cũng vậy. Chúng tôi thực hiện điều này trên Khung an ninh mạng NIST (công trình của Chính phủ Hoa Kỳ, thuộc phạm vi công cộng ở Hoa Kỳ, xem tuyên bố bản quyền của NIST) và bài báo Attention Is All You Need (Vaswani et al. 2017; giấy phép phân phối không độc quyền của arXiv, được công bố trên trang tóm tắt của arXiv). Các đường dẫn mã có thể chạy được gọi các dịch vụ của OpenAI được điều chỉnh bởi Điều khoản sử dụng của OpenAI. Cấu trúc và mẫu xác minh tính đầy đủ bằng cách xây dựng; ngữ nghĩa cần một vòng lặp lặp – Hình ảnh của tác giả Xử lý danh sách đòi hỏi khả năng nhận diện ở cấp độ phân tích cú pháp rằng hình thức câu hỏi là liệt kê, cùng với một đường dẫn truy xuất không phụ thuộc vào top-k. Đây là việc “khuếch đại chuyên gia” áp dụng cho một hình thức câu hỏi cụ thể: chuyên gia biết rằng lĩnh vực của họ có các danh sách giới hạn (các danh mục của GOVERN, các nghĩa vụ của người bán, các loại trừ của một chính sách) và một danh sách hoàn chỉnh trông như thế nào. Hệ thống thực thi các tín hiệu hoàn chỉnh; chuyên gia xác nhận kết quả. 1. Tại sao việc liệt kê làm hỏng RAG đơn giản 1.1 Lỗi thầm lặng: năm trong số sáu, hoàn toàn tự tin Lấy một câu hỏi liệt kê đơn giản về NIST CSF: “Tất cả các danh mục thuộc chức năng GOVERN là gì?” Câu trả lời đúng là một danh sách gồm sáu danh mục: Bối cảnh tổ chức (GV.OC), Chiến lược quản lý rủi ro (GV.RM), Vai trò, Trách nhiệm và Quyền hạn (GV.RR), Chính sách (GV.PO), Giám sát (GV.OV) và Quản lý rủi ro chuỗi cung ứng an ninh mạng (GV.SC). Sáu mục này xuất hiện: Trong Bảng 1 ở trang 20 (danh sách ngắn gọn các Chức năng và Danh mục). Trong Phụ lục A ở trang 21 đến 23 (mỗi danh mục có một tiểu mục riêng với các tiểu danh mục bên dưới). Một quy trình RAG đơn giản thực hiện điều này: Nhúng câu hỏi. Truy xuất 5 đoạn hàng đầu theo độ tương đồng. Gửi chúng đến LLM với một lời nhắc tạo. Những gì trả về từ truy xuất thường là phần giới thiệu về GOVERN (trang 17, danh sách mô tả danh mục theo dấu đầu dòng) cộng với một vài đoạn văn xung quanh nó. Điều đó đủ để LLM liệt kê bốn hoặc năm danh mục, nhưng nó có thể bỏ sót GV.SC nếu các đề cập về chuỗi cung ứng được nhóm lại trong một đoạn khác không nằm trong top-k. LLM sau đó tạo ra: “Các danh mục thuộc GOVERN là: Bối cảnh tổ chức, Chiến lược quản lý rủi ro, Vai trò và Trách nhiệm, Chính sách và Giám sát.” Năm trong số sáu. Trông giống như một câu trả lời hoàn chỉnh. Người dùng không có cách nào để biết rằng GV.SC bị thiếu trừ khi họ kiểm tra lại tài liệu. Lỗi này không phải là một sản phẩm của truy xuất top-k. Thử nghiệm Needle-in-a-Haystack (Kamradt, 2023, github.com/gkamradt/LLMTest_NeedleInAHaystack) đo lường một kim, một đống cỏ khô, một câu nguyên văn để tìm. Các mô hình tiên tiến đạt điểm gần như hoàn hảo với ngữ cảnh dài, điều này là thực tế và hữu ích. Một câu hỏi liệt kê là sáu kim, rải rác khắp kho tài liệu, không có cái nào nguyên văn vì mỗi mục được đặt tên khác nhau ở những nơi khác nhau (Quản lý rủi ro chuỗi cung ứng an ninh mạng trong mục lục, GV.SC trong phụ lục, rủi ro bên thứ ba trong phần nội dung). Thử nghiệm không kiểm tra hình thức đó. Các mô hình chỉ có ngữ cảnh dài gặp phải bức tường tương tự như top-k đơn giản: chúng trả về bốn hoặc năm, bỏ sót cái được diễn đạt khác, và trình bày danh sách bị cắt cụt với sự tự tin hoàn toàn. Các mô hình ngữ cảnh dài và top-k thất bại ở đây vì cùng một lý do.

Nguồn tin: Towards Data Science — Tác giả: angela shi. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.