Bỏ qua tới nội dung chính
Quay lại tin tức

Trước khi triển khai RAG tác nhân hoàn chỉnh: Nắm rõ cách bạn đưa ra quyết định và các phương pháp phân tích cú pháp bạn lựa chọn

Towards Data Science· angela shi· 12/8/2026general

Enterprise Document Intelligence [Tập 1 #5nonies] - Bản chất, lập kế hoạch, thực thi, tổng hợp: hoàn thành giai đoạn đầu với một bộ điều phối đọc bản chất của từng tệp PDF và chọn phương pháp phù hợp, bao gồm fitz, Docling, PaddleOCR, EasyOCR, MinerU hoặc Surya, sau đó tổng hợp các kết quả đầu ra thành một kho dữ liệu. Bài viết Trước khi có RAG hoàn toàn tự chủ: Hãy biết cách bạn quyết định và các phương pháp phân tích cú pháp bạn chọn đã xuất hiện lần đầu trên Towards Data Science.

Mô hình ngôn ngữ lớn Trước RAG (Retrieval Augmented Generation) hoàn toàn tự chủ: Nắm rõ cách bạn đưa ra quyết định và các phương pháp phân tích bạn lựa chọn Tình báo tài liệu doanh nghiệp [Tập 1 #5nonies] – Bản chất, lập kế hoạch, thực thi, tổng hợp: hoàn thành khối kiến thức đầu tiên với một bộ điều phối đọc bản chất của từng tệp PDF và chọn phương pháp phù hợp (fitz, fitz, Docling, PaddleOCR, EasyOCR, MinerU hoặc Surya), sau đó tổng hợp các kết quả đầu ra thành một kho dữ liệu duy nhất. angela shi Ngày 12/8/2026 15 phút đọc Ảnh của Caleb Oquendo, qua Pexels. Các kỹ sư AI ngày nay nói nhiều về AI tự chủ (agentic AI), và nguyên tắc rất đơn giản: để mô hình tự quyết định. Đối với một trợ lý đa năng, điều đó là chấp nhận được: để tác nhân thử nghiệm, quan sát những gì nó thực hiện. Đối với một quy trình RAG doanh nghiệp, điều đó rất nguy hiểm. Các câu trả lời cung cấp thông tin cho các quyết định thực tế, vì vậy chúng ta phải nắm rõ từng bước và kiểm soát luồng giữa các bước. Bài viết này áp dụng quan điểm đó vào bước mà việc "để mô hình tự quyết định" là hấp dẫn nhất: chọn phương pháp phân tích phù hợp cho từng tài liệu. Chúng tôi xây dựng lựa chọn đó như một bộ điều phối mà chúng tôi kiểm soát. Nó đọc bản chất của tệp PDF, lập kế hoạch các phương pháp phù hợp, thực thi chúng theo thứ tự và tổng hợp mọi kết quả đầu ra thành một kho dữ liệu được làm giàu duy nhất để truy xuất, tạo và đánh giá. Mỗi quyết định đều rõ ràng và được ghi lại, vì vậy kế hoạch có thể được đọc và kiểm tra trước khi bất kỳ điều gì được thực thi. Bài viết này mở rộng khối phân tích tài liệu của Tình báo tài liệu doanh nghiệp, chuỗi bài xây dựng một hệ thống RAG doanh nghiệp từ bốn khối kiến thức. Nó hoàn thành khối kiến thức đó bằng cách kết hợp các phương pháp mà chuỗi bài đã xây dựng từng bước một: fitz cho lớp văn bản, Azure Document Intelligence và Docling cho bảng biểu, một LLM thị giác cho biểu đồ và sơ đồ, EasyOCR cho các trang không có lớp văn bản, chú thích hình ảnh cho những gì quy trình sẽ bỏ qua, và hai cách khôi phục mục lục, từ mục lục in sẵn hoặc chỉ từ kiểu chữ trong nội dung. 🧭 Mới bắt đầu chuỗi bài? Hãy bắt đầu với bản đồ: Prompt, Context, Loop trình bày ba lớp kỹ thuật mà mọi hệ thống RAG được xây dựng trên đó, prompt (lời gọi), context (những gì lấp đầy cửa sổ của mô hình), loop (khi lời gọi tiếp theo được kích hoạt và khi nó dừng lại), và xem xét toàn bộ chuỗi bài qua lăng kính đó, từng bài viết một. Đây là cách ngắn nhất để xem những gì được đề cập và vị trí của bài viết này. Vị trí của bài viết này: nó hoàn thành khối kiến thức đầu tiên bằng cách kết hợp mọi phương pháp phân tích mà các bài viết trước đã giới thiệu – Hình ảnh của tác giả 📓 Sổ tay thực thi chạy parse_pdf_agentic() trên bài báo về sự chú ý (data/paper/1706.03762v7.pdf), in ra bản chất được phát hiện, kế hoạch bốn bước mà bộ điều phối đã tạo ra và từ điển kho dữ liệu đã hợp nhất với một toc_df 15 hàng gốc và một line_df 1048 hàng: doc-intel/notebooks-vol1. 1. Tại sao có dấu ngoặc kép cho từ “agentic” Mọi nhà cung cấp RAG hiện nay đều gắn nhãn vòng lặp phân tích tài liệu của họ là tự chủ (agentic). Mở mã nguồn ra và hầu như luôn là cùng một thứ: một bộ điều phối dựa trên quy tắc đọc một vài tín hiệu tệp, chọn một kế hoạch phương pháp theo thứ tự, chạy từng phương pháp theo trình tự và tổng hợp các kết quả đầu ra. Các LLM nằm bên trong các thành phần riêng lẻ (một vòng lặp xác thực tiêu đề, một trình đọc thị giác trên hình ảnh, một bộ xử lý hậu kỳ OCR). Không có LLM nào ở lớp điều phối quyết định điều gì sẽ chạy tiếp theo. Không có vòng phản hồi nào mà một tác nhân quan sát kết quả đầu ra và lập kế hoạch lại. Đó chính xác là những gì bộ điều phối trong bài viết này thực hiện. Vì vậy, gọi nó là tự chủ là một sự phóng đại, và gọi nó là tự chủ mà không có dấu ngoặc kép sẽ là bán cùng một sự thổi phồng từ ngữ mà phần còn lại của thị trường đang bán. Dấu ngoặc kép vẫn được giữ nguyên. Bức tranh chân thực, theo từng chức năng: detect_document_nature(pdf_path): sáu cờ xác định được đọc từ line_df / span_df. is_scanned (đã quét), has_native_outline (có dàn ý gốc), has_sommaire (có mục lục), is_composite (là tổng hợp), has_rich_figures (có hình ảnh phong phú), has_tables_signal (có tín hiệu bảng). Docstring (chuỗi tài liệu) nêu rõ: “xác định; không có LLM”. plan_parsing_methods(nature): mã Python thuần túy if / elif dựa trên nhãn nature (bản chất). Mỗi nhánh trả về một danh sách MethodStep (bước phương pháp) được mã hóa cứng theo thứ tự. Không có LLM. parse_pdf_agentic(pdf_path, llm_parse=…): lặp qua kế hoạch và gọi một bộ điều hợp cho mỗi phương pháp. Đối số llm_parse kwarg được chuyển tiếp đến các phương pháp sử dụng nó (vòng lặp cấu trúc nội dung, trình đọc tầm nhìn tương lai). Bản thân bộ điều phối không thực hiện cuộc gọi LLM nào. synthesize_parsing_outputs(step_outputs): Hợp nhất DataFrame cộng với một thuật toán _pick_richer (chọn phong phú hơn). Không có LLM. Những gì phân tích tác nhân thực sự sẽ bổ sung: một LLM đọc đầu ra của từng phương pháp, quyết định liệu tập dữ liệu đã hoàn thành hay một phương pháp đáng để chạy lại với các tham số khác, và thêm hoặc bỏ các phương pháp khỏi kế hoạch một cách linh hoạt. Sử dụng công cụ theo nghĩa ReAct. Các vòng lặp phản hồi. Điều đó thuộc về Tập 3 (Agentic Bricks - Các khối tác nhân) của loạt bài, nơi mỗi khối có một trình bao tác nhân quan sát, lập kế hoạch và hành động. Bài viết này dừng lại một bước trước đó. Vì vậy, bài viết này xây dựng phiên bản chân thực của mô hình mà mọi người ngày nay gọi là tác nhân: định tuyến dựa trên quy tắc cộng với các lá LLM. Nó đủ để đóng khối phân tích bằng một lệnh gọi parse_pdf_agentic(path) duy nhất trả về một tập dữ liệu được làm giàu. Tập 3 sẽ bổ sung tác nhân thực sự lên trên. 2. Tài liệu chúng ta muốn sử dụng tối đa Hãy nghĩ về những tài liệu mà một phương pháp phân tích duy nhất không bao giờ đủ: một hợp đồng 200 trang với các bảng tỷ lệ, một báo cáo hàng quý đầy biểu đồ và chú thích, một đơn xin tài trợ, một bằng sáng chế, một bài báo NIPS dày đặc với các phương trình và bảng kết quả. Mỗi loại đều đánh bại một trình phân tích khác nhau. Fitz lấy được văn bản nhưng bỏ lỡ các ô bảng. Docling lấy được các bảng nhưng dàn ý chỉ sâu hai cấp. Azure Layout mạnh về cả hai nhưng không có kích thước phông chữ. Mistral OCR trả về markdown miễn phí nhưng chỉ khi bạn chạy nó trên một trang đã quét. Nhóm cần mỗi công cụ này trên các tài liệu khác nhau, đôi khi trên các trang khác nhau của cùng một tài liệu. Phản xạ mà loạt bài đã xây dựng trong tám bài viết là một phương pháp cho mỗi vấn đề. Phản xạ đó đúng ở cấp độ cá nhân và nó không mở rộng quy mô cho tài liệu. Một người gọi sản xuất không muốn viết một câu lệnh switch (chuyển đổi) trên các trình phân tích. Họ muốn gọi một hàm và nhận lại một từ điển tập dữ liệu được điền đầy đủ đến mức mà

Nguồn tin: Towards Data Science — Tác giả: angela shi. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.