Datalab đã công bố OmniExtractBench, một bộ tiêu chuẩn mở để trích xuất tài liệu có cấu trúc. Bộ tiêu chuẩn này kiểm tra độ chính xác của một hệ thống trong việc điền dữ liệu vào một lược đồ JSON từ tệp PDF. OmniExtractBench tổng hợp 620 tài liệu từ 4 bộ tiêu chuẩn hiện có. Một công cụ chấm điểm xác định sẽ đánh giá tất cả các tài liệu này và giải thích từng quyết định.
Việc công bố bộ tiêu chuẩn này diễn ra trong bối cảnh các nhà cung cấp giải pháp trích xuất đang công bố bảng xếp hạng riêng của họ. Datalab lập luận rằng các bảng xếp hạng đó khó so sánh hoặc kiểm định. OmniExtractBench là nỗ lực của Datalab nhằm tạo ra một thước đo chung.
Về khả năng triển khai, công cụ chấm điểm có thể được cài đặt từ PyPI với tên omni-extract-bench (phiên bản 0.1.7, Python 3.11+, chỉ yêu cầu SciPy).
Datalab đã phát hành OmniExtractBench, một bộ tiêu chuẩn mở để trích xuất tài liệu có cấu trúc. Bộ tiêu chuẩn này kiểm tra độ chính xác của một hệ thống khi điền vào một lược đồ JSON từ tệp PDF. OmniExtractBench tổng hợp 620 tài liệu từ 4 bộ tiêu chuẩn hiện có. Một công cụ chấm điểm xác định sẽ đánh giá tất cả các tài liệu và giải thích từng quyết định.
Việc phát hành này diễn ra trong bối cảnh các nhà cung cấp giải pháp trích xuất đang công bố bảng xếp hạng riêng của họ. Datalab lập luận rằng các bảng xếp hạng đó khó so sánh hoặc kiểm tra. OmniExtractBench là nỗ lực của Datalab nhằm tạo ra một thước đo chung.
Liệu nó có thể triển khai được không? Có, công cụ chấm điểm có thể cài đặt từ PyPI dưới tên omni-extract-bench (phiên bản 0.1.7, Python 3.11+, chỉ SciPy) theo giấy phép Apache 2.0. Để chạy lại các nhà cung cấp, người dùng cần có khóa API và tín dụng trả phí riêng.
OmniExtractBench là gì?
OmniExtractBench là một bộ tiêu chuẩn trích xuất có cấu trúc do Datalab xây dựng. Mỗi tác vụ cung cấp cho hệ thống một tệp PDF và một lược đồ JSON. Hệ thống trả về JSON, sau đó được chấm điểm từng giá trị so với tệp vàng (gold file). Mã nguồn có trên GitHub và dữ liệu có trên Hugging Face theo giấy phép CC BY 4.0.
4 lỗi mà nó nhắm đến
Bài đăng ra mắt của Datalab nêu ra 4 vấn đề thường gặp với các bộ tiêu chuẩn trích xuất hiện có:
Thiên vị: tài liệu và cách chấm điểm có thể ưu ái nhà cung cấp đã xây dựng bộ tiêu chuẩn.
Hệ thống kiểm tra không rõ ràng: điểm thấp có thể phản ánh một hệ thống kiểm tra bị lỗi, chứ không phải một mô hình yếu kém.
Chấm điểm không minh bạch: người đọc không thể biết tại sao một tài liệu cụ thể lại có điểm thấp.
Đa dạng tài liệu hạn chế: một số bộ chỉ chứa các bảng dày đặc, số khác chỉ chứa các tệp sạch, không được quét.
620 tài liệu đến từ đâu
| Bộ tiêu chuẩn | Tài liệu | Nhà xuất bản gốc | Nội dung |
| :------------------ | :------- | :-------------------------- | :---------------------------------------- |
| ExtractBench | 329 | LlamaIndex | Biểu mẫu, hồ sơ, bản trình bày |
| Internal | 202 | Datalab (tổng hợp) | Lược đồ vô hướng dày đặc, tài liệu nhỏ |
| LongExtractBench | 47 | micro1 (được Reducto ủy quyền) | Bảng rất lớn |
| LongArray-Extract | 42 | Extend | Bảng lớn với các giá trị vô hướng lặp lại |
Các biểu mẫu hồ sơ quy định là danh mục lớn nhất, với 88 tài liệu. 128 tài liệu chỉ có một trang. Ở chiều ngược lại, 33 tài liệu trên 100 trang chiếm 40% tổng số trang. Bộ tổng hợp của Datalab chiếm tỷ lệ lớn thứ hai.
Cách công cụ chấm điểm hoạt động
Công cụ chấm điểm làm phẳng dự đoán và JSON vàng thành các địa chỉ, là các đường dẫn đến các giá trị đơn lẻ. Nó chuẩn hóa từng giá trị trước tiên, để "03/31/2024" khớp với "2024-03-31".
Bảng là phần khó. Khi so sánh theo vị trí, một hàng bị bỏ sót sẽ làm lệch mọi hàng sau đó. Chúng tôi đã chạy lại công cụ chấm điểm trên một bảng 100 hàng bị thiếu hàng đầu tiên. So sánh theo vị trí đạt 0%, trong khi OmniExtractBench đạt 99%.
Giải pháp là ghép nối dựa trên nội dung bằng thuật toán Hungarian. ExtractBench và LongArray-Extract đã căn chỉnh các hàng theo cách này. OmniExtractBench bổ sung một lớp phán quyết lên trên.
6 phán quyết cho mỗi giá trị
matched (khớp): được ghép nối và các giá trị trùng khớp.
misread (đọc sai): được ghép nối nhưng các giá trị khác nhau.
unfound (không tìm thấy): tệp vàng có giá trị, dự đoán không có.
fabricated (bịa đặt): lược đồ cho phép, tệp vàng không đề cập, dự đoán điền vào.
invented_item (mục bịa đặt): một phần của hàng được dự đoán không ghép nối với bất kỳ thứ gì.
invented_field (trường bịa đặt): một địa chỉ mà lược đồ chưa bao giờ khai báo.
Độ chính xác (Accuracy) là số giá trị khớp trên tổng số phán quyết. Độ chính xác (Precision) chia số giá trị khớp cho số giá trị được dự đoán. Độ thu hồi (Recall) chia chúng cho số giá trị vàng. Các quy tắc đầy đủ có trong đặc tả số liệu.
Quy tắc rỗng
Các chuỗi rỗng, None và khoảng trắng được tính là bỏ sót, do đó các địa chỉ đó bị loại bỏ. Các chuỗi như "NA" hoặc "-" vẫn là câu trả lời thực. Điều này ngăn chặn một lỗ hổng khai thác thầm lặng: thêm các trường tùy chọn rỗng vào lược đồ để đạt được các kết quả khớp miễn phí. Trong thử nghiệm của chúng tôi, các trường rỗng được thêm vào không tạo ra phán quyết nào.
So sánh với các bộ tiêu chuẩn trích xuất khác
**Bảng so sánh các tiêu chuẩn đánh giá**
| Tiêu chuẩn đánh giá | Nhà phát hành | Số lượng tài liệu | Căn chỉnh hàng | Giải thích theo giá trị | Giấy phép chấm điểm | Giấy phép dữ liệu |
|---|---|---|---|---|---|---|
| OmniExtractBench | Datalab | 620, từ 4 nguồn | Tiếng Hungary, theo nội dung | Có, 6 loại phán quyết | Apache 2.0 | CC BY 4.0 |
| ExtractBench | LlamaIndex | 370 | Tiếng Hungary | Khác biệt từng trường, báo cáo HTML | Apache 2.0 | Apache 2.0 |
| LongArray-Extract | Extend | 45, tổng hợp | Tiếng Hungary | Điểm từng tài liệu | Không nêu | CC BY 4.0 |
| LongExtractBench | micro | 1225, trong đó 50 công khai | Theo khóa hàng | Không nêu | MIT | CC BY 4.0, chỉ nhãn |
Các nguồn được liên kết trên mỗi tên tiêu chuẩn đánh giá. Đã kiểm tra ngày 27/9/2026.
**Hệ thống nào bỏ sót trường và hệ thống nào tạo ra giá trị**
Datalab đã chấm điểm 10 cấu hình hệ thống trên toàn bộ tập dữ liệu. Chế độ chính xác của Datalab dẫn đầu với độ chính xác 93,85%. Chế độ cân bằng của Datalab (93,48%) và Reducto deep_extract v2 (93,47%) có kết quả gần như tương đương. Độ chính xác (precision) và độ thu hồi (recall) sau đó cho thấy cách mỗi hệ thống gặp lỗi.
**Cân bằng:** Datalab (cả hai chế độ) và Reducto duy trì độ chính xác và độ thu hồi trong phạm vi 0,6 điểm.
**Thiên về bỏ sót:** GPT 5.6-sol đạt độ chính xác 95,11% nhưng độ thu hồi chỉ 84,99%. Hệ thống này mất 11,88% do không tìm thấy giá trị. Gemini và Claude cũng cho thấy mô hình tương tự, nhưng ít rõ rệt hơn.
**Thiên về tạo ra giá trị:** LlamaExtract có độ thu hồi 93,13% nhưng độ chính xác 86,57%, mất 9,03% do các giá trị bị tạo ra. Extend mất 4,01% do các mục được tạo ra.
**Thấp ở cả hai chỉ số:** Mistral OCR 4.1 và Azure Content Understanding đều tụt hậu ở cả hai chỉ số, với độ thu hồi thấp hơn nữa.
Cách mỗi hệ thống không đạt 100%, theo loại phán quyết. Nguồn: Datalab.
**Tự chạy thử**
Sao chép mã đã sao chép. Sử dụng trình duyệt khác.
```
uv pip install omni-extract-bench
oeb score --pred pred.json --gt gold.json --schema schema.json --verdicts
```
Cài đặt tiện ích mở rộng [benchmark] và chạy `oeb benchmark` để chạy lại các nhà cung cấp. Các lần chạy có thể tiếp tục, và mỗi nhà cung cấp cần thông tin xác thực riêng. Datalab cũng đề xuất thử nghiệm sân chơi của họ trên các tài liệu của riêng bạn.
**Những điểm chính**
OmniExtractBench tổng hợp 620 tài liệu từ các bộ LlamaIndex, micro1, Extend và Datalab.
Một công cụ chấm điểm xác định đưa ra 1 trong 6 phán quyết có thể kiểm toán cho mỗi giá trị.
Việc ghép hàng dựa trên nội dung ngăn chặn việc một hàng bị bỏ sót làm cho toàn bộ bảng bị chấm điểm 0.
Việc bỏ qua các địa chỉ rỗng ngăn chặn việc thêm các trường không cần thiết vào lược đồ làm tăng điểm số.
Datalab chế độ chính xác dẫn đầu với 93,85%; Datalab chế độ cân bằng và Reducto đạt gần 93,5%.
**Câu hỏi thường gặp**
OmniExtractBench đo lường điều gì? Tiêu chuẩn này đo lường mức độ chính xác của một hệ thống trong việc trích xuất các giá trị từ tệp PDF vào một lược đồ JSON, được chấm điểm theo từng giá trị.
OmniExtractBench có phải là mã nguồn mở không? Có. Công cụ chấm điểm là Apache 2.0 trên GitHub và PyPI. Tập dữ liệu là CC BY 4.0 trên Hugging Face.
Ai đã xây dựng OmniExtractBench? Datalab đã xây dựng tiêu chuẩn này. Datalab cũng duy trì các công cụ tài liệu mã nguồn mở Marker và Surya.
Nguồn tin: MarkTechPost — Tác giả: Asif Razzaq. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.