Bỏ qua tới nội dung chính
Quay lại tin tức

Văn bản OCR cũ làm suy yếu quá trình huấn luyện mô hình ngôn ngữ, và FineBooks mong muốn khắc phục vấn đề này trên quy mô lớn.

The Decoder· Matthias Bastian· 10/8/2026general

Dự án FineBooks của Hugging Face và EleutherAI đã thử nghiệm 14 mô hình nhận dạng ký tự quang học (OCR) mã nguồn mở trên hơn 2.000 trang sách lịch sử. Mô hình hàng đầu, dots.mocr, đạt độ chính xác ký tự 97,6% với chi phí dưới 2 USD cho mỗi nghìn trang. Nhóm nghiên cứu cho biết, mức độ này đủ tốt cho dữ liệu huấn luyện AI, nhưng chưa đủ cho việc phiên âm học thuật. Bài viết "Văn bản OCR cũ làm suy yếu quá trình huấn luyện mô hình ngôn ngữ, và FineBooks muốn khắc phục điều đó ở quy mô lớn" xuất hiện lần đầu trên The Decoder.

AI trong thực tiễn Văn bản OCR cũ làm suy yếu quá trình huấn luyện mô hình ngôn ngữ, và FineBooks muốn khắc phục điều này trên quy mô lớn. Matthias Bastian Ngày 10/8/2026 Các điểm chính Dự án FineBooks, một sự hợp tác giữa Hugging Face và EleutherAI, đã đánh giá 14 mô hình OCR mã nguồn mở trên hơn 2.000 trang sách lịch sử để đánh giá mức độ chúng có thể chuyển đổi văn bản được quét thành dữ liệu huấn luyện sạch cho các mô hình ngôn ngữ AI. Các mô hình nhỏ hơn thường vượt trội hơn các mô hình lớn hơn, với mô hình hoạt động tốt nhất đạt độ chính xác ký tự trên 97% với chi phí dưới hai đô la Mỹ cho mỗi nghìn trang. Mặc dù các nhà nghiên cứu coi chất lượng đầu ra là đủ cho mục đích huấn luyện AI, họ lưu ý rằng các mô hình vẫn còn quá nhiều lỗi để sử dụng trong các ứng dụng học thuật hoặc khoa học. Dự án FineBooks từ Hugging Face và EleutherAI đã thử nghiệm 14 mô hình OCR mã nguồn mở trên hơn 2.000 trang sách lịch sử. Các mô hình tốt nhất đã tạo ra văn bản đủ tốt để huấn luyện AI, nhưng chúng chưa sẵn sàng cho mục đích sử dụng học thuật. Huấn luyện các mô hình ngôn ngữ AI mã nguồn mở trên sách thuộc phạm vi công cộng đồng nghĩa với việc phải xử lý văn bản kém chất lượng. Các thư viện đã trích xuất những văn bản đó từ các bản quét nhiều năm trước bằng cách sử dụng nhận dạng ký tự quang học (OCR), và kết quả thường đầy lỗi. Dự án Talkie đã đưa ra con số về thiệt hại tiềm tàng: một mô hình ngôn ngữ được huấn luyện trên văn bản OCR chỉ học được với hiệu suất 30% so với mô hình được huấn luyện trên bản chép tay của con người từ cùng một cuốn sách. FineBooks, một sự hợp tác giữa Hugging Face và EleutherAI, đã thử nghiệm xem liệu các mô hình OCR mã nguồn mở hiện tại có thể giải quyết vấn đề này hay không. Nhóm đã chạy 14 mô hình mã nguồn mở trên 2.165 trang sách lịch sử và công bố kết quả dưới dạng bảng xếp hạng. Các mô hình tốt nhất đạt độ chính xác ký tự trên 97% với chi phí dưới hai đô la cho mỗi nghìn trang. Ba trong số 2.165 trang dữ liệu gốc: một văn bản lịch sử tự nhiên tiếng Anh một cột, một bảng mục lục đa ngôn ngữ và một trang minh họa mà toàn bộ bản chép chỉ là một dòng ghi công nghệ sĩ. | Ảnh: FineBooks / Biodiversity Heritage Library Hàng triệu trang thuộc phạm vi công cộng cần nhận dạng văn bản tốt hơn Khi EleutherAI và các đối tác phát hành Common Pile vào năm ngoái, kho dữ liệu huấn luyện có giấy phép mở lớn nhất cho đến nay, nó chứa khoảng 300.000 cuốn sách thuộc phạm vi công cộng với văn bản từ các lần chạy OCR cũ hơn. Các tác giả của FineBooks cho biết việc xử lý lại những cuốn sách đó bằng các mô hình tốt hơn là một trong những cách hiệu quả nhất để cải thiện các bộ dữ liệu huấn luyện AI mở. Dự án đã chọn Thư viện Di sản Đa dạng Sinh học (BHL) làm mục tiêu đầu tiên, nơi lưu giữ hơn 300.000 tài liệu lịch sử tự nhiên được số hóa với tổng cộng hơn 64 triệu trang. BHL cung cấp bộ sưu tập của mình dưới dạng tải xuống hàng loạt qua AWS. Việc đo lường chất lượng OCR yêu cầu các trang có bản chép đúng đã biết. Nhóm đã sử dụng công trình từ dự án IMPACT và BHL-Europe: từ năm 2011 đến 2012, các chuyên gia đã chép sáu tập BHL bằng tiếng Anh, tiếng Pháp, tiếng Đức và tiếng Latinh với tỷ lệ lỗi khoảng một ký tự trên 2.000. Dữ liệu đó có sẵn theo giấy phép CC-BY trong kho lưu trữ GitHub và tạo thành cơ sở của bộ dữ liệu gốc mới. Các mô hình nhỏ đánh bại các đối thủ lớn hơn. Tất cả 14 mô hình đều được cung cấp miễn phí và chạy trên phần cứng cục bộ mà không cần khóa API. Chỉ số được sử dụng là Tỷ lệ lỗi ký tự (CER), thể hiện tỷ lệ các ký tự được nhận dạng sai. Bảng xếp hạng chia kết quả thành hai biến thể: "ngoại giao" (diplomatic) tính việc hiện đại hóa các ký tự cổ như chữ "s" dài (ſ) là lỗi, và biến thể "đọc" (reading) chấp nhận những thay đổi như vậy. Mô hình dẫn đầu dots.mocr chỉ sử dụng 3 tỷ tham số, trong khi Qwen3.5-9B có điểm số thấp hơn dù lớn gần gấp ba lần. OvisOCR2 đứng thứ hai với chỉ 0,9 tỷ tham số, chi phí 46 cent cho mỗi nghìn trang. Kích thước mô hình và chất lượng OCR không tương quan đối với các tài liệu lịch sử. **DEC_D_Incontent-2** | Mô hình | Kích thước | Độ chính xác | Chi phí/1.000 trang | | :---------------- | :-------- | :----------- | :------------------ | | dots.mocr | 3B | 97,6% | 1,94 USD | | OvisOCR2 | 0,9B | 96,9% | 0,46 USD | | PaddleOCR-VL-1.6 | 1B | 96,1% | 0,34 USD | | olmOCR-2 | 8,3B | 95,7% | 0,45 USD | | LightOnOCR-2 | 1B | 95,1% | 0,37 USD | | Qwen3.5-9B | 9,7B | 94,9% | 0,89 USD | | DeepSeek-OCR | 3,3B | 93,8% | 0,37 USD | Đánh giá chỉ bao gồm các kiểu chữ Antiqua trong bốn ngôn ngữ. Nó không tính đến kiểu chữ Fraktur, các chữ viết phi Latinh hoặc chữ viết tay, và FineBooks chỉ giới hạn ở các trang sách một cột. Nhóm nghiên cứu có kế hoạch xử lý lại khoảng 200.000 tài liệu BHL thuộc phạm vi công cộng bằng một trong các mô hình hàng đầu và phát hành văn bản dưới dạng tập dữ liệu mở. Các mô hình mới được thêm vào bảng xếp hạng liên tục và khuôn khổ đánh giá được cung cấp công khai. **Đủ tốt cho đào tạo AI, quá thiếu chính xác cho nghiên cứu học thuật** Các tác giả của FineBooks đánh giá kết quả dựa trên mục đích sử dụng. Đối với việc đào tạo các mô hình ngôn ngữ, các mô hình hàng đầu hoạt động đủ tốt, họ viết. Các mô hình tạo ra ít lỗi hơn nhiều so với các quy trình cũ, và việc xử lý lại một bộ sưu tập có quy mô như BHL là khả thi với chi phí đã đo lường. Các thư viện phải đối mặt với một vấn đề khác, nhóm nghiên cứu lưu ý. Hệ thống của họ dựa vào ALTO XML, một định dạng với tọa độ cấp độ từ. Các mô hình mới xuất ra Markdown hoặc văn bản thuần túy mà không có vị trí từ, do đó chúng không thể tích hợp vào cơ sở hạ tầng thư viện hiện có. Đối với các bản chép học thuật, độ chính xác vẫn còn thiếu sót, nhưng không phải vì các mô hình đọc sai ký tự. Chúng tự động hiện đại hóa chúng một cách âm thầm, thay thế chữ "s" dài hoặc các chữ ghép bằng các ký tự hiện đại tương đương. Nhóm nghiên cứu cho biết, việc tinh chỉnh có mục tiêu có thể khắc phục điều này. **Nguồn:** Hugging Face

Nguồn tin: The Decoder — Tác giả: Matthias Bastian. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.