Cách thức hoạt động của Baidu Unlimited-OCR: Giải pháp chuyển đổi văn bản tài liệu dài
Khoảng một tháng trước, Baidu (thường được gọi là “Google của Trung Quốc”) đã giới thiệu Unlimited-OCR, một bước tiến vượt trội so với DeepSeek OCR. Mô hình này được thiết kế để phiên âm các tài liệu dài, nhiều trang với độ chính xác cao, đồng thời mang lại khả năng suy luận nhanh chóng và ổn định. Không giống như các hệ thống OCR thị giác-ngôn ngữ thông thường, Unlimited-OCR giải quyết một nút thắt lớn trong việc phiên âm tài liệu dài: bộ nhớ đệm Key-Value (KV) tăng nhanh chóng mặt, [...] Bài viết How Baidu Unlimited-OCR Works: Solving Long-Document Transcription xuất hiện lần đầu trên Analytics Vidhya.
Unlimited-OCR được giải thích: Cách Baidu giải quyết AI tài liệu dài
Hội nghị AI tương lai nhất của Ấn Độ đã trở lại – Lớn hơn, sắc nét hơn, táo bạo hơn
d : h : m : s
Nhận thông tin chi tiết
Các khóa học miễn phí
Các khóa học miễn phí
Lộ trình học tập
Chương trình tăng tốc
Chương trình tăng tốc
Mới
Chương trình GenAI Pinnacle
GenAI Pinnacle Plus
Agentic AI Pioneer
Mới
DeepSeek
Hội nghị thượng đỉnh DataHack 2025
DHS 2026
Các khóa học miễn phí
Đăng nhập
Chuyển chế độ
Đăng xuất
Chuẩn bị phỏng vấn
Sự nghiệp
GenAI
Kỹ thuật nhắc lệnh (Prompt Engg)
ChatGPT
LLM
Langchain
RAG
AI Agents
Học máy (Machine Learning)
Học sâu (Deep Learning)
Công cụ GenAI
LLMOps
Python
NLP
SQL
Dự án AIML
Danh sách đọc
Lộ trình học tập của nhà phân tích dữ liệu
Cách trở thành nhà phân tích dữ liệu vào năm 2025: Lộ trình hoàn chỉnh
Lộ trình học tập Tableau
Lộ trình học tập toàn diện về Tableau vào năm 2025
Lộ trình học tập NLP
Lộ trình học tập NLP toàn diện 2025
Lộ trình học tập của nhà khoa học dữ liệu
Lộ trình học tập để trở thành nhà khoa học dữ liệu vào năm 2025
Lộ trình học tập của kỹ sư dữ liệu
Lộ trình từng bước để trở thành kỹ sư dữ liệu vào năm 2025
Lộ trình học tập MLOps
Lộ trình học tập MLOps toàn diện: Phiên bản 2025
Lộ trình học tập của kỹ sư AI
Lộ trình để trở thành kỹ sư AI vào năm 2025
Lộ trình học tập thị giác máy tính (Computer Vision)
Lộ trình học tập toàn diện để thành thạo thị giác máy tính vào năm 2025
Lộ trình học tập AI tạo sinh (Generative AI)
Lộ trình tốt nhất để học AI tạo sinh vào năm 2025
Lộ trình AI tạo sinh cho doanh nghiệp
Lộ trình GenAI cho doanh nghiệp
Lộ trình LLM
Các mô hình ngôn ngữ lớn được giải mã: Lộ trình dành cho người mới bắt đầu
Lộ trình kỹ sư nhắc lệnh (Prompt Engineer)
Lộ trình học tập để trở thành chuyên gia kỹ thuật nhắc lệnh
Trang chủ
Thị giác máy tính
Cách Baidu Unlimited-OCR hoạt động: Giải quyết việc chuyển đổi tài liệu dài
Cách Baidu Unlimited-OCR hoạt động: Giải quyết việc chuyển đổi tài liệu dài
Shaik Hamzah Shareef
Cập nhật lần cuối: 13 tháng 8 năm 2026
9 phút đọc
Khoảng một tháng trước, Baidu (thường được gọi là “Google của Trung Quốc”) đã giới thiệu Unlimited-OCR, một cải tiến so với DeepSeek OCR. Mô hình này được thiết kế để chuyển đổi các tài liệu dài, nhiều trang với độ chính xác cao, đồng thời mang lại khả năng suy luận nhanh và ổn định.
Không giống như các hệ thống OCR thị giác-ngôn ngữ thông thường, Unlimited-OCR giải quyết một nút thắt lớn trong việc chuyển đổi tài liệu dài: bộ nhớ đệm Key-Value (KV) đang phát triển nhanh chóng, với mức sử dụng bộ nhớ tăng lên khi tạo ra nhiều token đầu ra hơn. Trong bài viết này, chúng tôi sẽ xem xét cách Unlimited-OCR của Baidu cải thiện hiệu quả và khả năng mở rộng cho các tác vụ OCR tài liệu dài.
Mục lục
Cách các mô hình thị giác-ngôn ngữ đọc một trang
Vấn đề token hai mặt
Cách DeepSeek OCR giải quyết phía đầu vào
Cách Baidu giải quyết phía đầu ra
Hiểu về bộ nhớ đệm KV
Một phép tương tự đơn giản
Cơ chế chú ý cửa sổ trượt tham chiếu (R-SWA)
Chạy Unlimited-OCR
Chạy với vLLM
Kết luận
Các câu hỏi thường gặp
Cách các mô hình thị giác-ngôn ngữ đọc một trang
Biểu diễn bản vá token hình ảnh
Không giống các hệ thống OCR truyền thống, các Mô hình Ngôn ngữ-Thị giác (Vision-Language Models - VLM) không đọc trực tiếp các điểm ảnh thô. Thay vào đó, mỗi trang tài liệu được chia thành một lưới các vùng vuông nhỏ, gọi là các "patch". Mỗi patch được chuyển đổi thành một nhúng số (numerical embedding) và được coi là một mã thông báo thị giác (visual token), tương tự như cách các từ được chuyển đổi thành mã thông báo văn bản (text token) bên trong một mô hình ngôn ngữ.
Kết quả là, toàn bộ một trang tài liệu trở thành một chuỗi các mã thông báo thị giác mà mô hình transformer có thể xử lý.
Hãy hình dung việc đọc một tờ báo qua một ô cửa sổ nhỏ. Thay vì nhìn toàn bộ trang cùng một lúc, người đọc sẽ kiểm tra từng ô vuông nhỏ một cho đến khi xem hết toàn bộ tài liệu. Các mô hình thị giác thực hiện điều gì đó rất tương tự, ngoại trừ việc chúng biểu diễn mỗi ô vuông bằng toán học. Số lượng patch ở đây trực tiếp quyết định số lượng mã thông báo đầu vào mà mô hình tạo ra.
Sử dụng nhiều patch hơn đồng nghĩa với:
* Bảo toàn tốt hơn các chi tiết nhỏ
* Độ chính xác OCR cao hơn
* Hiểu tốt hơn các bảng và chữ viết tay
Tuy nhiên, điều này cũng có nghĩa là:
* Nhiều mã thông báo đầu vào hơn
* Chi phí tính toán cao hơn
* Tăng mức sử dụng bộ nhớ GPU
* Tốc độ suy luận chậm hơn
Sử dụng ít patch hơn giúp tăng tốc độ suy luận nhưng phải hy sinh chi tiết, khiến việc nhận dạng các phông chữ nhỏ hoặc tài liệu có mật độ thông tin dày đặc trở nên khó khăn hơn. Giống như nhiều vấn đề trong học máy, đây là một sự đánh đổi giữa tốc độ và độ chính xác.
**Vấn đề Mã thông báo Hai mặt**
Xử lý các tài liệu dài đặt ra hai thách thức tính toán độc lập.
**1. Mã thông báo đầu vào**
Đầu tiên, hệ thống phải chuyển đổi mỗi trang thành các mã thông báo thị giác trước khi mô hình có thể hiểu tài liệu.
Một trang có độ phân giải cao có thể dễ dàng tạo ra hàng nghìn mã thông báo thị giác. Đối với một tài liệu chứa hàng chục trang, số lượng mã thông báo đầu vào nhanh chóng trở nên khổng lồ, khiến quá trình suy luận tốn kém về mặt tính toán. Do đó, thách thức đầu tiên là:
“Làm thế nào để giảm số lượng mã thông báo đầu vào mà không làm mất thông tin thị giác quan trọng?”
**2. Mã thông báo đầu ra**
Sau khi xử lý tài liệu, mô hình phải tạo ra bản chép lời từng mã thông báo một. Điều này tạo ra một thách thức thứ hai và thường khó khăn hơn.
Giả sử một tài liệu chứa 100 trang trở lên. Bản chép lời được tạo ra có thể dễ dàng chứa hàng chục nghìn mã thông báo đầu ra. Trong các bộ giải mã transformer thông thường, mỗi mã thông báo mới được tạo ra được lưu trữ bên trong bộ nhớ đệm Key-Value (KV) để các mã thông báo sau này có thể tham chiếu đến nó.
Khi bản chép lời dài hơn:
* Nhiều mã thông báo được tạo ra và thêm vào.
* Bộ nhớ đệm KV tiếp tục mở rộng với mỗi mã thông báo.
* Mức tiêu thụ bộ nhớ GPU liên tục tăng lên.
* Tính toán cơ chế chú ý (attention) dần trở nên chậm hơn.
Không giống như phía đầu vào, nơi chi phí được cố định sau khi tài liệu đã được mã hóa, phía đầu ra tăng lên trong suốt quá trình giải mã. Đối với các tài liệu đủ dài.



Nguồn tin: Analytics Vidhya — Tác giả: Shaik Hamzah Shareef. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.