Bỏ qua tới nội dung chính
Quay lại tin tức

Cách thức hoạt động của Baidu Unlimited-OCR: Giải pháp chuyển đổi văn bản tài liệu dài

Analytics Vidhya· Shaik Hamzah Shareef· 13/8/2026general

Khoảng một tháng trước, Baidu (thường được gọi là “Google của Trung Quốc”) đã giới thiệu Unlimited-OCR, một bước tiến vượt trội so với DeepSeek OCR. Mô hình này được thiết kế để phiên âm các tài liệu dài, nhiều trang với độ chính xác cao, đồng thời mang lại khả năng suy luận nhanh chóng và ổn định. Không giống như các hệ thống OCR thị giác-ngôn ngữ thông thường, Unlimited-OCR giải quyết một nút thắt lớn trong việc phiên âm tài liệu dài: bộ nhớ đệm Key-Value (KV) tăng nhanh chóng mặt, [...] Bài viết How Baidu Unlimited-OCR Works: Solving Long-Document Transcription xuất hiện lần đầu trên Analytics Vidhya.

Unlimited-OCR được giải thích: Cách Baidu giải quyết AI tài liệu dài Hội nghị AI tương lai nhất của Ấn Độ đã trở lại – Lớn hơn, sắc nét hơn, táo bạo hơn d : h : m : s Nhận thông tin chi tiết Các khóa học miễn phí Các khóa học miễn phí Lộ trình học tập Chương trình tăng tốc Chương trình tăng tốc Mới Chương trình GenAI Pinnacle GenAI Pinnacle Plus Agentic AI Pioneer Mới DeepSeek Hội nghị thượng đỉnh DataHack 2025 DHS 2026 Các khóa học miễn phí Đăng nhập Chuyển chế độ Đăng xuất Chuẩn bị phỏng vấn Sự nghiệp GenAI Kỹ thuật nhắc lệnh (Prompt Engg) ChatGPT LLM Langchain RAG AI Agents Học máy (Machine Learning) Học sâu (Deep Learning) Công cụ GenAI LLMOps Python NLP SQL Dự án AIML Danh sách đọc Lộ trình học tập của nhà phân tích dữ liệu Cách trở thành nhà phân tích dữ liệu vào năm 2025: Lộ trình hoàn chỉnh Lộ trình học tập Tableau Lộ trình học tập toàn diện về Tableau vào năm 2025 Lộ trình học tập NLP Lộ trình học tập NLP toàn diện 2025 Lộ trình học tập của nhà khoa học dữ liệu Lộ trình học tập để trở thành nhà khoa học dữ liệu vào năm 2025 Lộ trình học tập của kỹ sư dữ liệu Lộ trình từng bước để trở thành kỹ sư dữ liệu vào năm 2025 Lộ trình học tập MLOps Lộ trình học tập MLOps toàn diện: Phiên bản 2025 Lộ trình học tập của kỹ sư AI Lộ trình để trở thành kỹ sư AI vào năm 2025 Lộ trình học tập thị giác máy tính (Computer Vision) Lộ trình học tập toàn diện để thành thạo thị giác máy tính vào năm 2025 Lộ trình học tập AI tạo sinh (Generative AI) Lộ trình tốt nhất để học AI tạo sinh vào năm 2025 Lộ trình AI tạo sinh cho doanh nghiệp Lộ trình GenAI cho doanh nghiệp Lộ trình LLM Các mô hình ngôn ngữ lớn được giải mã: Lộ trình dành cho người mới bắt đầu Lộ trình kỹ sư nhắc lệnh (Prompt Engineer) Lộ trình học tập để trở thành chuyên gia kỹ thuật nhắc lệnh Trang chủ Thị giác máy tính Cách Baidu Unlimited-OCR hoạt động: Giải quyết việc chuyển đổi tài liệu dài Cách Baidu Unlimited-OCR hoạt động: Giải quyết việc chuyển đổi tài liệu dài Shaik Hamzah Shareef Cập nhật lần cuối: 13 tháng 8 năm 2026 9 phút đọc Khoảng một tháng trước, Baidu (thường được gọi là “Google của Trung Quốc”) đã giới thiệu Unlimited-OCR, một cải tiến so với DeepSeek OCR. Mô hình này được thiết kế để chuyển đổi các tài liệu dài, nhiều trang với độ chính xác cao, đồng thời mang lại khả năng suy luận nhanh và ổn định. Không giống như các hệ thống OCR thị giác-ngôn ngữ thông thường, Unlimited-OCR giải quyết một nút thắt lớn trong việc chuyển đổi tài liệu dài: bộ nhớ đệm Key-Value (KV) đang phát triển nhanh chóng, với mức sử dụng bộ nhớ tăng lên khi tạo ra nhiều token đầu ra hơn. Trong bài viết này, chúng tôi sẽ xem xét cách Unlimited-OCR của Baidu cải thiện hiệu quả và khả năng mở rộng cho các tác vụ OCR tài liệu dài. Mục lục Cách các mô hình thị giác-ngôn ngữ đọc một trang Vấn đề token hai mặt Cách DeepSeek OCR giải quyết phía đầu vào Cách Baidu giải quyết phía đầu ra Hiểu về bộ nhớ đệm KV Một phép tương tự đơn giản Cơ chế chú ý cửa sổ trượt tham chiếu (R-SWA) Chạy Unlimited-OCR Chạy với vLLM Kết luận Các câu hỏi thường gặp Cách các mô hình thị giác-ngôn ngữ đọc một trang Biểu diễn bản vá token hình ảnh Không giống các hệ thống OCR truyền thống, các Mô hình Ngôn ngữ-Thị giác (Vision-Language Models - VLM) không đọc trực tiếp các điểm ảnh thô. Thay vào đó, mỗi trang tài liệu được chia thành một lưới các vùng vuông nhỏ, gọi là các "patch". Mỗi patch được chuyển đổi thành một nhúng số (numerical embedding) và được coi là một mã thông báo thị giác (visual token), tương tự như cách các từ được chuyển đổi thành mã thông báo văn bản (text token) bên trong một mô hình ngôn ngữ. Kết quả là, toàn bộ một trang tài liệu trở thành một chuỗi các mã thông báo thị giác mà mô hình transformer có thể xử lý. Hãy hình dung việc đọc một tờ báo qua một ô cửa sổ nhỏ. Thay vì nhìn toàn bộ trang cùng một lúc, người đọc sẽ kiểm tra từng ô vuông nhỏ một cho đến khi xem hết toàn bộ tài liệu. Các mô hình thị giác thực hiện điều gì đó rất tương tự, ngoại trừ việc chúng biểu diễn mỗi ô vuông bằng toán học. Số lượng patch ở đây trực tiếp quyết định số lượng mã thông báo đầu vào mà mô hình tạo ra. Sử dụng nhiều patch hơn đồng nghĩa với: * Bảo toàn tốt hơn các chi tiết nhỏ * Độ chính xác OCR cao hơn * Hiểu tốt hơn các bảng và chữ viết tay Tuy nhiên, điều này cũng có nghĩa là: * Nhiều mã thông báo đầu vào hơn * Chi phí tính toán cao hơn * Tăng mức sử dụng bộ nhớ GPU * Tốc độ suy luận chậm hơn Sử dụng ít patch hơn giúp tăng tốc độ suy luận nhưng phải hy sinh chi tiết, khiến việc nhận dạng các phông chữ nhỏ hoặc tài liệu có mật độ thông tin dày đặc trở nên khó khăn hơn. Giống như nhiều vấn đề trong học máy, đây là một sự đánh đổi giữa tốc độ và độ chính xác. **Vấn đề Mã thông báo Hai mặt** Xử lý các tài liệu dài đặt ra hai thách thức tính toán độc lập. **1. Mã thông báo đầu vào** Đầu tiên, hệ thống phải chuyển đổi mỗi trang thành các mã thông báo thị giác trước khi mô hình có thể hiểu tài liệu. Một trang có độ phân giải cao có thể dễ dàng tạo ra hàng nghìn mã thông báo thị giác. Đối với một tài liệu chứa hàng chục trang, số lượng mã thông báo đầu vào nhanh chóng trở nên khổng lồ, khiến quá trình suy luận tốn kém về mặt tính toán. Do đó, thách thức đầu tiên là: “Làm thế nào để giảm số lượng mã thông báo đầu vào mà không làm mất thông tin thị giác quan trọng?” **2. Mã thông báo đầu ra** Sau khi xử lý tài liệu, mô hình phải tạo ra bản chép lời từng mã thông báo một. Điều này tạo ra một thách thức thứ hai và thường khó khăn hơn. Giả sử một tài liệu chứa 100 trang trở lên. Bản chép lời được tạo ra có thể dễ dàng chứa hàng chục nghìn mã thông báo đầu ra. Trong các bộ giải mã transformer thông thường, mỗi mã thông báo mới được tạo ra được lưu trữ bên trong bộ nhớ đệm Key-Value (KV) để các mã thông báo sau này có thể tham chiếu đến nó. Khi bản chép lời dài hơn: * Nhiều mã thông báo được tạo ra và thêm vào. * Bộ nhớ đệm KV tiếp tục mở rộng với mỗi mã thông báo. * Mức tiêu thụ bộ nhớ GPU liên tục tăng lên. * Tính toán cơ chế chú ý (attention) dần trở nên chậm hơn. Không giống như phía đầu vào, nơi chi phí được cố định sau khi tài liệu đã được mã hóa, phía đầu ra tăng lên trong suốt quá trình giải mã. Đối với các tài liệu đủ dài.

Nguồn tin: Analytics Vidhya — Tác giả: Shaik Hamzah Shareef. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.