Bỏ qua tới nội dung chính
Quay lại tin tức

Đưa AI ngôn ngữ ký hiệu đến tay người dùng

Google DeepMind· 12/8/2026models

Giới thiệu sign-language-to-text (SL2T), mô hình đột phá của chúng tôi, đang cung cấp sức mạnh cho các tính năng ngôn ngữ ký hiệu mới dành cho người dùng khiếm thính và khó nghe.

Ngày 12 tháng 8 năm 2026 Đưa AI ngôn ngữ ký hiệu đến tay người dùng Nhóm Ngôn ngữ Ký hiệu Google DeepMind Giới thiệu sign-language-to-text (SL2T), mô hình đột phá của chúng tôi cung cấp các tính năng ngôn ngữ ký hiệu mới cho người dùng khiếm thính và khó nghe. Khả năng xử lý ngôn ngữ nói của AI đã phát triển nhanh chóng trong những thập kỷ gần đây, cho phép dịch tự động, đọc chính tả và giao diện hội thoại mà người dùng có thính giác cảm thấy dễ dàng. Tuy nhiên, cuộc cách mạng công nghệ này vẫn chưa tiếp cận được hơn 200 ngôn ngữ ký hiệu trên thế giới — và ước tính 70 triệu người khiếm thính và khó nghe sử dụng chúng. Hôm nay, chúng tôi giới thiệu một mô hình dịch ngôn ngữ ký hiệu sang văn bản (SL2T) đa ngôn ngữ quy mô lớn, đánh dấu một bước đột phá về chất lượng và tính tổng quát. Với mô hình này, chúng tôi lần đầu tiên đưa AI ngôn ngữ ký hiệu ra khỏi phòng thí nghiệm và vào các sản phẩm tiêu dùng: SL2T cung cấp tính năng đọc chính tả ký hiệu sang văn bản trong Gboard và Live Transcribe trên Pixel 11, bắt đầu với Ngôn ngữ Ký hiệu Mỹ (ASL) sang tiếng Anh. Nhiều thiết bị khác sẽ sớm ra mắt, và các ngôn ngữ bổ sung sẽ tiếp nối. Tương tự như cách người dùng có thính giác có thể sử dụng tính năng đọc chính tả để nói thay vì gõ, tính năng này cho phép người dùng khiếm thính ký hiệu vào điện thoại của họ ở bất cứ đâu họ thường gõ. Người dùng có thể ký hiệu để tìm kiếm trên web, soạn tin nhắn hoặc tài liệu, và yêu cầu Gemini giải quyết các truy vấn hoặc thực hiện các tác vụ. Trong Live Transcribe, người dùng có thể ký hiệu phản hồi trong các cuộc hội thoại thay vì phải gõ qua lại. Theo những người thử nghiệm của chúng tôi, việc ký hiệu bằng ASL nhanh hơn, tự nhiên hơn và thú vị hơn so với việc gõ bằng tiếng Anh. Tính năng ký hiệu sang văn bản, được hỗ trợ bởi SL2T, cho phép người dùng ký hiệu vào điện thoại của họ ở bất cứ đâu họ thường gõ. Tại sao ngôn ngữ ký hiệu lại quan trọng Ngôn ngữ ký hiệu là ngôn ngữ chính của cộng đồng người Điếc trên khắp thế giới và là nền tảng của bản sắc văn hóa người Điếc. Có sự đa dạng lớn giữa những người Điếc về mức độ thành thạo trong việc ký hiệu, nói, đọc và viết. Do đó, việc hỗ trợ tiếp cận trên mọi phương thức là rất quan trọng. Người Điếc có thể hưởng lợi từ việc xử lý ngôn ngữ ký hiệu theo cách tương tự như người nghe hưởng lợi từ việc xử lý ngôn ngữ nói. Hơn nữa, công nghệ này mở ra những khả năng mới để thu hẹp khoảng cách giao tiếp giữa cộng đồng người Điếc và người nghe. Mặc dù có cơ hội tạo ra tác động xã hội tích cực này, tiến bộ trong AI ngôn ngữ ký hiệu vẫn còn chậm. Điều này là do việc xây dựng AI cho ngôn ngữ ký hiệu đặt ra những thách thức phức tạp và do những quan niệm sai lầm phổ biến về cách thức hoạt động của chính các ngôn ngữ này. So với việc phiên âm ngôn ngữ nói, dịch ngôn ngữ ký hiệu đặt ra hai thách thức cốt lõi. Thứ nhất, phiên âm lời nói là vấn đề thực hiện ánh xạ tuần tự từ âm thanh sang văn bản trong cùng một ngôn ngữ. Trong khi đó, ngôn ngữ ký hiệu là những ngôn ngữ tự nhiên độc lập với ngữ pháp và từ vựng riêng biệt. Kết quả là, chúng đòi hỏi dịch máy thực sự thay vì một quá trình tuần tự chuyển đổi từ ký hiệu sang từ. Thứ hai, mô hình phải học cách "nhìn" và hiểu chuyển động vật lý. Ngôn ngữ ký hiệu truyền đạt ý nghĩa thông qua các chuyển động đồng thời của bàn tay, cánh tay, thân mình, đầu và khuôn mặt. Việc theo dõi chính xác những chuyển động này ở tốc độ khung hình cao là một nhiệm vụ thị giác máy tính khó khăn và đòi hỏi nhiều tính toán. Với bối cảnh này, dễ hiểu tại sao một số nỗ lực ban đầu về công nghệ ngôn ngữ ký hiệu, như găng tay ngôn ngữ ký hiệu, lại bị hạn chế về cơ bản: ngôn ngữ ký hiệu không đơn thuần là "tiếng Anh trên tay". Chúng đòi hỏi nhận thức thị giác phức tạp về các chuyển động toàn thân tinh tế và dịch ngôn ngữ đầy đủ. SL2T được thiết kế để cung cấp cả hai điều này. SL2T xem các đầu vào ngôn ngữ ký hiệu dưới dạng các điểm trên cơ thể người ký hiệu và dịch chúng thành các đầu ra văn bản dạng luồng. Ví dụ từ bộ dữ liệu chuẩn FLEURS-ASL. Cách thức hoạt động của SL2T Chúng tôi đã xây dựng SL2T bằng cách kết hợp phương pháp tiếp cận lấy người dùng làm trung tâm, có cân nhắc yếu tố văn hóa với việc mở rộng quy mô dữ liệu lớn. Mô hình được huấn luyện trên hơn 100.000 giờ dữ liệu từ hơn 50 ngôn ngữ ký hiệu – với khoảng một phần tư dữ liệu là ASL (Ngôn ngữ ký hiệu Mỹ). Việc huấn luyện đồng thời trên các ngôn ngữ, phương ngữ và trình độ thành thạo đa dạng giúp mô hình học được các cấu trúc cơ bản chung, vượt trội hơn các mô hình đơn ngữ trong các thử nghiệm của chúng tôi. Để bảo vệ quyền riêng tư của người dùng, SL2T xem ngôn ngữ ký hiệu như một chuỗi các vị trí điểm mốc tư thế (pose landmark locations) thay vì nguồn cấp dữ liệu camera thô. Một mô hình trên thiết bị (MediaPipe Holistic) theo dõi vị trí các điểm trên người ký hiệu, và chỉ những tọa độ hình học này được gửi đến máy chủ để dịch, cho phép loại bỏ video gốc ngay lập tức. SL2T dịch trực tiếp chuỗi tọa độ này thành văn bản, bỏ qua các chú thích trung gian được gọi là "glosses" (từ mã) vốn được sử dụng rộng rãi trong các nghiên cứu trước đây về dịch ngôn ngữ ký hiệu. Glosses không thể nắm bắt được các khía cạnh phong phú, phi tuyến tính của ngôn ngữ ký hiệu như các dấu hiệu phi thủ công (non-manual markers) và cấu trúc không gian. Dịch trực tiếp từ các điểm mốc loại bỏ giới hạn từ vựng nhân tạo và cho phép chất lượng dịch tăng theo tỷ lệ trực tiếp với dữ liệu. SL2T là mô hình dịch ngôn ngữ ký hiệu có năng lực nhất cho đến nay theo các tiêu chuẩn chính như FLEURS-ASL (sd-test), đánh giá chất lượng dịch từ ASL sang tiếng Anh. SL2T đạt điểm zero-shot ấn tượng là 70 BLEURT, cao hơn đáng kể so với bất kỳ điểm số nào được báo cáo trước đây. Tuy nhiên, việc tối ưu hóa các tiêu chuẩn học thuật đơn thuần không đảm bảo khả năng sử dụng trong các ứng dụng thực tế, vì vậy chúng tôi đã nỗ lực giải quyết các vấn đề thực tiễn như giảm thiểu độ trễ truyền trực tuyến, ngăn chặn hiện tượng "ảo giác" (hallucination) đối với các đầu vào không phải ký hiệu, đảm bảo công bằng cho 10% người ký hiệu thuận tay trái và cải thiện hiệu suất đối với việc ký hiệu bằng một tay, vốn được sử dụng khi cầm điện thoại thông minh bằng tay kia.

Nguồn tin: Google DeepMind. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.