Bỏ qua tới nội dung chính
Quay lại tin tức

Whisper liên tục sửa lỗi giọng nói tiếng Nigeria. Dưới đây là cách tôi đo lường điều đó.

Dev.to Machine Learning· Nadine· 5/10/2026opensource

Tôi đã tinh chỉnh Whisper trên giọng nói tiếng Nigeria một thời gian và xây dựng bộ tiêu chuẩn này để đo lường mô hình của mình so với các mô hình tiêu chuẩn. Câu hỏi đặt ra là: khi một mô hình nhận dạng giọng nói nghe tiếng Anh hoặc tiếng Pidgin Nigeria, liệu nó có ghi lại đúng những gì đã được nói hay viết lại thành tiếng Anh chuẩn? Bộ tiêu chuẩn này đánh giá khả năng nhận dạng giọng nói thay vì các mô hình ngôn ngữ lớn (LLM) dựa trên văn bản. Nó bao gồm hai mô hình Whisper có sẵn (large-v3 và small) và một phiên bản large-v3 mà tôi đã tự tinh chỉnh trên giọng nói tiếng Nigeria. Tôi sử dụng thuật ngữ "phương ngữ" (dialect) cho bất kỳ biến thể tiếng Anh Nigeria hoặc dạng tiếng Pidgin nào, mặc dù tiếng Pidgin về mặt kỹ thuật là một ngôn ngữ riêng.

Những gì tôi đã đánh giá Tôi đã tinh chỉnh Whisper trên giọng nói tiếng Nigeria một thời gian và tôi đã xây dựng tiêu chuẩn này để đo lường mô hình của mình so với các mô hình tiêu chuẩn. Câu hỏi đặt ra là: khi một mô hình giọng nói nghe tiếng Anh hoặc tiếng Pidgin Nigeria, liệu nó có viết ra những gì đã được nói hay nó viết lại thành tiếng Anh chuẩn? Nó đánh giá khả năng nhận dạng giọng nói thay vì các mô hình ngôn ngữ lớn (LLM) dựa trên văn bản: hai mô hình Whisper có sẵn (large-v3 và small) và một phiên bản large-v3 mà tôi tự tinh chỉnh trên giọng nói tiếng Nigeria. Tôi sử dụng thuật ngữ "phương ngữ" cho bất kỳ biến thể tiếng Anh Nigeria hoặc dạng tiếng Pidgin nào, mặc dù tiếng Pidgin về mặt kỹ thuật là một ngôn ngữ riêng. Các bài kiểm tra độ chính xác của hệ thống nhận dạng giọng nói tự động (ASR) tiêu chuẩn sẽ đánh dấu một mô hình là sai khi nó phiên âm chính xác các từ phương ngữ, tiếng lóng hoặc tiếng Pidgin. Hầu hết các đánh giá đều dựa trên tỷ lệ lỗi từ (WER) được tính toán so với các tham chiếu được viết bằng chính tả tiếng Anh chuẩn. Nếu một mô hình phiên âm "pipo" (những gì người nói đã nói) nhưng tham chiếu ghi "people", WER tiêu chuẩn sẽ tính một lỗi thay thế. Điều đó phạt một sự khác biệt về chính tả, không phải một lỗi nghe. Tiêu chuẩn này tách biệt các lỗi nhận dạng thực sự khỏi sự không khớp chính tả phương ngữ và báo cáo 5 chỉ số: WER thô (Raw WER): WER tiêu chuẩn. WER trung thực (Faithful WER): WER sau khi bỏ qua các biến thể phương ngữ trung thực (các cách viết như "pipo" khớp với những gì đã được nói). Mức phạt phương ngữ (Dialect penalty): Raw WER trừ đi Faithful WER, tính bằng điểm phần trăm. Tỷ lệ ảo giác (Hallucination rate): tỷ lệ các lỗi từ không phải là biến thể phương ngữ trung thực. Trong mã của tiêu chuẩn này, "ảo giác" có nghĩa là bất kỳ lỗi nào như vậy, không chỉ các từ được tạo ra. Sự điều chỉnh quá mức chuẩn hóa (Normalization overcorrection): tỷ lệ các ảo giác mà tham chiếu chứa một từ phương ngữ và mô hình "sửa" nó thành tiếng Anh chuẩn. Ví dụ, nếu một mô hình tạo ra 100 ảo giác (lỗi không phải là biến thể phương ngữ trung thực), tỷ lệ điều chỉnh quá mức 10,6% có nghĩa là khoảng 11 trong số đó là các từ phương ngữ mà mô hình đã thay thế bằng tiếng Anh chuẩn, như "dey" → "they". Phần còn lại là các lỗi khác. Tôi đã chọn 500 mẫu từ 5 nhóm người nói (Igbo, Yoruba, Hausa, Pidgin, đa ngôn ngữ), chạy 3 mô hình Whisper trên chúng và xây dựng một bộ phân loại tự động với 120 quy tắc thay thế phương ngữ đã biết để tính toán các chỉ số nhận biết phương ngữ mà không cần chờ đợi chú thích thủ công hoàn chỉnh. Các mô hình đã được kiểm tra Accent Labs là một dự án tôi bắt đầu như một quy trình làm sạch dữ liệu cho các bộ dữ liệu giọng nói. Sau đó, tôi đã sử dụng quy trình đó để chuẩn bị khoảng 24.000 mẫu mà tôi đã tinh chỉnh Whisper large-v3. Mô hình đã tinh chỉnh được huấn luyện trên giọng nói tiếng Anh và tiếng Pidgin Nigeria với lấy mẫu có trọng số theo giọng. | Mô hình | Tham số | Vai trò | |---|---|---| | OpenAI Whisper large-v3 | 1.540M | Đường cơ sở đa năng không cần huấn luyện (zero-shot) | | OpenAI Whisper small | 244M | Đường cơ sở nhẹ để so sánh khoảng cách phương ngữ | | Accent Labs fine-tuned Whisper | 1.540M | Mô hình large-v3 đã tinh chỉnh của tôi (kho lưu trữ Hugging Face riêng tư: nadinev/naija-voice-model) | Tôi đã chọn Whisper vì nó được sử dụng rộng rãi và có sẵn công khai, và việc so sánh các mô hình không cần huấn luyện và đã tinh chỉnh trên cùng một kiến trúc cho thấy mức độ hữu ích của việc huấn luyện tập trung vào phương ngữ. Chi tiết thiết lập: Dữ liệu kiểm tra: 500 mẫu kiểm tra được lấy từ cùng một danh sách kết hợp được sử dụng để tinh chỉnh. 340 trong số đó (68%) trùng lặp với dữ liệu huấn luyện theo ID mẫu, để lại 160 mẫu sạch mà tôi báo cáo riêng. Các đường cơ sở không cần huấn luyện chưa bao giờ thấy dữ liệu này. Cài đặt suy luận: Ngôn ngữ được buộc là tiếng Anh (không tự động phát hiện), tác vụ là phiên âm. Dấu câu được loại bỏ và văn bản được chuyển sang chữ thường trước khi căn chỉnh WER. Quá trình tạo sử dụng num_beams=10, no_repeat_ngram_size=3, max_new_tokens=225. Lưu ý về lần chạy đầu tiên: Lần chạy ban đầu của tôi không loại bỏ dấu câu trước khi thực hiện căn chỉnh WER (Word Error Rate). Theo mặc định, Whisper xuất ra chữ hoa và dấu câu, do đó các dấu chấm và dấu phẩy cuối câu được tính là lỗi (ví dụ: "people.," được tính là lỗi so với "people"). Sau khi khắc phục, mô hình large-v3 giảm từ 41,92% xuống 35,05%, mô hình small giảm từ 48,00% xuống 41,19% và mô hình tinh chỉnh giảm từ 11,11% xuống 8,30%. Các mô hình cơ sở giảm nhiều nhất, do đó khoảng cách thu hẹp (từ 30,8 xuống 26,8 điểm phần trăm), nhưng mức giảm tương đối vẫn được duy trì (74% trước đây, 76% hiện tại). Tỷ lệ hiệu chỉnh quá mức do chuẩn hóa tăng lên đối với cả ba mô hình (từ 18,5% / 14,7% / 7,7% lên 23,5% / 18,5% / 10,6%), vì các lỗi chỉ liên quan đến dấu câu không còn được tính. **Thiết kế bộ phân loại tự động** Thay vì tự tay gắn nhãn khoảng 6.659 lỗi từ trên cả ba mô hình (riêng mô hình tinh chỉnh là 645 lỗi), tôi đã xây dựng một bộ phân loại tự động dựa trên quy tắc trong tệp `compute_benchmark_metrics.py`. Bộ phân loại này gắn nhãn hai loại lỗi từ việc căn chỉnh cấp độ từ: * **FAITHFUL_DIALECT_PAIRS** (38 cặp): (từ tham chiếu, từ giả thuyết) trong đó từ tham chiếu là tiếng Anh chuẩn và từ giả thuyết là một biến thể phương ngữ đã biết. * Đây không phải là lỗi thực sự và được loại bỏ trong Faithful WER. * **DIALECT_NORMALIZATION_PAIRS** (82 cặp): (từ tham chiếu, từ giả thuyết) trong đó từ tham chiếu chứa một từ phương ngữ và từ giả thuyết hiệu chỉnh quá mức thành tiếng Anh chuẩn. * Đây là những lỗi do mô hình "sửa" phương ngữ. | Tham chiếu | Đầu ra mô hình | Loại | Lỗi thực sự? | | :---------- | :------------- | :------------------- | :----------- | | people | pipo | Biến thể trung thực | Không | | the | di | Biến thể trung thực | Không | | dey | they | Hiệu chỉnh quá mức | Có | | dem | them | Hiệu chỉnh quá mức | Có | | na | is | Hiệu chỉnh quá mức | Có | Bất kỳ lỗi nào không phải là biến thể trung thực đều được gắn nhãn là ảo giác, nghĩa là đầu ra không khớp với những gì đã được nói. Mỗi lỗi đều có một nguyên nhân: chuẩn hóa phương ngữ (một cặp hiệu chỉnh quá mức), nhiễu (một từ chèn thêm) hoặc ngữ âm (tất cả các trường hợp khác). Các lỗi thay thế không khớp với cả hai danh sách mặc định được phân loại là ngữ âm và được ghi vào tệp `unknown_dialect_pairs.csv` để xem xét. **Kết quả đánh giá hiệu năng** | Chỉ số | Whisper large-v3 | Whisper small | Tinh chỉnh | | :--------------------------------------- | :--------------- | :------------ | :--------- | | Raw WER (tất cả 500 mẫu) | 35,05% | 41,19% | 8,30% | | Faithful WER | 35,05% | 41,19% | 8,00% | | Mức phạt phương ngữ (điểm) | 0,00 | 0,00 | 0,30 | | Tỷ lệ ảo giác (% tổng số lỗi) | 100% | 100% | 96,4% | | Hiệu chỉnh quá mức do chuẩn hóa (% ảo giác) | 23,5% | 18,5% | 10,6% | | Raw WER (160 mẫu giữ lại) | 39,50% | 44,52% | 7,11% | **Raw WER theo từng phương ngữ:** | Phương ngữ | Whisper large-v3 | Whisper small | Tinh chỉnh | | :--------- | :--------------- | :------------ | :--------- | | Hausa | 35,41% | 41,86% | 9,81% | | Igbo | 35,38% | 42,92% | 7,75% | | Đa ngôn ngữ | 27,65% | 33,69% | 3,84% | | Pidgin | 35,02% | 40,23% | 7,46% | | Yoru | | | |

Nguồn tin: Dev.to Machine Learning — Tác giả: Nadine. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.