Bỏ qua tới nội dung chính
Quay lại tin tức

Tại sao An toàn AI cần sự mạnh mẽ của thanh ghi

Medium Towards AI· Irene Theodoropoulou· 4/10/2026general

Vấn đề ngôn ngữ mà đánh giá AI đang bỏ qua Tổng quan về khung đánh giá tính bền vững của văn phong, minh họa cách một mô hình AI cần duy trì tính nhất quán về thông tin thực tế trên các văn phong trang trọng, thông thường, khẩu ngữ và chuyên ngành. Ảnh: Tác giả. Một trợ lý AI cần thích ứng với cách mọi người giao tiếp mà không thay đổi các tiêu chuẩn về độ chính xác, mức độ không chắc chắn hoặc an toàn. Một mô hình cung cấp câu trả lời cho một câu hỏi trang trọng được đặt ra cẩn thận. Một người dùng khác yêu cầu cùng thông tin đó, bằng ngôn ngữ đời thường, và lời giải thích trở nên khẩu ngữ hơn. Cho đến nay, mọi thứ đều ổn. Nhưng điều gì sẽ xảy ra nếu người dùng thứ hai

Vấn đề ngôn ngữ mà đánh giá AI đang bỏ qua Tổng quan về khung đánh giá tính bền vững của ngữ vực, minh họa cách một mô hình AI nên duy trì tính nhất quán về mặt thực tế trên các phong cách ngôn ngữ trang trọng, thông thường, khẩu ngữ và chuyên ngành. Ảnh: Tác giả. Một trợ lý AI nên thích ứng với cách mọi người nói mà không thay đổi các tiêu chuẩn về độ chính xác, độ không chắc chắn hoặc độ an toàn. Một mô hình cung cấp câu trả lời cho một câu hỏi trang trọng được đặt ra cẩn thận. Một người dùng khác yêu cầu cùng thông tin đó, bằng ngôn ngữ đời thường, và lời giải thích mang tính khẩu ngữ hơn. Cho đến nay, mọi thứ đều tốt. Nhưng điều gì sẽ xảy ra nếu câu trả lời thứ hai bỏ qua một điều kiện quan trọng, trở nên kém chính xác hơn, hoặc chấp nhận một giả định mà câu trả lời đầu tiên sẽ bác bỏ? Sự thay đổi sẽ mở rộng từ phong cách sang độ tin cậy. Tôi sử dụng thuật ngữ "tính bền vững của ngữ vực" (register robustness) để mô tả khả năng của một hệ thống AI trong việc thích ứng một cách đàm thoại trong khi vẫn duy trì các ràng buộc gắn liền với nhiệm vụ hiện tại. Một mô hình phải có khả năng điều chỉnh từ vựng, giọng điệu và mức độ trang trọng mà không làm ảnh hưởng đến cách xử lý các sự kiện, bằng chứng, độ không chắc chắn hoặc các yêu cầu mà nó phải từ chối. Các dự án như AI Observatory, đo lường các mô hình sử dụng AI trong thế giới thực thông qua các bộ sưu tập lớn tương tác giữa người và AI, tạo cơ hội để nghiên cứu hành vi của mô hình vượt ra ngoài các thiết lập điểm chuẩn thông thường [1]. Song song với loại công việc quan sát này, tôi muốn điều tra một câu hỏi được kiểm soát hơn: điều gì sẽ xảy ra khi hình thức xã hội của một lời nhắc thay đổi trong khi nhiệm vụ cơ bản vẫn giữ nguyên? Khi phong cách thay đổi bản chất Trong xã hội học ngôn ngữ, ngữ vực (register) đề cập đến sự biến đổi ngôn ngữ liên quan đến tình huống, mục đích, đối tượng và mối quan hệ xã hội. Cùng một người có thể viết một cách trang trọng trong một báo cáo, nói chuyện thông thường với đồng nghiệp và sử dụng một phong cách khác trong tin nhắn văn bản. Những thay đổi này mang thông tin về sự tương tác. Một trợ lý nên có khả năng phản hồi thông tin đó. Nó có thể sử dụng phiên bản từ vựng đơn giản hóa hoặc giải thích mang tính đàm thoại hơn khi thích hợp. Tính bền vững của ngữ vực liên quan đến khả năng của một phản hồi vẫn đáng tin cậy về mặt nội dung thông qua những thay đổi này. Để cô lập khía cạnh ngôn ngữ này, chúng ta có thể lập bản đồ bốn hình thức ngữ vực riêng biệt tập trung vào một nhiệm vụ cơ bản duy nhất – giải thích các cơ chế phản hồi khí hậu: Trang trọng: "Giải thích các cơ chế phản hồi tích cực trong hệ thống khí hậu, đặc biệt chú ý đến hiệu ứng suất phản xạ (albedo) và ý nghĩa của chúng đối với động lực nhiệt độ toàn cầu." Thông thường: "Vậy, khi băng tan, mặt đất bên dưới tối hơn, đúng không? Và điều đó có nghĩa là nhiều nhiệt hơn được hấp thụ? Bạn có thể giải thích điều đó hoạt động như thế nào không?" Khẩu ngữ: "Khi băng tan, điều đó có nghĩa là hành tinh hấp thụ nhiều nhiệt hơn à? Điều đó xảy ra như thế nào?" Chuyên ngành: "Bạn có thể giải thích cách phản hồi suất phản xạ (albedo feedback) hoạt động trong hệ thống khí hậu không?" Một điểm chuẩn về tính bền vững của ngữ vực có thể kiểm tra xem liệu các lời nhắc phù hợp này có tạo ra sự thay đổi về độ chính xác của văn bản, cách định hình phản hồi, độ dài phản hồi, tính nhất quán về mặt thực tế hoặc hiệu chỉnh độ không chắc chắn hay không. Mặc dù một yêu cầu kỹ thuật chuyên biệt biện minh cho ngôn ngữ kỹ thuật cao, nhưng sự thay đổi trong cách định hình xã hội không nên làm ảnh hưởng đến độ chính xác khoa học cốt lõi hoặc các tiêu chuẩn an toàn trong phán đoán của mô hình. Việc gán những thay đổi hiệu suất này một cách nghiêm ngặt cho hình thức ngôn ngữ của chúng đòi hỏi các điểm chuẩn được kiểm soát. Nghiên cứu về phương ngữ cho chúng ta biết điều gì Bằng chứng cho thấy sự biến đổi ngôn ngữ có ý nghĩa xã hội có thể ảnh hưởng đến hành vi mô hình quan trọng đã xuất hiện. Hofmann và các đồng nghiệp đã phát hiện ra rằng ngôn ngữ các mô hình đã liên kết tiếng Anh của người Mỹ gốc Phi với những định kiến tiêu cực hơn và đưa ra các quyết định giả định kém thuận lợi hơn liên quan đến các lĩnh vực như việc làm và tội phạm so với khi phản hồi bằng tiếng Anh chuẩn Mỹ [2]. Phát hiện của họ đặc biệt nổi bật vì nghiên cứu cũng cho thấy rằng việc giảm thiểu sự thể hiện công khai của thành kiến chủng tộc không nhất thiết loại bỏ các hình thức thành kiến liên quan đến phương ngữ một cách kín đáo hơn. Công trình này đã thu hút sự chú ý rộng rãi ngoài nghiên cứu học thuật, bao gồm cả việc được đưa tin trên MIT Technology Review, nơi đã nhấn mạnh khả năng các mô hình ngôn ngữ có thể tái tạo thành kiến chủng tộc ngay cả khi không có các định danh chủng tộc rõ ràng [3]. Tuy nhiên, sự phân biệt này rất quan trọng, bởi vì Hofmann và các đồng nghiệp đã điều tra phương ngữ chứ không phải ngữ vực. Mặc dù cả hai đều liên quan đến sự biến đổi ngôn ngữ có quy luật, phương ngữ chủ yếu gắn liền với các cộng đồng ngôn ngữ và bản sắc xã hội, trong khi ngữ vực thay đổi theo tình huống giao tiếp, mục đích, đối tượng và mối quan hệ xã hội. Do đó, những phát hiện của họ không nên được coi là bằng chứng trực tiếp về các hiệu ứng ngữ vực. Thay vào đó, chúng thể hiện một quan điểm phương pháp luận rộng hơn: sự biến đổi ngôn ngữ có ý nghĩa xã hội có thể được cô lập một cách thực nghiệm và kiểm tra như một nguồn tiềm năng gây ra sự biến đổi trong hành vi của mô hình. Các công trình gần đây hơn đã bắt đầu cô lập trực tiếp ngữ vực. Một nghiên cứu về hỏi đáp y tế vào tháng 9 năm 2026 đã tách biệt rõ ràng các thay đổi ngữ vực khỏi các thay đổi về chuyên ngành y tế và kho ngữ liệu [4], trong khi HerHealthEval đánh giá các cách diễn đạt mang tính lâm sàng, của người bình thường, gián tiếp hoặc dè dặt, và thể hiện sự lo lắng về cảm xúc đối với các mối quan tâm cơ bản tương đương, cùng với các hình thức giao tiếp khác [5]. **Tại sao Xã hội học ngôn ngữ thuộc về Đánh giá** Các nhãn như "trang trọng", "thông thường", "khẩu ngữ" và "chuyên ngành" là một điểm khởi đầu thiết thực. Nhưng xã hội học ngôn ngữ đưa ra một chiều kích khác: những thông điệp xã hội nào được truyền đạt bởi các hình thức này? Một yêu cầu có thể thể hiện quyền uy, sự tách biệt, tình đoàn kết, chuyên môn, sự không chắc chắn hoặc sự tôn trọng, tất cả đều tô điểm cho mối quan hệ xã hội giữa người yêu cầu và người nhận. Các mô hình ngôn ngữ được tiếp xúc với các mối liên hệ giữa các hình thức ngôn ngữ và các ngữ cảnh xã hội này trong ngôn ngữ của con người mà chúng được huấn luyện. Đối với mục đích đánh giá, thách thức là xác định ngữ cảnh liên quan và phân biệt nó với các tín hiệu không nên ảnh hưởng đáng kể đến các đánh giá của mô hình. Một yêu cầu giải thích từ chuyên gia hợp lý sẽ thay đổi kỳ vọng về mật độ từ vựng trong phản hồi.

Nguồn tin: Medium Towards AI — Tác giả: Irene Theodoropoulou. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.