Bỏ qua tới nội dung chính
Quay lại tin tức

Nhân hóa đầu ra của các mô hình ngôn ngữ lớn (LLM) là một việc làm không cần thiết.

Hacker News LLM· kuberwastaken· 10/8/2026general

URL bài viết: https://kuber.studio/blog/Reflections/Humanising-LLM-Outputs-is-Actually-Dumb URL bình luận: https://news.ycombinator.com/item?id=49243474 Điểm: 2 Bình luận: 0

Dấu hiệu lớn nhất để nhận biết sự thay đổi trong văn hóa và xu hướng đối với các công cụ AI thường là X, các kho lưu trữ GitHub lan truyền và Hacker News. Một trong những dấu hiệu này gần đây xuất hiện nhiều là các kỹ năng như "Tôi bị ADHD" (rối loạn tăng động giảm chú ý) và các hướng dẫn trong Agents.md như chỉ đưa ra kết quả đầu ra bằng tiếng Anh kỹ thuật đơn giản ASD-STE100. Việc này có sức hấp dẫn nhất định, bởi không ai trong chúng ta thực sự thích sự dài dòng và những đặc điểm riêng biệt của các kết quả đầu ra từ LLM. Tuy nhiên, việc khắc phục điều đó bằng cách "nhân hóa" mô hình là một cách tiếp cận sai lầm. Vấn đề là những hướng dẫn này không được áp dụng sau khi mô hình hoàn thành công việc, mà chúng trở thành một phần của chính công việc đó. Nếu yêu cầu một tác nhân (agent) sử dụng câu ngắn, tránh biệt ngữ, không làm người dùng choáng ngợp và chỉ bao gồm những chi tiết quan trọng nhất, tức là đang yêu cầu nó liên tục nén đầu ra thành một định dạng băng thông thấp hơn. Quá trình nén đó có thể gây mất mát thông tin. Người dùng có thể không bao giờ nhận ra những gì đã bị loại bỏ vì đầu ra vẫn dễ đọc. ASD-STE là một ví dụ điển hình vì nó nghe có vẻ hợp lý. Tiêu chuẩn này được thiết kế để làm cho tài liệu không mơ hồ đối với con người. Nhưng một tác nhân không phải là một người viết tài liệu kỹ thuật, và trạng thái thô thường là biểu diễn chứa nhiều thông tin nhất. Trong khi đó, các quy tắc về phong cách lại nằm trong cùng danh sách hướng dẫn với: giải quyết nhiệm vụ, sử dụng công cụ chính xác, bảo toàn các trừu tượng, không làm hỏng bất cứ điều gì. Điều này trở nên kỳ lạ hơn khi các tác nhân bắt đầu giao tiếp với nhau. Một tác nhân phụ (subagent) điều tra một lỗi, biến phát hiện của nó thành một bản tóm tắt dễ đọc cho con người, tác nhân chính (parent agent) đọc bản tóm tắt đó, và sau đó biến nó thành một bản tóm tắt dễ đọc khác cho người dùng. Nếu một tác nhân phụ chạy sáu thử nghiệm, người dùng không muốn nhận được: Hầu hết các thử nghiệm đều thành công, mặc dù có một vấn đề đáng xem xét. Người dùng muốn nhận được: 5/6 ĐẠT THẤT BẠI: test_cache_invalidation NGUYÊN NHÂN: khóa cũ tồn tại sau khi khởi động lại CÁCH TÁI TẠO: tests/cache_test.py:184 Quan trọng hơn, việc "nhân hóa" che giấu thất bại. Các tác nhân thất bại theo những cách hữu ích nhưng khó coi: bằng chứng mâu thuẫn, các nhánh chưa được giải quyết, dấu vết ngăn xếp (stack traces), các giả định không chắc chắn. Văn xuôi của con người rất giỏi trong việc làm mềm những điều này thành các câu như: Có một vài cân nhắc ở đây. Điều đó nghe có vẻ hay hơn. Nhưng người dùng thà phát hiện tác nhân của mình đang "ảo giác" (hallucinating) hoặc gần hết cửa sổ token của nó còn hơn là hài lòng với điều đó. Mọi hệ thống khác mà chúng ta xây dựng đều hoạt động theo cách ngược lại. Cơ sở dữ liệu không lưu trữ dữ liệu theo định dạng mà bảng điều khiển hiển thị, trình biên dịch không làm cho mã trung gian (IR) của chúng dễ đọc, API không trao đổi các bản tóm tắt thân thiện. Chúng ta giữ biểu diễn có độ trung thực cao nhất càng lâu càng tốt và chuyển đổi nó ở ranh giới nơi con người tiêu thụ. Tuy nhiên, các công cụ LLM ngày càng làm điều này ngược lại. Để làm rõ, không có điều nào trong số này là một lập luận chống lại khả năng tiếp cận hoặc cá nhân hóa. Nếu người dùng muốn câu trả lời ba dòng hoặc tiếng Anh kỹ thuật đơn giản, điều đó thật tuyệt! Chỉ là nên thực hiện điều đó ở cuối quá trình. Hãy để các tác nhân giữ trạng thái chi tiết, để các tác nhân phụ trao đổi lược đồ, khác biệt, lỗi chính xác, độ tin cậy, nguồn gốc. Sau đó nén lại cho người dùng. Phần tốt nhất là những kỹ năng lan truyền này thực sự có thể chỉ ra một tương lai đúng đắn. Người dùng đang vá lỗi này ở lớp nhắc lệnh (prompt layer), một điều thuộc về sâu hơn trong ngăn xếp (stack). "Nói chuyện với tôi như thể tôi bị ADHD" hoàn toàn có ý nghĩa như một trình kết xuất (renderer), nhưng lại ít ý nghĩa hơn nhiều như một hướng dẫn vận hành. Phiên bản bền vững là các tác nhân có ngôn ngữ gốc là trạng thái chính xác, hướng máy, với phiên bản thân thiện, súc tích, hướng con người chỉ được tạo ra ở ranh giới. Vì vậy, các kho lưu trữ lan truyền không phải là trạng thái cuối cùng, mà là một báo cáo lỗi.

Nguồn tin: Hacker News LLM — Tác giả: kuberwastaken. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.