Bỏ qua tới nội dung chính
Quay lại tin tức

Hiệu ứng Diễn đạt: Định lượng sự Trôi dạt Hai chiều trong Hiệu suất Chuẩn của LLM

Hacker News LLM· sbulaev· 13/8/2026general

URL bài viết: https://arxiv.org/abs/2608.11694 URL bình luận: https://news.ycombinator.com/item?id=49282632 Điểm: 1 Bình luận: 0

Khoa học Máy tính > Tính toán và Ngôn ngữ arXiv:2608.11694 (cs) [Đệ trình ngày 12/8/2026] Tiêu đề: Hiệu ứng Diễn đạt: Định lượng sự Trôi dạt Hai chiều trong Hiệu suất Chuẩn của LLM Tác giả: Shailja Thakur, Sungeun An, Chad DeLuca, Hima Patel Xem bản PDF của bài báo có tiêu đề "Hiệu ứng Diễn đạt: Định lượng sự Trôi dạt Hai chiều trong Hiệu suất Chuẩn của LLM", của Shailja Thakur và 3 tác giả khác Xem PDF HTML (thử nghiệm) Tóm tắt: Một điểm số chuẩn xuất phát từ một cách diễn đạt duy nhất cho mỗi vấn đề. Cách diễn đạt duy nhất đó được coi như đại diện cho toàn bộ không gian các cách có thể đặt cùng một vấn đề, nhưng thực tế không phải vậy. Chúng tôi chỉ ra rằng việc diễn đạt lại một vấn đề trong khi giữ nguyên ý nghĩa và câu trả lời thường xuyên làm thay đổi câu trả lời của mô hình theo cả hai hướng, khiến một số thất bại trở thành thành công và một số thành công trở thành thất bại. Chúng tôi gọi đây là sự trôi dạt. BenchDrift tạo ra các biến thể giữ nguyên ý nghĩa của các vấn đề chuẩn theo bốn trục, bao gồm ngôn ngữ, tham chiếu, ngữ dụng và cấu trúc, đồng thời đo lường tần suất và lý do tại sao tính đúng đắn bị thay đổi dưới mỗi trục. Trên tám mô hình và ba bộ chuẩn (GSM8K, MMLU, MATH-Hard), chúng tôi quan sát thấy sự trôi dạt lớn theo cả hai hướng. Hai phát hiện nổi bật. Thứ nhất, độ nhạy cảm với cách diễn đạt không giảm khi các mô hình trở nên tốt hơn. Thay vào đó, nó thay đổi dấu hiệu. Các mô hình yếu hơn thu được nhiều lợi ích từ việc diễn đạt lại hơn là mất đi, trong khi các mô hình mạnh hơn mất đi nhiều hơn đáng kể so với những gì chúng thu được. Chúng tôi nhận thấy rằng các mô hình tốt nhất trên một bộ chuẩn do đó là những mô hình có điểm số phụ thuộc nhiều nhất vào cách diễn đạt mà chúng được cung cấp. Thứ hai, các mô hình phần lớn đồng ý về những cách diễn đạt lại nào gây mất nhiều câu trả lời đúng nhất, mặc dù chúng khác nhau về mức độ trôi dạt, do đó sự mong manh thuộc về cách diễn đạt lại chứ không phải mô hình. Hơn nữa, việc diễn đạt lại làm hỏng các câu trả lời mà mô hình tự tin, bất kể vấn đề được rút ngắn hay kéo dài. Mã nguồn và Dữ liệu: https://this.URL Chủ đề: Tính toán và Ngôn ngữ (cs.CL); Trí tuệ Nhân tạo (cs.AI) Trích dẫn dưới dạng: arXiv:2608.11694 [cs.CL] (hoặc arXiv:2608.11694v1 [cs.CL] cho phiên bản này) https://doi.org/10.48550/arXiv.2608.11694 Tập trung để tìm hiểu thêm DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) Lịch sử đệ trình Từ: Shailja Thakur [xem email] [v1] Thứ Tư, ngày 12/8/2026 06:05:47 UTC (1.955 KB) Liên kết toàn văn: Truy cập bài báo: Xem bản PDF của bài báo có tiêu đề "Hiệu ứng Diễn đạt: Định lượng sự Trôi dạt Hai chiều trong Hiệu suất Chuẩn của LLM", của Shailja Thakur và 3 tác giả khác Xem PDF HTML (thử nghiệm) Nguồn TeX xem giấy phép Ngữ cảnh duyệt hiện tại: cs.CL < trước | tiếp theo > mới | gần đây | 2026-08 Thay đổi để duyệt theo: cs cs.AI Tài liệu tham khảo & Trích dẫn NASA ADS Google Scholar Semantic Scholar xuất trích dẫn BibTeX Đang tải... Trích dẫn định dạng BibTeX &times; đang tải... Dữ liệu được cung cấp bởi: Đánh dấu Công cụ Thư mục Công cụ Thư mục và Trích dẫn Chuyển đổi Trình khám phá Thư mục Trình khám phá Thư mục (Trình khám phá là gì?) Chuyển đổi Bài báo Liên quan Bài báo Liên quan (Bài báo Liên quan là gì?) Chuyển đổi Litmaps Litmaps (Litmaps là gì?) Chuyển đổi scite.ai Trích dẫn Thông minh scite (Trích dẫn Thông minh là gì?) Mã nguồn, Dữ liệu, Phương tiện Mã nguồn, Dữ liệu và Phương tiện liên quan đến bài viết này alphaXiv Bật/Tắt alphaXiv (alphaXiv là gì?) Liên kết đến mã nguồn Bật/Tắt CatalyzeX Code Finder for Papers (CatalyzeX là gì?) DagsHub Bật/Tắt DagsHub (DagsHub là gì?) GotitPub Bật/Tắt Gotit.pub (GotitPub là gì?) Huggingface Bật/Tắt Hugging Face (Huggingface là gì?) ScienceCast Bật/Tắt ScienceCast (ScienceCast là gì?) Bản thử nghiệm Bản thử nghiệm Replicate Bật/Tắt Replicate (Replicate là gì?) Spaces Bật/Tắt Hugging Face Spaces (Spaces là gì?) Spaces Bật/Tắt TXYZ.AI (TXYZ.AI là gì?) Các bài báo liên quan Công cụ đề xuất và tìm kiếm Liên kết đến Influence Flower Influence Flower (Influence Flowers là gì?) Bộ đề xuất cốt lõi bật/tắt CORE Recommender (CORE là gì?) Tác giả Địa điểm Tổ chức Chủ đề Giới thiệu về arXivLabs arXivLabs: các dự án thử nghiệm với cộng đồng cộng tác viên arXivLabs là một khuôn khổ cho phép các cộng tác viên phát triển và chia sẻ các tính năng arXiv mới trực tiếp trên trang web của chúng tôi. Cả cá nhân và tổ chức làm việc với arXivLabs đều đã chấp nhận và tuân thủ các giá trị của chúng tôi về sự cởi mở, cộng đồng, sự xuất sắc và quyền riêng tư dữ liệu người dùng. arXiv cam kết với những giá trị này và chỉ làm việc với các đối tác tuân thủ chúng. Bạn có ý tưởng cho một dự án sẽ mang lại giá trị cho cộng đồng arXiv? Tìm hiểu thêm về arXivLabs. Những tác giả nào của bài báo này là người xác nhận? | Tắt MathJax (MathJax là gì?)

Nguồn tin: Hacker News LLM — Tác giả: sbulaev. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.