Hiệu ứng Diễn đạt: Định lượng sự Trôi dạt Hai chiều trong Hiệu suất Chuẩn của LLM
URL bài viết: https://arxiv.org/abs/2608.11694 URL bình luận: https://news.ycombinator.com/item?id=49282632 Điểm: 1 Bình luận: 0
Khoa học Máy tính > Tính toán và Ngôn ngữ
arXiv:2608.11694 (cs)
[Đệ trình ngày 12/8/2026]
Tiêu đề: Hiệu ứng Diễn đạt: Định lượng sự Trôi dạt Hai chiều trong Hiệu suất Chuẩn của LLM
Tác giả: Shailja Thakur, Sungeun An, Chad DeLuca, Hima Patel
Xem bản PDF của bài báo có tiêu đề "Hiệu ứng Diễn đạt: Định lượng sự Trôi dạt Hai chiều trong Hiệu suất Chuẩn của LLM", của Shailja Thakur và 3 tác giả khác
Xem PDF
HTML (thử nghiệm)
Tóm tắt: Một điểm số chuẩn xuất phát từ một cách diễn đạt duy nhất cho mỗi vấn đề. Cách diễn đạt duy nhất đó được coi như đại diện cho toàn bộ không gian các cách có thể đặt cùng một vấn đề, nhưng thực tế không phải vậy. Chúng tôi chỉ ra rằng việc diễn đạt lại một vấn đề trong khi giữ nguyên ý nghĩa và câu trả lời thường xuyên làm thay đổi câu trả lời của mô hình theo cả hai hướng, khiến một số thất bại trở thành thành công và một số thành công trở thành thất bại. Chúng tôi gọi đây là sự trôi dạt. BenchDrift tạo ra các biến thể giữ nguyên ý nghĩa của các vấn đề chuẩn theo bốn trục, bao gồm ngôn ngữ, tham chiếu, ngữ dụng và cấu trúc, đồng thời đo lường tần suất và lý do tại sao tính đúng đắn bị thay đổi dưới mỗi trục. Trên tám mô hình và ba bộ chuẩn (GSM8K, MMLU, MATH-Hard), chúng tôi quan sát thấy sự trôi dạt lớn theo cả hai hướng. Hai phát hiện nổi bật. Thứ nhất, độ nhạy cảm với cách diễn đạt không giảm khi các mô hình trở nên tốt hơn. Thay vào đó, nó thay đổi dấu hiệu. Các mô hình yếu hơn thu được nhiều lợi ích từ việc diễn đạt lại hơn là mất đi, trong khi các mô hình mạnh hơn mất đi nhiều hơn đáng kể so với những gì chúng thu được. Chúng tôi nhận thấy rằng các mô hình tốt nhất trên một bộ chuẩn do đó là những mô hình có điểm số phụ thuộc nhiều nhất vào cách diễn đạt mà chúng được cung cấp. Thứ hai, các mô hình phần lớn đồng ý về những cách diễn đạt lại nào gây mất nhiều câu trả lời đúng nhất, mặc dù chúng khác nhau về mức độ trôi dạt, do đó sự mong manh thuộc về cách diễn đạt lại chứ không phải mô hình. Hơn nữa, việc diễn đạt lại làm hỏng các câu trả lời mà mô hình tự tin, bất kể vấn đề được rút ngắn hay kéo dài. Mã nguồn và Dữ liệu: https://this.URL
Chủ đề:
Tính toán và Ngôn ngữ (cs.CL); Trí tuệ Nhân tạo (cs.AI)
Trích dẫn dưới dạng:
arXiv:2608.11694 [cs.CL]
(hoặc arXiv:2608.11694v1 [cs.CL] cho phiên bản này)
https://doi.org/10.48550/arXiv.2608.11694
Tập trung để tìm hiểu thêm
DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)
Lịch sử đệ trình
Từ: Shailja Thakur [xem email]
[v1]
Thứ Tư, ngày 12/8/2026 06:05:47 UTC (1.955 KB)
Liên kết toàn văn:
Truy cập bài báo:
Xem bản PDF của bài báo có tiêu đề "Hiệu ứng Diễn đạt: Định lượng sự Trôi dạt Hai chiều trong Hiệu suất Chuẩn của LLM", của Shailja Thakur và 3 tác giả khác
Xem PDF
HTML (thử nghiệm)
Nguồn TeX
xem giấy phép
Ngữ cảnh duyệt hiện tại:
cs.CL
< trước
|
tiếp theo >
mới
|
gần đây
| 2026-08
Thay đổi để duyệt theo:
cs
cs.AI
Tài liệu tham khảo & Trích dẫn
NASA ADS
Google Scholar
Semantic Scholar
xuất trích dẫn BibTeX
Đang tải...
Trích dẫn định dạng BibTeX
×
đang tải...
Dữ liệu được cung cấp bởi:
Đánh dấu
Công cụ Thư mục
Công cụ Thư mục và Trích dẫn
Chuyển đổi Trình khám phá Thư mục
Trình khám phá Thư mục (Trình khám phá là gì?)
Chuyển đổi Bài báo Liên quan
Bài báo Liên quan (Bài báo Liên quan là gì?)
Chuyển đổi Litmaps
Litmaps (Litmaps là gì?)
Chuyển đổi scite.ai
Trích dẫn Thông minh scite (Trích dẫn Thông minh là gì?)
Mã nguồn, Dữ liệu, Phương tiện
Mã nguồn, Dữ liệu và Phương tiện liên quan đến bài viết này
alphaXiv Bật/Tắt
alphaXiv (alphaXiv là gì?)
Liên kết đến mã nguồn Bật/Tắt
CatalyzeX Code Finder for Papers (CatalyzeX là gì?)
DagsHub Bật/Tắt
DagsHub (DagsHub là gì?)
GotitPub Bật/Tắt
Gotit.pub (GotitPub là gì?)
Huggingface Bật/Tắt
Hugging Face (Huggingface là gì?)
ScienceCast Bật/Tắt
ScienceCast (ScienceCast là gì?)
Bản thử nghiệm
Bản thử nghiệm
Replicate Bật/Tắt
Replicate (Replicate là gì?)
Spaces Bật/Tắt
Hugging Face Spaces (Spaces là gì?)
Spaces Bật/Tắt
TXYZ.AI (TXYZ.AI là gì?)
Các bài báo liên quan
Công cụ đề xuất và tìm kiếm
Liên kết đến Influence Flower
Influence Flower (Influence Flowers là gì?)
Bộ đề xuất cốt lõi bật/tắt
CORE Recommender (CORE là gì?)
Tác giả
Địa điểm
Tổ chức
Chủ đề
Giới thiệu về arXivLabs
arXivLabs: các dự án thử nghiệm với cộng đồng cộng tác viên
arXivLabs là một khuôn khổ cho phép các cộng tác viên phát triển và chia sẻ các tính năng arXiv mới trực tiếp trên trang web của chúng tôi.
Cả cá nhân và tổ chức làm việc với arXivLabs đều đã chấp nhận và tuân thủ các giá trị của chúng tôi về sự cởi mở, cộng đồng, sự xuất sắc và quyền riêng tư dữ liệu người dùng. arXiv cam kết với những giá trị này và chỉ làm việc với các đối tác tuân thủ chúng.
Bạn có ý tưởng cho một dự án sẽ mang lại giá trị cho cộng đồng arXiv? Tìm hiểu thêm về arXivLabs.
Những tác giả nào của bài báo này là người xác nhận? |
Tắt MathJax (MathJax là gì?)
Nguồn tin: Hacker News LLM — Tác giả: sbulaev. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.