Đánh giá cấu trúc bộ nhớ trong các tác nhân LLM
URL bài viết: https://arxiv.org/abs/2602.11243 URL bình luận: https://news.ycombinator.com/item?id=49968612 Điểm: 1 Số bình luận: 0
Khoa học Máy tính > Học máy
arXiv:2602.11243 (cs)
[Đệ trình ngày 11/2/2026 (v1), sửa đổi lần cuối ngày 1/10/2026 (phiên bản này, v4)]
Tiêu đề: Đánh giá cấu trúc bộ nhớ trong các tác nhân LLM
Các tác giả: Alina Shutova, Alexandra Olenina, Ivan Vinogradov, Anton Sinitsin
Xem bản PDF của bài báo có tiêu đề "Evaluating Memory Structure in LLM Agents", của Alina Shutova và 3 tác giả khác
Xem PDF
HTML (thử nghiệm)
Tóm tắt: Các tác nhân dựa trên LLM và trợ lý trò chuyện hiện đại dựa vào các khuôn khổ bộ nhớ dài hạn để lưu trữ kiến thức có thể tái sử dụng, gợi lại sở thích của người dùng và tăng cường khả năng suy luận. Khi các nhà nghiên cứu tạo ra các kiến trúc bộ nhớ phức tạp hơn, việc phân tích khả năng của chúng và định hướng các thiết kế bộ nhớ trong tương lai ngày càng trở nên khó khăn. Hầu hết các điểm chuẩn bộ nhớ dài hạn tập trung vào việc ghi nhớ sự kiện đơn giản, gợi nhớ đa bước và các thay đổi dựa trên thời gian. Mặc dù những khả năng này chắc chắn quan trọng, nhưng chúng thường có thể đạt được bằng các LLM tăng cường truy xuất đơn giản và không kiểm tra các hệ thống phân cấp bộ nhớ phức tạp. Để khắc phục khoảng cách này, chúng tôi đề xuất StructMemEval – một điểm chuẩn kiểm tra khả năng của tác nhân trong việc tổ chức bộ nhớ dài hạn, không chỉ là gợi nhớ sự kiện. Chúng tôi tập hợp một bộ nhiệm vụ mà con người giải quyết bằng cách tổ chức kiến thức của họ theo một cấu trúc cụ thể: sổ cái giao dịch, danh sách việc cần làm, cây và các cấu trúc khác. Các thử nghiệm ban đầu của chúng tôi cho thấy rằng các LLM tăng cường truy xuất đơn giản gặp khó khăn với các nhiệm vụ này, trong khi các tác nhân bộ nhớ có thể giải quyết chúng một cách đáng tin cậy nếu được nhắc nhở cách tổ chức bộ nhớ của chúng. Tuy nhiên, chúng tôi cũng nhận thấy rằng các LLM hiện đại không phải lúc nào cũng nhận ra cấu trúc bộ nhớ khi không được nhắc nhở làm như vậy. Điều này làm nổi bật một hướng quan trọng cho những cải tiến trong tương lai đối với cả việc huấn luyện LLM và các khuôn khổ bộ nhớ.
Bình luận:
Bản thảo, công trình đang tiến hành
Chủ đề:
Học máy (cs.LG); Tính toán và Ngôn ngữ (cs.CL)
Trích dẫn dưới dạng:
arXiv:2602.11243 [cs.LG]
(hoặc arXiv:2602.11243v4 [cs.LG] cho phiên bản này)
https://doi.org/10.48550/arXiv.2602.11243
Tập trung để tìm hiểu thêm
DOI do arXiv cấp thông qua DataCite
Lịch sử đệ trình
Từ: Alina Shutova [xem email]
[v1]
Thứ Tư, 11/2/2026 17:32:23 UTC (126 KB)
[v2]
Thứ Sáu, 22/5/2026 11:17:25 UTC (194 KB)
[v3]
Thứ Năm, 10/9/2026 11:44:23 UTC (194 KB)
[v4]
Thứ Năm, 1/10/2026 10:38:13 UTC (162 KB)
Liên kết toàn văn:
Truy cập bài báo:
Xem bản PDF của bài báo có tiêu đề "Evaluating Memory Structure in LLM Agents", của Alina Shutova và 3 tác giả khác
Xem PDF
HTML (thử nghiệm)
Nguồn TeX
xem giấy phép
Ngữ cảnh duyệt hiện tại:
cs.LG
< trước
| tiếp theo >
mới
| gần đây
| 2026-02
Thay đổi để duyệt theo:
cs
cs.CL
Tài liệu tham khảo & Trích dẫn
NASA ADS
Google Scholar
Semantic Scholar
xuất trích dẫn BibTeX
Đang tải...
Trích dẫn định dạng BibTeX
×
đang tải...
Dữ liệu được cung cấp bởi:
Đánh dấu
Công cụ thư mục
Công cụ thư mục và trích dẫn
Trình khám phá thư mục Bật/Tắt
Trình khám phá thư mục (Trình khám phá là gì?)
Bài báo liên quan Bật/Tắt
Bài báo liên quan (Bài báo liên quan là gì?)
Litmaps Bật/Tắt
Litmaps (Litmaps là gì?)
scite.ai Bật/Tắt
Trích dẫn thông minh scite (Trích dẫn thông minh là gì?)
Mã, Dữ liệu, Phương tiện
Mã, Dữ liệu và Phương tiện liên quan đến bài viết này
alphaXiv Bật/Tắt
alphaXiv (alphaXiv là gì?)
Liên kết đến mã nguồn
CatalyzeX Code Finder for Papers (CatalyzeX là gì?)
DagsHub
DagsHub (DagsHub là gì?)
GotitPub
Gotit.pub (GotitPub là gì?)
Huggingface
Hugging Face (Huggingface là gì?)
ScienceCast
ScienceCast (ScienceCast là gì?)
Các bản thử nghiệm
Replicate
Replicate (Replicate là gì?)
Spaces
Hugging Face Spaces (Spaces là gì?)
Spaces
TXYZ.AI (TXYZ.AI là gì?)
Các bài báo liên quan
Công cụ đề xuất và tìm kiếm
Liên kết đến Influence Flower
Influence Flower (Influence Flowers là gì?)
Công cụ đề xuất cốt lõi
CORE Recommender (CORE là gì?)
Công cụ đề xuất IArxiv
IArxiv Recommender
(IArxiv là gì?)
Tác giả
Địa điểm
Tổ chức
Chủ đề
Giới thiệu về arXivLabs
arXivLabs: các dự án thử nghiệm với cộng tác viên cộng đồng
arXivLabs là một khuôn khổ cho phép các cộng tác viên phát triển và chia sẻ các tính năng arXiv mới trực tiếp trên trang web của chúng tôi.
Cả cá nhân và tổ chức làm việc với arXivLabs đều đã chấp nhận và tuân thủ các giá trị của chúng tôi về sự cởi mở, cộng đồng, sự xuất sắc và quyền riêng tư dữ liệu người dùng. arXiv cam kết với các giá trị này và chỉ làm việc với các đối tác tuân thủ chúng.
Có ý tưởng cho một dự án sẽ mang lại giá trị cho cộng đồng arXiv? Tìm hiểu thêm về arXivLabs.
Những tác giả nào của bài báo này là người ủng hộ? |
Vô hiệu hóa MathJax (MathJax là gì?)
Nguồn tin: Hacker News LLM — Tác giả: matt_d. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.