Bỏ qua tới nội dung chính
Quay lại tin tức

Đánh giá cấu trúc bộ nhớ trong các tác nhân LLM

Hacker News LLM· matt_d· 5/10/2026general

URL bài viết: https://arxiv.org/abs/2602.11243 URL bình luận: https://news.ycombinator.com/item?id=49968612 Điểm: 1 Số bình luận: 0

Khoa học Máy tính > Học máy arXiv:2602.11243 (cs) [Đệ trình ngày 11/2/2026 (v1), sửa đổi lần cuối ngày 1/10/2026 (phiên bản này, v4)] Tiêu đề: Đánh giá cấu trúc bộ nhớ trong các tác nhân LLM Các tác giả: Alina Shutova, Alexandra Olenina, Ivan Vinogradov, Anton Sinitsin Xem bản PDF của bài báo có tiêu đề "Evaluating Memory Structure in LLM Agents", của Alina Shutova và 3 tác giả khác Xem PDF HTML (thử nghiệm) Tóm tắt: Các tác nhân dựa trên LLM và trợ lý trò chuyện hiện đại dựa vào các khuôn khổ bộ nhớ dài hạn để lưu trữ kiến thức có thể tái sử dụng, gợi lại sở thích của người dùng và tăng cường khả năng suy luận. Khi các nhà nghiên cứu tạo ra các kiến trúc bộ nhớ phức tạp hơn, việc phân tích khả năng của chúng và định hướng các thiết kế bộ nhớ trong tương lai ngày càng trở nên khó khăn. Hầu hết các điểm chuẩn bộ nhớ dài hạn tập trung vào việc ghi nhớ sự kiện đơn giản, gợi nhớ đa bước và các thay đổi dựa trên thời gian. Mặc dù những khả năng này chắc chắn quan trọng, nhưng chúng thường có thể đạt được bằng các LLM tăng cường truy xuất đơn giản và không kiểm tra các hệ thống phân cấp bộ nhớ phức tạp. Để khắc phục khoảng cách này, chúng tôi đề xuất StructMemEval – một điểm chuẩn kiểm tra khả năng của tác nhân trong việc tổ chức bộ nhớ dài hạn, không chỉ là gợi nhớ sự kiện. Chúng tôi tập hợp một bộ nhiệm vụ mà con người giải quyết bằng cách tổ chức kiến thức của họ theo một cấu trúc cụ thể: sổ cái giao dịch, danh sách việc cần làm, cây và các cấu trúc khác. Các thử nghiệm ban đầu của chúng tôi cho thấy rằng các LLM tăng cường truy xuất đơn giản gặp khó khăn với các nhiệm vụ này, trong khi các tác nhân bộ nhớ có thể giải quyết chúng một cách đáng tin cậy nếu được nhắc nhở cách tổ chức bộ nhớ của chúng. Tuy nhiên, chúng tôi cũng nhận thấy rằng các LLM hiện đại không phải lúc nào cũng nhận ra cấu trúc bộ nhớ khi không được nhắc nhở làm như vậy. Điều này làm nổi bật một hướng quan trọng cho những cải tiến trong tương lai đối với cả việc huấn luyện LLM và các khuôn khổ bộ nhớ. Bình luận: Bản thảo, công trình đang tiến hành Chủ đề: Học máy (cs.LG); Tính toán và Ngôn ngữ (cs.CL) Trích dẫn dưới dạng: arXiv:2602.11243 [cs.LG] (hoặc arXiv:2602.11243v4 [cs.LG] cho phiên bản này) https://doi.org/10.48550/arXiv.2602.11243 Tập trung để tìm hiểu thêm DOI do arXiv cấp thông qua DataCite Lịch sử đệ trình Từ: Alina Shutova [xem email] [v1] Thứ Tư, 11/2/2026 17:32:23 UTC (126 KB) [v2] Thứ Sáu, 22/5/2026 11:17:25 UTC (194 KB) [v3] Thứ Năm, 10/9/2026 11:44:23 UTC (194 KB) [v4] Thứ Năm, 1/10/2026 10:38:13 UTC (162 KB) Liên kết toàn văn: Truy cập bài báo: Xem bản PDF của bài báo có tiêu đề "Evaluating Memory Structure in LLM Agents", của Alina Shutova và 3 tác giả khác Xem PDF HTML (thử nghiệm) Nguồn TeX xem giấy phép Ngữ cảnh duyệt hiện tại: cs.LG < trước | tiếp theo > mới | gần đây | 2026-02 Thay đổi để duyệt theo: cs cs.CL Tài liệu tham khảo & Trích dẫn NASA ADS Google Scholar Semantic Scholar xuất trích dẫn BibTeX Đang tải... Trích dẫn định dạng BibTeX × đang tải... Dữ liệu được cung cấp bởi: Đánh dấu Công cụ thư mục Công cụ thư mục và trích dẫn Trình khám phá thư mục Bật/Tắt Trình khám phá thư mục (Trình khám phá là gì?) Bài báo liên quan Bật/Tắt Bài báo liên quan (Bài báo liên quan là gì?) Litmaps Bật/Tắt Litmaps (Litmaps là gì?) scite.ai Bật/Tắt Trích dẫn thông minh scite (Trích dẫn thông minh là gì?) Mã, Dữ liệu, Phương tiện Mã, Dữ liệu và Phương tiện liên quan đến bài viết này alphaXiv Bật/Tắt alphaXiv (alphaXiv là gì?) Liên kết đến mã nguồn CatalyzeX Code Finder for Papers (CatalyzeX là gì?) DagsHub DagsHub (DagsHub là gì?) GotitPub Gotit.pub (GotitPub là gì?) Huggingface Hugging Face (Huggingface là gì?) ScienceCast ScienceCast (ScienceCast là gì?) Các bản thử nghiệm Replicate Replicate (Replicate là gì?) Spaces Hugging Face Spaces (Spaces là gì?) Spaces TXYZ.AI (TXYZ.AI là gì?) Các bài báo liên quan Công cụ đề xuất và tìm kiếm Liên kết đến Influence Flower Influence Flower (Influence Flowers là gì?) Công cụ đề xuất cốt lõi CORE Recommender (CORE là gì?) Công cụ đề xuất IArxiv IArxiv Recommender (IArxiv là gì?) Tác giả Địa điểm Tổ chức Chủ đề Giới thiệu về arXivLabs arXivLabs: các dự án thử nghiệm với cộng tác viên cộng đồng arXivLabs là một khuôn khổ cho phép các cộng tác viên phát triển và chia sẻ các tính năng arXiv mới trực tiếp trên trang web của chúng tôi. Cả cá nhân và tổ chức làm việc với arXivLabs đều đã chấp nhận và tuân thủ các giá trị của chúng tôi về sự cởi mở, cộng đồng, sự xuất sắc và quyền riêng tư dữ liệu người dùng. arXiv cam kết với các giá trị này và chỉ làm việc với các đối tác tuân thủ chúng. Có ý tưởng cho một dự án sẽ mang lại giá trị cho cộng đồng arXiv? Tìm hiểu thêm về arXivLabs. Những tác giả nào của bài báo này là người ủng hộ? | Vô hiệu hóa MathJax (MathJax là gì?)

Nguồn tin: Hacker News LLM — Tác giả: matt_d. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.