Mọi người đang xây dựng các hệ thống bộ nhớ AI.
Nhưng làm thế nào để chúng ta biết hệ thống nào thực sự hoạt động hiệu quả?
Khi các tác nhân AI (AI agent) chuyển từ tương tác một lần sang hợp tác dài hạn, bộ nhớ đang trở thành một năng lực cốt lõi. Tuy nhiên, việc đánh giá các hệ thống bộ nhớ một cách công bằng lại khó khăn một cách đáng ngạc nhiên.
Các hệ thống khác nhau thường sử dụng các bộ dữ liệu, mô hình trả lời, lời nhắc (prompt) và phương pháp đánh giá khác nhau. Khi điểm số cuối cùng thay đổi, thật khó để xác định liệu sự khác biệt đến từ chính hệ thống bộ nhớ hay từ cách thiết lập đánh giá.
Đó là lý do chúng tôi đã xây dựng Bảng xếp hạng bộ nhớ tác nhân (Agent Memory Leaderboard - AML).
Tại sao chúng ta cần một tiêu chuẩn đánh giá bộ nhớ?
Bộ nhớ
Mọi người đều đang xây dựng các hệ thống bộ nhớ AI.
Nhưng làm thế nào để chúng ta biết hệ thống nào thực sự hoạt động hiệu quả?
Khi các tác nhân AI (AI agent) chuyển từ tương tác một lần sang hợp tác dài hạn, bộ nhớ đang trở thành một năng lực cốt lõi. Tuy nhiên, việc đánh giá công bằng các hệ thống bộ nhớ lại khó một cách đáng ngạc nhiên.
Các hệ thống khác nhau thường sử dụng các bộ dữ liệu, mô hình trả lời, câu lệnh (prompt) và phương pháp đánh giá khác nhau. Khi điểm số cuối cùng thay đổi, thật khó để xác định liệu sự khác biệt đến từ chính hệ thống bộ nhớ hay từ cách thiết lập đánh giá.
Đó là lý do chúng tôi xây dựng Bảng xếp hạng Bộ nhớ Tác nhân (Agent Memory Leaderboard - AML).
Tại sao chúng ta cần một tiêu chuẩn đánh giá bộ nhớ?
Bộ nhớ không chỉ là lưu trữ lịch sử hội thoại.
Một hệ thống bộ nhớ hữu ích cần có khả năng truy xuất thông tin liên quan, kết nối thông tin theo thời gian, xử lý các trạng thái thay đổi và cung cấp ngữ cảnh hữu ích cho nhiệm vụ hiện tại của tác nhân.
Tuy nhiên, chưa có một môi trường đánh giá chung nào để so sánh các phương pháp bộ nhớ khác nhau trong cùng điều kiện.
AML được tạo ra để cung cấp nền tảng chung đó.
Phiên bản đầu tiên được khởi xướng bởi gần 30 trường đại học và viện nghiên cứu, bao gồm hai hạng mục đánh giá:
Phương pháp mã nguồn mở — Bộ nhớ văn bản
Sản phẩm thương mại — Bộ nhớ văn bản
Tính đến ngày 12/8/2026:
136 đội đã đăng ký tham gia cuộc thi
67 khung bộ nhớ tiêu biểu đã hoàn thành thành công vòng đánh giá đầu tiên
Trang web AML đã vượt 200.000 lượt truy cập
Trang web đã vượt 100.000 lượt truy cập trong 10 ngày đầu tiên
Kết quả bảng xếp hạng đầu tiên hiện đã được công bố.
Làm cho các hệ thống bộ nhớ dễ so sánh hơn
Một trong những thách thức chính mà chúng tôi muốn giải quyết là tính nhất quán trong đánh giá.
Trong một thiết lập điển hình, một hệ thống bộ nhớ có thể được đánh giá cùng với một mô hình trả lời, câu lệnh (prompt) hoặc người đánh giá cụ thể.
Điều đó gây khó khăn cho việc so sánh trực tiếp.
Điểm số cao hơn có thể đến từ một hệ thống bộ nhớ tốt hơn — nhưng nó cũng có thể đến từ một mô hình hạ nguồn (downstream model) mạnh hơn hoặc một thiết lập đánh giá khác.
AML cố gắng tách biệt các thành phần này.
Giao diện cốt lõi cho các hệ thống bộ nhớ tham gia là:
Hệ thống bộ nhớ
Thêm → Tìm kiếm
Hệ thống bộ nhớ nhận lịch sử dài hạn thông qua chức năng Thêm (Add) và trả về các ký ức liên quan thông qua chức năng Tìm kiếm (Search).
Sau đó, AML xử lý:
Nền tảng đánh giá AML
Trả lời → Đánh giá
Việc tạo câu trả lời và đánh giá được hoàn thành bởi nền tảng tiêu chuẩn theo cùng một quy trình đánh giá.
Điều này giúp giảm thiểu tác động của các mô hình trả lời, câu lệnh (prompt), người đánh giá và quy ước tính điểm khác nhau.
Mục tiêu rất đơn giản:
So sánh các hệ thống bộ nhớ trong cùng điều kiện nhiều nhất có thể.
Bộ nhớ không chỉ là truy xuất
Một hệ thống bộ nhớ không nên chỉ được đánh giá dựa trên việc nó có thể truy xuất thứ gì đó trông tương tự hay không. Chất lượng bộ nhớ không chỉ là truy xuất thông tin tương tự, mà còn là hiểu được sự liên quan, ngữ cảnh, thời gian và yêu cầu nhiệm vụ.
Đối với bộ nhớ văn bản, AML đánh giá nhiều khả năng, bao gồm:
Khả năng nhớ lại sự kiện (Factual recall)
Suy luận quan hệ và đa bước (Relational and multi-hop reasoning)
Hiểu biết về thời gian và sự kiện (Temporal and event understanding)
Quản lý bộ nhớ (Memory governance)
Cá nhân hóa và chăm sóc (Personalization and care)
Thực thi quy tắc và quy trình làm việc (Rules and workflow execution)
An toàn nhận thức và quyền riêng tư (Epistemic safety and privacy)
Điều này quan trọng vì bộ nhớ tác nhân trong thế giới thực không chỉ là một vấn đề tìm kiếm.
Một tác nhân có thể cần hiểu:
Điều gì đã xảy ra trước đây?
Nó xảy ra khi nào?
Điều gì đã thay đổi sau đó?
Kinh nghiệm trước đây nào phù hợp bây giờ?
Thông tin nào nên được tin cậy?
Ký ức đó nên ảnh hưởng đến nhiệm vụ hiện tại như thế nào?
Một hệ thống bộ nhớ hữu ích cần xử lý những câu hỏi này cùng nhau.
Những kết quả đầu tiên
Đánh giá AML đầu tiên hiện đã hoàn thành.
67 khung bộ nhớ đại diện đã hoàn thành thành công quá trình đánh giá trên hai hạng mục, bao gồm bộ nhớ văn bản cho cả phương pháp mã nguồn mở và sản phẩm thương mại.
Bảng xếp hạng đầy đủ, điểm số và phiên bản hệ thống có sẵn trên bảng xếp hạng.
Bảng xếp hạng:
[https://agentmemoryleaderboard.ai/leaderboard/industry/textual]
Tiếp theo là gì?
Bảng xếp hạng đầu tiên không phải là đích đến cuối cùng.
Chúng tôi dự định duy trì AML như một hệ thống đánh giá dài hạn và bảng xếp hạng công khai cho các hệ thống bộ nhớ tác nhân.
Trong thời gian tới, chúng tôi sẽ công bố các phân tích kỹ thuật sâu hơn về kết quả vòng đầu tiên, bao gồm:
Các kiến trúc kỹ thuật hoạt động tốt
Các mẫu đánh giá thú vị
Hiệu suất trên từng khả năng bộ nhớ riêng lẻ
Sự khác biệt giữa bộ nhớ văn bản và bộ nhớ mã
Những gì kết quả hiện tại cho chúng ta biết về sự phát triển của bộ nhớ tác nhân
Chúng tôi cũng mong muốn bản thân tiêu chuẩn đánh giá sẽ phát triển.
Nếu quý vị đang nghiên cứu về các tác nhân AI, hệ thống bộ nhớ, đánh giá hoặc các lĩnh vực liên quan, chúng tôi rất mong nhận được ý kiến của quý vị về những gì một tiêu chuẩn bộ nhớ hữu ích nên đo lường tiếp theo.
Bốn hạng mục đánh giá
Để phản ánh tốt hơn các loại hệ thống bộ nhớ khác nhau, AML tổ chức đánh giá thành hai hạng mục:
Phương pháp mã nguồn mở
Bộ nhớ văn bản
Sản phẩm thương mại
Bộ nhớ văn bản
Mỗi hạng mục đánh giá các hệ thống theo cùng một khung tiêu chuẩn.
Khám phá AML
Bảng xếp hạng:
[https://agentmemoryleaderboard.ai/leaderboard/industry/textual]
GitHub:
[https://github.com/AML-memory/agent-memory-leaderboard]
Hugging Face Space:
[https://huggingface.co/agent-memory-leaderboard]
X:
[https://x.com/AgentMemoryL/status/2087544165433590240]
Liên hệ:
contactus@agentmemoryleaderboard.ai
Những kết quả đầu tiên đã được công bố.
Giờ đây, công việc thực sự bắt đầu:
Làm cho bộ nhớ có thể đo lường được. Làm cho tiến độ có thể kiểm chứng được.
Nguồn tin: Dev.to Machine Learning — Tác giả: Agent Memory Leaderboard. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.