Bỏ qua tới nội dung chính
Quay lại tin tức

Tác nhân của bạn thực sự cần bao nhiêu bộ nhớ?

Hugging Face Blog· 18/8/2026opensource
Quay lại bài viết a]:ẩn"> Tác nhân của bạn thực sự cần bao nhiêu bộ nhớ? Bài viết doanh nghiệp đã xuất bản Ngày 18 tháng 8 năm 2026 Ủng hộ 9 +3 Vatche Isahagian Vatche Theo dõi nghiên cứu ibm Gaodan Fang gaodan-fang Theo dõi nghiên cứu ibm Jayaram Radhakrishnan Jayaramkr Theo dõi nghiên cứu ibm Punleuk Oum illeatmyhat Theo dõi nghiên cứu ibm Ashwath Vaithinathan Aravindan ashwath-vaithina Theo dõi nghiên cứu ibm Evelyn Duesterwald evduester Theo dõi nghiên cứu ibm G Thomas gsthomasx Theo dõi nghiên cứu ibm Vinod Muthusamy vinodmut Theo dõi nghiên cứu ibm Merve Unuvar mrvnvr Theo dõi nghiên cứu ibm Ayhan Sebin ayhansebin Theo dõi nghiên cứu ibm Cái nhìn sâu sắc quan trọng: Liều lượng phụ thuộc vào khả năng Quá trình học tập diễn ra xung quanh mô hình chứ không phải bên trong nó Kết quả trên toàn phổ Ba cấu hình chúng tôi so sánh Ba mẫu, trong một chế độ xem Chiến lược bộ nhớ rẻ nhất cũng có thể là chiến lược tốt nhất Bộ nhớ nên được hiệu chỉnh chứ không phải chỉ được tích lũy Tiếp theo là gì Phụ lục: Tìm hiểu các số liệu Trong bài đăng trước, chúng tôi đã so sánh ALTK-Evolve với ACE và cho thấy rằng cách bạn cung cấp các nguyên tắc tự chắt lọc của đại lý — một số nguyên tắc được truy xuất cho mỗi nhiệm vụ so với toàn bộ được đưa vào — thúc đẩy cả độ chính xác và chi phí. Bài đăng này quay lại câu hỏi đặt ra trước nó: bạn nên cho nó bao nhiêu? Việc trang bị cho tác nhân bộ nhớ tác nhân nghe có vẻ đơn giản: chắt lọc các bài học từ công việc trước đây của nó, đưa chúng trở lại bối cảnh và có nhiều kinh nghiệm hơn đồng nghĩa với việc hiệu suất sẽ tốt hơn. Nó không phải lúc nào cũng hoạt động theo cách đó. Khi chúng tôi mở rộng đánh giá thành tám mô hình - từ mô hình dày đặc 30B đến các hệ thống độc quyền hàng đầu - một phát hiện nổi bật: Bộ nhớ tác nhân không phải là tính năng bạn bật. Đó là liều lượng bạn hiệu chỉnh cho mô hình. TL;DR ALTK-Evolve cho phép tác nhân học hỏi từ các quỹ đạo trong quá khứ của chính nó: chắt lọc các hướng dẫn có thể tái sử dụng và đưa chúng trở lại vào thời điểm suy luận mà không cần cập nhật trọng lượng và không có chú thích của con người. Liều lượng phù hợp sẽ khác nhau tùy theo cấp mô hình: các mô hình mạnh có khoảng trống muốn có bộ hướng dẫn đầy đủ, các mô hình yếu hơn hoạt động hiệu quả nhất với lõi nhỏ gọn cộng với khả năng truy xuất theo từng tác vụ và các mô hình bão hòa không cho thấy mức tăng nào có thể đo lường được. Truy xuất được quản lý có thể là tùy chọn vừa chính xác nhất vừa rẻ nhất: gpt-oss-120b đã đạt được mức hoàn thành nhiệm vụ +16,1pp chỉ với +5% mã thông báo — và bộ nhớ đệm nhanh chóng giúp duy trì ngay cả bộ hướng dẫn đầy đủ với giá cả phải chăng trong quá trình sản xuất. Cái nhìn sâu sắc quan trọng: Liều lượng phụ thuộc vào khả năng Không phải mọi model đều được hưởng lợi từ cùng một lượng bộ nhớ. Trên tám mô hình trải rộng trên phạm vi khả năng, chúng tôi thấy ba mô hình lặp lại: Những mô hình mạnh mẽ có khoảng trống muốn có bộ hướng dẫn đầy đủ - mọi hướng dẫn, bao gồm cả các bài học về các trường hợp khó khăn hiếm gặp. Họ có khả năng tiếp thu và áp dụng tất cả những điều đó. DeepSeek-V3.2 (671B MoE) đã tăng +9,5 điểm phần trăm khi hoàn thành nhiệm vụ khi được cung cấp bộ hướng dẫn tự khai thác đầy đủ. Các mô hình nhỏ hơn hoặc yếu hơn sẽ bị nhấn chìm bởi một bộ hướng dẫn lớn. Đối với những điều này, cốt lõi chặt chẽ, có độ tin cậy cao cộng với một số nguyên tắc liên quan đến nhiệm vụ được truy xuất cho mỗi nhiệm vụ là hoạt động tốt nhất. gpt-oss-120b (117B MoE) đã đạt được +16,1pp với phương pháp chọn lọc này — trong khi bộ hướng dẫn đầy đủ thu được ít hơn và tốn thêm ~50% số token. Các mô hình đã bão hòa không cho thấy mức tăng nào có thể đo lường được. Chúng tôi gọi đây là mô hình bão hòa - nhãn mô tả những gì chúng tôi quan sát được, không phải nguyên nhân đã được chứng minh. Mô hình có thể đã đạt gần mức trần đối với những nhiệm vụ này, các hướng dẫn có thể chưa giải quyết được những lỗi còn lại hoặc có thể nó đã không áp dụng hướng dẫn một cách hiệu quả. GLM-5 (745B MoE) đã xuất hiện trong quá trình chạy của chúng tôi. Điều đặt một mô hình vào một mẫu này chứ không phải một mẫu khác không chỉ đơn giản là số lượng tham số. Khoảng trống điểm chuẩn, kích thước cửa sổ ngữ cảnh, kiến ​​trúc, chất lượng hướng dẫn và phân bổ nhiệm vụ đều dường như định hình vị trí của mô hình và việc tách các yếu tố đó là công việc đang diễn ra. Bài học rút ra thực tế có một trong hai cách: liều lượng bộ nhớ phù hợp tùy thuộc vào kiểu máy và chúng ta có thể hiệu chỉnh nó. Quá trình học tập diễn ra xung quanh mô hình chứ không phải bên trong nó “Bộ nhớ” ở đây không có nghĩa là phát lại bản ghi trước đây. Nó có nghĩa là một bộ hướng dẫn - các chiến lược hiệu quả, những sai lầm cần tránh và các trường hợp khó khăn - được chắt lọc từ quỹ đạo trước đó của chính tác nhân. Vòng lặp rất đơn giản: Tác nhân thực hiện các nhiệm vụ và tạo ra quỹ đạo. ALTK-Evolve trích xuất các hướng dẫn hành vi từ cả hoạt động thành công và không thành công. Nó hợp nhất những hướng dẫn đó thành một bộ có thể tái sử dụng. Tại thời điểm suy luận, tác nhân nhận được bộ hướng dẫn đầy đủ hoặc lựa chọn liên quan đến nhiệm vụ của nó. Không có trọng lượng mô hình nào được cập nhật. Vòng lặp học tập thay đổi hướng dẫn có sẵn cho tổng đài viên chứ không phải mô hình cơ bản — đó chính xác là lý do tại sao việc áp dụng và di chuyển trên tám mô hình mà chúng tôi đã thử nghiệm lại rẻ. Kết quả trên toàn phổ Chúng tôi đã đánh giá trên AppWorld — 585 tác vụ gồm nhiều bước (168 test_normal + 417 test_challenge) trên 9 ứng dụng mô phỏng (lịch, nhắn tin, thanh toán, v.v.). Nhiệm vụ được tính điểm theo hai cách: liệu tác nhân có hoàn thành đầy đủ từng nhiệm vụ hay không (TGC - Hoàn thành mục tiêu nhiệm vụ) và liệu mọi biến thể của một kịch bản có vượt qua hay không (SGC - Hoàn thành mục tiêu kịch bản, một thanh nghiêm ngặt hơn, tất cả hoặc không có gì). Định nghĩa đầy đủ có trong phần phụ lục. Ba cấu hình chúng tôi so sánh Bởi vì phần khó hiểu của bất kỳ nghiên cứu bộ nhớ nào là những gì thực sự có trong cửa sổ ngữ cảnh, nên chúng tôi xác định các cấu hình ở phía trước. Cả hai cấu hình bộ nhớ đều lấy từ cùng một bộ hướng dẫn, được khai thác một lần (thông qua vòng lặp ở trên) chỉ từ phần đào tạo của AppWorld. Những thay đổi giữa chúng chỉ là cách phân phối một bộ đó - bộ hướng dẫn đầy đủ đưa vào tất cả các bước đó, trong khi truy xuất được quản lý cung cấp một tập hợp con đã chọn - không bao giờ là cách tạo ra các nguyên tắc và không có dữ liệu phân tách thử nghiệm nào được đưa vào xây dựng nó. Cấu hình Có gì trong bối cảnh của tác nhân Đường cơ sở Không có bộ nhớ - đại lý được vận chuyển. Bộ hướng dẫn đầy đủ Mọi hướng dẫn được khai thác, được đưa vào mỗi bước ReAct. Truy xuất được sắp xếp Cốt lõi cố định, có độ tin cậy cao của những hướng dẫn tương tự.

Nguồn tin: Hugging Face Blog. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.