
Các nhà nghiên cứu của Google đã tìm ra cách ngăn chặn các tác nhân AI tự cải thiện ghi nhớ các bài kiểm tra của chúng.
Các tác nhân AI tự cải thiện có xu hướng ghi nhớ các tác vụ thử nghiệm của chúng, khiến hiệu suất cải thiện giảm sút hoặc biến mất trên các tác vụ mới. RRSI, một phương pháp mới từ các nhà nghiên cứu Google, đã kiểm soát được hiện tượng này và nâng cao điểm số trên các bộ dữ liệu chưa từng thấy lên tới 4,7 điểm, đồng thời sử dụng ít hơn khoảng 30% số token so với phiên bản không được điều chỉnh. Bài viết "Các nhà nghiên cứu Google tìm ra cách ngăn chặn các tác nhân AI tự cải thiện ghi nhớ các bài kiểm tra của chúng" xuất hiện lần đầu trên The Decoder.
Cộng thêm
Nghiên cứu AI
Sao chép URL vào khay nhớ tạm
Chia sẻ bài viết này
Đi đến phần bình luận
Các nhà nghiên cứu của Google tìm ra cách ngăn chặn các tác nhân AI tự cải thiện ghi nhớ các bài kiểm tra của chúng
Jonathan Kemper
Ngày 4/10/2026
Các tác nhân AI liên tục tối ưu hóa môi trường làm việc của chính chúng có xu hướng nhanh chóng chuyên biệt hóa quá mức vào các nhiệm vụ kiểm tra. Một phương pháp mới từ Google Cloud AI Research và một số trường đại học nhằm ngăn chặn điều đó, đồng thời cắt giảm chi phí tính toán.
Các tác nhân AI hiện đại bao bọc một mô hình ngôn ngữ cố định trong một cái gọi là "harness" (bộ khung điều khiển), một khuôn khổ gồm các lời nhắc (prompts), quy trình làm việc, công cụ, bộ nhớ và logic kiểm soát những gì mô hình nhìn thấy ở mỗi bước.
Bộ khung điều khiển quyết định liệu một tác nhân có đọc đúng tệp trước khi thay đổi nó, liệu nó có phục hồi sau lỗi hay không và liệu nó có cung cấp kết quả một cách rõ ràng hay không. Theo một bài nghiên cứu mới, phần lớn tiến bộ gần đây trong các tác nhân đến từ công việc trên bộ khung điều khiển, chứ không phải từ các mô hình mới.
Cho đến gần đây, việc này được thực hiện thủ công. Con người xem xét các lần chạy thất bại và vá bộ khung điều khiển bằng tay. Các phương pháp mới hơn tự động hóa vòng lặp bằng cách để một mô hình ngôn ngữ tự viết lại bộ khung điều khiển, lặp đi lặp lại, dựa trên phản hồi từ các nhiệm vụ kiểm tra.
Các nhà nghiên cứu gọi đây là một hình thức thực tế của sự tự cải thiện đệ quy. Hệ thống tạo ra phản hồi mà nó sử dụng để tối ưu hóa bộ khung điều khiển, từ đó kiểm soát hành vi của chính hệ thống.
Tự tối ưu hóa khiến các tác nhân ghi nhớ các nhiệm vụ kiểm tra của chúng
Bài báo cho thấy sự tự tối ưu hóa này đi kèm với một vấn đề. Bởi vì tác nhân liên tục làm việc trên cùng một tập hợp hạn chế các nhiệm vụ kiểm tra, nó cuối cùng sẽ ghi nhớ chúng. Điểm số của nó trên các nhiệm vụ đào tạo tăng lên, trong khi mức tăng trên các nhiệm vụ mới, chưa từng thấy bị thu hẹp hoặc biến mất hoàn toàn.
Các nhà nghiên cứu cho biết điều này xảy ra theo nhiều cách. Quá trình tìm kiếm ghi nhớ các mẫu chỉ phù hợp với một điểm chuẩn cụ thể, ưu tiên các ứng cử viên đạt điểm cao hoàn toàn do may mắn và chồng chất sự phức tạp không cần thiết làm tăng điểm kiểm tra mà không làm cho tác nhân tốt hơn.
Các phương pháp khác chủ yếu cải thiện trên các nhiệm vụ đào tạo, nhưng rất ít trong số đó được chuyển sang các điểm chuẩn chưa từng thấy. RRSI nâng cao điểm số ở đó trong cả ba lĩnh vực. | Hình ảnh: Google
Thu hẹp ngân sách chỉnh sửa và một nhà phê bình nghiêm khắc giữ cho bộ khung điều khiển mang tính tổng quát
RRSI (Regularized Recursive Self-Improvement of Agent Harnesses - Tự cải thiện đệ quy được điều chỉnh của bộ khung điều khiển tác nhân) hoạt động ở cả hai đầu của vòng lặp tối ưu hóa trong khi vẫn giữ cho bộ khung điều khiển có thể chỉnh sửa hoàn toàn. Khi hệ thống đề xuất các thay đổi mới, một ngân sách sẽ giới hạn số lượng chỉnh sửa độc lập mà một ứng cử viên có thể gộp lại cùng một lúc.
Ngân sách đó thu hẹp theo thời gian. Các vòng đầu cho phép viết lại lớn hơn, trong khi các vòng sau chỉ cho phép những thay đổi nhỏ có thể được truy nguyên rõ ràng đến một kết quả. Hệ thống cũng theo dõi các nỗ lực trước đó để không tiếp tục theo đuổi những ý tưởng thất bại tương tự. Khi tiến độ bị đình trệ, nó cố tình thử nghiệm các phần của bộ khung điều khiển mà nó chưa chạm tới.
RRSI kiểm soát sự tự tối ưu hóa tại hai điểm, khi đề xuất các thay đổi mới và khi quyết định thay đổi nào trong số đó trở thành một phần vĩnh viễn của bộ khung điều khiển. | Hình ảnh: Google
Khi chọn các thay đổi, một nhà phê bình xem xét mọi đề xuất và loại bỏ bất kỳ đề xuất nào mã hóa cứng tên nhiệm vụ, giải pháp hoặc các thủ thuật cụ thể theo điểm chuẩn khác. Một quy tắc khác chỉ chấp nhận chi phí tính toán cao hơn nếu chúng đi kèm với một mức tăng hiệu suất có thể đo lường được. Các thành phần không còn hữu ích sẽ bị loại bỏ.
Từ bỏ lợi ích huấn luyện mang lại hiệu quả trên các tác vụ mới
Các nhà nghiên cứu đã thử nghiệm RRSI trên tám bộ tiêu chuẩn bao gồm lập trình, công việc văn phòng tự động và thiết kế kỹ thuật. Mô hình cơ bản, Claude Opus 4.8, được giữ nguyên trong suốt quá trình. Nhóm đã so sánh RRSI với bộ điều khiển cơ bản không sửa đổi và bốn phương pháp tối ưu hóa gần đây.
Theo bài báo, RRSI đạt được tới 14,1 điểm trên các tác vụ đã được huấn luyện và tới 4,7 điểm trên năm bộ tiêu chuẩn chưa từng thấy. Nó cũng sử dụng ít hơn khoảng 30% token trong thời gian chạy so với phiên bản không được điều chỉnh. Hiệu suất tổng thể không bao giờ giảm xuống dưới mức cơ bản trên bất kỳ bộ tiêu chuẩn chưa từng thấy nào, điều thường xảy ra với một bộ điều khiển đã ghi nhớ các tác vụ của nó.
Bộ điều khiển RRSI cũng cải thiện trên mọi tác vụ ngoài tập huấn luyện, với mức tăng lớn nhất là 4,7 điểm trên JobBench. | Hình ảnh: Google
Mọi phương pháp đều hoạt động tốt trên các tác vụ huấn luyện, nhưng kết quả đảo ngược trên các tác vụ mới. Hai phương pháp thậm chí còn thấp hơn bộ điều khiển cơ bản. RRSI đạt được mức tăng huấn luyện nhỏ nhất trong tất cả các biến thể và là phương pháp duy nhất đạt được kết quả tốt hơn đáng kể so với mức cơ bản trên các tác vụ chưa từng thấy. Các biện pháp bảo vệ được thiết kế để tạo ra sự đánh đổi này.
Trong số các bộ điều khiển được tối ưu hóa, RRSI cần ít token và bước nhất, đồng thời hoạt động tốt nhất trên các tác vụ mới, mặc dù bộ điều khiển cơ bản không sửa đổi thậm chí còn tinh gọn hơn. | Hình ảnh: Google
Các bộ điều khiển được tối ưu hóa trên một mô hình cũng giúp các mô hình yếu hơn
Một bộ điều khiển lập trình được tối ưu hóa với Gemini 3.5 Flash đã nâng cao độ chính xác của Gemini 3.1 Flash Lite yếu hơn nhiều từ 11,2 lên 14,6 điểm mà không cần bất kỳ sửa đổi nào. Các cơ chế mà hệ thống tìm thấy không phụ thuộc vào khả năng của mô hình được sử dụng để khám phá chúng.
Các tác giả lưu ý rằng nghiên cứu của họ chỉ bao gồm các bộ điều khiển được xây dựng xung quanh các mô hình cố định và không đề cập đến các trường hợp trọng số mô hình thay đổi.
Họ kết luận rằng tự cải thiện chỉ làm cho các tác nhân AI đáng tin cậy hơn khi phản hồi lặp đi lặp lại được chuyển thành những thay đổi lâu dài. Mã nguồn có sẵn trên GitHub.
Các bộ điều khiển được thiết kế thủ công thường không tổng quát hóa được cho các tác vụ mới, như các thử nghiệm trên ARC-AGI-3 đã chỉ ra. Với một bộ điều khiển được xây dựng có mục đích, Opus 4.6 đạt 97,1% trong môi trường quen thuộc và 0% trong môi trường không quen thuộc. Nvidia gần đây đã giới thiệu SoL-Pi, một phương pháp liên quan trong đó một tác nhân nghiên cứu tự động xây dựng lại bộ điều khiển của các tác nhân lập trình. Nó cắt giảm việc sử dụng token tới 49% mà không làm giảm hiệu suất đáng kể.
Ngay trước đó, Google đã để các tác nhân "mơ" về các lần tìm kiếm trước đây để cải thiện chiến lược tìm kiếm của họ. Công trình đó cũng không thay đổi mô hình.
Nguồn tin: The Decoder — Tác giả: Jonathan Kemper. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.