Quay lại thời điểm chúng tôi thực hiện podcast đầu tiên trên Cursor khi họ còn 5 người:
Và sau đó tóm tắt lại các đại lý tại ICML 2024 với Graham Neubig:
Và sau đó là kỷ nguyên thứ ba của họ vào năm 2026:
Và nói về cách họ thực hiện FDE trong Doanh nghiệp:
Bản tin AI ngày 13/8/2026-14/8/2026. Chúng tôi đã kiểm tra 12 subreddits, 544 Twitter và không có Discord nào nữa. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo trước đây. Xin nhắc lại, AINews hiện là một phần của Không gian tiềm ẩn. Bạn có thể chọn tham gia/không tham gia tần suất email!
Tóm tắt Twitter của AI
Đẩy giới hạn trọng lượng mở: GLM-5.3, Qwen3.8-27B/Max, DeepSeek V4-Pro và RedNote’ của Z.ai
Quay lại thời điểm chúng tôi thực hiện podcast đầu tiên trên Cursor khi họ còn 5 người:
Và sau đó tóm tắt lại các đại lý tại ICML 2024 với Graham Neubig:
Và sau đó là kỷ nguyên thứ ba của họ vào năm 2026:
Và nói về cách họ thực hiện FDE trong Doanh nghiệp:
Bản tin AI ngày 13/8/2026-14/8/2026. Chúng tôi đã kiểm tra 12 subreddits, 544 Twitter và không có Discord nào nữa. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo trước đây. Xin nhắc lại, AINews hiện là một phần của Không gian tiềm ẩn. Bạn có thể chọn tham gia/không tham gia tần suất email!
Tóm tắt Twitter của AI
Đẩy biên giới trọng lượng mở: GLM-5.3, Qwen3.8-27B/Max, DeepSeek V4-Pro của Z.ai và dots3-note của RedNote
GLM-5.3 của Z.ai: Câu chuyện kỹ thuật lớn nhất là Z.ai tung ra GLM-5.3, được định vị là một mô hình tập trung vào mã hóa và mạng được xây dựng thông qua đào tạo sau trên cùng một mô hình cơ sở 743B được sử dụng cho GLM-5.2 thay vì đào tạo trước mới. Z.ai và các bài đăng tiếp theo khẳng định mức tăng lớn trong các đánh giá về tác nhân và bảo mật, bao gồm Terminal Bench 3.0: 28.3, DeepSWE: 66.9, Bài kiểm tra cuối cùng của đại lý: 28.5 và GDPVal-AA: 1769 (tóm tắt băng ghế dự bị, điểm chuẩn đầy đủ). Công ty cũng cho biết khả năng mạng đã được cải thiện đủ để quyền truy cập ban đầu được kiểm soát đối với các đối tác được chọn trước khi phát hành phiên bản mở rộng cuối cùng sau khi xem xét an toàn (chi tiết). Tuyên bố chính mà nhiều kỹ sư nhấn mạnh là bước nhảy vọt về năng lực hoàn toàn đến từ quá trình đào tạo sau đào tạo/RL theo tỷ lệ đối với các nhiệm vụ thực thi trong thời gian dài hơn, chứ không phải từ mô hình cơ sở lớn hơn (phân tích, phản ứng).
Qwen3.8 mở rộng biên giới cục bộ/mở: Alibaba đã phát hành Qwen3.8-27B, một mô hình dày đặc đa phương thức gốc trong Apache 2.0, với bối cảnh gốc 262K có thể mở rộng lên 1M thông qua YaRN, đồng thời nêu bật mô hình cấp tối đa Qwen3.8-2.4T-A95B đã được phát hành (thông báo, chuỗi hoàn hảo). Mô hình 27B đáng chú ý vì nó được định vị rõ ràng cho mã hóa trong thế giới thực, quy trình làm việc văn phòng và đại lý thay vì chỉ là các tiêu chuẩn học thuật. Hỗ trợ suy luận ngày 0 rộng rãi một cách bất thường: vLLM, Ollama, llama.cpp/GGUF, SGLang báo cáo 206 tok/s trên một RTX 5090, cùng với các đối tác đám mây bao gồm Together, Fireworks, Modal, DigitalOcean, DeepInfra và các đối tác khác. Chi tiết triển khai thực tế rất quan trọng ở đây: Unsloth tuyên bố các bản dựng NVFP4 và GGUF động, đồng thời Qwen nhấn mạnh 27B trên RAM 17GB để sử dụng cục bộ (bài đăng).
DeepSeek V4-Pro và dots3-note của RedNote tiếp tục làn sóng mô hình mở của Trung Quốc: vLLM đã công bố hỗ trợ cho DeepSeek-V4-Pro, yêu cầu cấp phép MIT, khả năng tương thích điểm kiểm tra với đường dẫn xem trước và hỗ trợ soạn thảo tích hợp. Trong khi đó, phòng thí nghiệm AI của RedNote đã phát hành bản xem trước dots3-note, MoE đa phương thức 280B với thông số hoạt động 16B và ngữ cảnh 512K, nhắm đến các tác nhân hoạt động lâu dài và đi kèm với phương pháp RL mới, TEMPO, để tự đánh giá trong thời gian dài (tín hiệu sớm, tóm tắt, giải thích kỹ thuật từ nhóm). Mô hình mới nổi là nhiều phòng thí nghiệm chuyên môn của Trung Quốc: một số nhà bình luận đã xác định rõ ràng Z.ai, DeepSeek, Moonshot, Qwen, MiniMax và RedNote là một hệ sinh thái mở đang phát triển nhanh chóng với các thế mạnh khác nhau (tổng hợp này, tổng hợp khác).
Thời gian chạy, khai thác và đào tạo dài hạn của đặc vụ
DeepSeek Harness đang được coi là cơ sở hạ tầng chứ không phải là tác nhân demo: Bản phát hành đã làm dấy lên nhiều cuộc thảo luận về kiến trúc thời gian chạy hơn là UX mô hình. Một số nghiên cứu chuyên sâu đã mô tả khai thác như một thời gian chạy tác nhân được bổ sung, trong đó vòng lặp tác nhân, công cụ, phiên, hệ thống tệp và nhà cung cấp đều có thể thay thế được, trong đó Cordis cung cấp khả năng quản lý vòng đời, các phần phụ thuộc phản ứng và các hiệu ứng có thể đảo ngược (tổng quan, luồng khả năng kết hợp thời gian chạy). Điểm thú vị về mặt kỹ thuật không chỉ là “tính mô-đun” mà còn hỗ trợ các thành phần thời gian chạy trao đổi nóng và có khả năng cho phép các tác nhân sửa đổi thời gian chạy của chính chúng mà không cần khởi động lại, đồng thời duy trì nhật ký sự kiện có thể kiểm tra và tránh trạng thái ẩn. Nhiều nhà xây dựng đã phản ứng rằng các dây nịt hiện tại có thể “sai” hoặc ít nhất là quá cố định so với hướng này (phản ứng).
Dây nịt đang trở thành mục tiêu tối ưu hóa theo đúng nghĩa của chúng: Một số bài đăng củng cố rằng điểm chuẩn và lợi ích sản phẩm đang ngày càng đến từ lớp giàn giáo/dây nịt, không chỉ IQ mô hình cơ sở. DAIR nhấn mạnh AutoDesign, trong đó trình tối ưu hóa meta tự viết lại dây nịt dựa trên phản hồi triển khai; họ báo cáo mức tăng khi tạo và chuyển từ giấy sang áp phích qua các cấu hình tác nhân/mô hình. Thử nghiệm Tetris của Lambda đã đưa ra quan điểm tương tự từ góc độ ngược lại: vị trí, cài đặt và ràng buộc hộp cát nhanh chóng đã thay đổi kết quả về mặt vật chất và các tác nhân khai thác các lỗ hổng chuẩn trừ khi được giới hạn chặt chẽ. Điều này phù hợp với cuộc thảo luận rộng rãi hơn rằng dữ liệu về khả năng quan sát hiện đang thực hiện hai nhiệm vụ là evals, bộ nhớ và nền tảng học tập (ghi chú của tài liệu LangSmith).
Điểm chuẩn, đánh giá và thái độ hoài nghi về điểm chuẩn
Các evals mới nhắm vào các chế độ lỗi của tác nhân thực: Vals đã đưa ra một tiêu chuẩn kỹ thuật đảo ngược tác nhân tập trung vào các mục tiêu cuối cùng mang tính xác định trong cài đặt nhị phân có liên quan đến an ninh mạng thay vì các tạo phẩm trung gian; một bài đăng đồng hành lập luận rằng các đặc vụ biên giới hiện tại mạnh hơn nhiều khi có sẵn nguồn so với khi họ phải suy luận về các nhị phân (ngữ cảnh). OpenRouter đã giới thiệu các điểm chuẩn tìm kiếm trên web cho các tác nhân dựa trên công cụ, trong khi TutorMoments của Ai2 được coi là đánh giá dạy kèm dựa trên hoạt động lặp lại cho thấy các mô hình thường trợ giúp quá mức thay vì khuyến khích đấu tranh hiệu quả.
Phản ứng dữ dội về đánh giá vẫn tiếp tục: Một chủ đề lặp đi lặp lại là sự hoài nghi đối với các tuyên bố về điểm chuẩn của nhà cung cấp. Vik Paruchuri chỉ trích điểm chuẩn LlamaIndex, nói rằng các lỗi ghi điểm có thể khiến hệ thống chuyển từ 65% lên 93,6% và lập luận rõ ràng rằng các nhà phát triển nên chạy đánh giá của riêng họ thay vì tin tưởng vào hoạt động tiếp thị—“bao gồm cả của chúng tôi” (tiếp theo). François Chollet nhắc lại rằng tập trình diễn ARC-3 công khai không phải là dữ liệu huấn luyện hoặc đánh giá và điểm số trên bảng xếp hạng là các proxy yếu cho hiệu suất của tập riêng tư. Một bổ sung đáng giá khác ở đây là Wiggle Framework của Meta, được Omar Sar nhấn mạnh: nó kiểm tra căng thẳng các thẩm phán LLM dưới áp lực nhắc lại và đối nghịch, việc tìm ra các phán quyết có thể lật ngược tình thế 25–
Nguồn tin: Latent Space. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.