Meta đang phát hành Muse Glimmer theo giấy phép Apache 2.0 dành cho các tác nhân AI cục bộ có thể chạy trên GPU tiêu dùng.
Phòng thí nghiệm Superintelligence Labs của công ty đã công bố trọng số của mô hình 30 tỷ tham số trên Hugging Face. Meta cho biết các nhà phát triển có thể sử dụng mô hình này cho việc lập trình cục bộ, gọi hàm, tác nhân cục bộ và đánh giá LLM-as-a-judge.
Việc phát hành này nhằm giải quyết một hạn chế vận hành mà các nhóm AI đang đối mặt: các mô hình được lưu trữ trên đám mây cần truy cập mạng và cơ sở hạ tầng trung tâm. Thay vào đó, Meta đề xuất Muse Glimmer cho các khối lượng công việc yêu cầu mô hình trên thiết bị, bao gồm các tác nhân cá nhân có quyền truy cập vào lịch trình, thông tin cá nhân.
Meta đang phát hành Muse Glimmer theo giấy phép Apache 2.0 cho các tác nhân AI cục bộ có thể chạy trên GPU tiêu dùng.
Phòng thí nghiệm Superintelligence Labs của công ty đã công bố trọng số của mô hình 30 tỷ tham số trên Hugging Face. Meta cho biết các nhà phát triển có thể sử dụng mô hình này cho việc lập trình cục bộ, gọi hàm, tác nhân cục bộ và đánh giá LLM-as-a-judge.
Việc phát hành này nhằm giải quyết một hạn chế vận hành mà các nhóm AI đang đối mặt: các mô hình được lưu trữ trên đám mây cần truy cập mạng và cơ sở hạ tầng trung tâm. Thay vào đó, Meta đề xuất Muse Glimmer cho các khối lượng công việc yêu cầu mô hình trên thiết bị, bao gồm các tác nhân cá nhân có quyền truy cập vào lịch trình, tin nhắn, tệp và các ngữ cảnh riêng tư khác.
Meta Muse Glimmer dẫn đầu một số tiêu chuẩn tác vụ tác nhân
Các bài kiểm tra tiêu chuẩn của Meta cho thấy Muse Glimmer vượt trội hơn Gemma4-31B và Qwen3.6-27B trên 5 trong số 8 tiêu chuẩn tác nhân tổng quát. Mô hình đạt 75,5 điểm trên MCP Atlas. Gemma4-31B đạt 54,2 điểm và Qwen3.6-27B ghi nhận 62,5 điểm.
DeepSearch QA cũng theo một mô hình tương tự. Meta báo cáo Muse Glimmer đạt 74,6 điểm, so với 61,7 điểm của Gemma4-31B và 71,1 điểm của Qwen3.6-27B. Thông báo được cung cấp xác định cả hai tiêu chuẩn này là các bài kiểm tra khả năng của tác nhân trong việc hoạt động trong các khung và hoàn thành các yêu cầu đa lượt.
Mô hình đạt 23,5 điểm trên τ²-Banking. Gemma4-31B ghi nhận 15,1 điểm. Qwen3.6-27B đạt 16,7 điểm.
Muse Glimmer cũng đạt 47,6 điểm trên WildClawBench, vượt trội hơn 37,6 điểm của Gemma4-31B và 43,2 điểm của Qwen3.6-27B. Kết quả GAIA2 của nó đạt 43,3 điểm, so với 36,4 và 40,0 điểm tương ứng.
Các điểm số tác nhân khác ủng hộ Qwen3.6-27B. Bảng của Meta cho thấy mô hình này đạt 1.141 điểm trên GDPval-AA, so với 953 điểm của Muse Glimmer và 811 điểm của Gemma4-31B. Qwen3.6-27B cũng dẫn đầu SkillsBench với Skills đạt 46,6 điểm, trong khi Muse Glimmer ghi nhận 44,3 điểm.
OSWorld-Verified tạo ra khoảng cách lớn nhất trong nhóm này. Meta báo cáo Qwen3.6-27B đạt 75,6 điểm. Muse Glimmer đạt 65,9 điểm và Gemma4-31B đạt 58,5 điểm.
Các bài kiểm tra này đo lường các tác vụ bị giới hạn. Chúng không thể hiện cách một tác nhân cục bộ sẽ hoạt động sau khi một tổ chức kết nối nó với các tệp, lịch, hệ thống nhắn tin hoặc công cụ nội bộ của mình.
Kết quả lập trình chia đều giữa Muse Glimmer và Qwen
Kết quả lập trình của Muse Glimmer cho thấy một so sánh hẹp hơn. Mô hình dẫn đầu SWE-Bench Pro với 51,2 điểm. Meta báo cáo Gemma4-31B đạt 36,9 điểm và Qwen3.6-27B đạt 50,2 điểm.
SciCode cho kết quả sát sao. Muse Glimmer đạt 43,6 điểm, cao hơn một chút so với Gemma4-31B ở mức 43,4 điểm. Qwen3.6-27B ghi nhận 39,8 điểm.
Qwen3.6-27B dẫn đầu hai đánh giá lập trình khác. Nó đạt 77,2 điểm trên SWE-Bench Verified, so với 76,0 điểm của Muse Glimmer. TerminalBench 2.1 cho Qwen3.6-27B 60,7 điểm; Muse Glimmer đạt 51,7 điểm và Gemma4-31B đạt 43,4 điểm.
Một tác nhân lập trình cục bộ không chỉ tạo ra mã. Nó cần một khung quyết định các kho lưu trữ, thiết bị đầu cuối, môi trường kiểm thử và lệnh mà mô hình có thể truy cập. Meta cho biết Muse Glimmer hỗ trợ OpenClaw và các mẫu điều phối tác nhân khác, với các khung tùy chỉnh được đề cập trong tài liệu dành cho nhà phát triển của họ.
Một tổ chức đánh giá mô hình cho công việc phần mềm nên xác định các lệnh và kho lưu trữ có sẵn cho tác nhân trước khi đo lường mức độ thành công của tác vụ. Tài liệu được cung cấp mô tả việc đào tạo lại cho các lệnh gọi công cụ không thành công. Hành vi đó yêu cầu kiểm soát các lần thử lại, đặc biệt khi một công cụ có thể thay đổi mã nguồn hoặc gọi một hệ thống bên ngoài.
Điểm số đa phương thức ủng hộ Qwen trong hầu hết các bài kiểm tra.
Muse Glimmer chấp nhận văn bản và hình ảnh xen kẽ thông qua một bộ mã hóa nhận thức chuyên dụng. Meta cho biết thiết kế này cho phép các tác nhân (agent) diễn giải ảnh chụp màn hình, biểu đồ và tài liệu như một phần của cuộc hội thoại.
Biểu đồ điểm chuẩn cho thấy Muse Glimmer dẫn đầu về khả năng suy luận Charxiv. Điểm số của mô hình này đạt 78,8, so với 77,7 của Gemma4-31B và 78,4 của Qwen3.6-27B.
Qwen3.6-27B dẫn đầu ScreenSpot Pro với 76,1 điểm. Muse Glimmer đạt 75,4 điểm và Gemma4-31B đạt 75,9 điểm. Cùng một mô hình này cũng dẫn đầu OmniDocBench v1.5 với 77,8 điểm, so với 75,8 điểm của Muse Glimmer và 72,5 điểm của Gemma4-31B.
MMMU Pro cho thấy sự khác biệt nhỏ hơn. Meta liệt kê Muse Glimmer đạt 74 điểm. Qwen3.6-27B đạt 75 điểm và Gemma4-31B đạt 73 điểm.
Những kết quả này có ý nghĩa quan trọng đối với các nhóm đang xem xét các tác nhân hoạt động trên giao diện trực quan. Một mô hình đọc ảnh chụp màn hình có thể diễn giải những gì nó nhìn thấy, tuy nhiên, việc thử nghiệm cục bộ vẫn phải bao gồm các quyền, bố cục hiển thị, định dạng tài liệu và các lỗi trả về từ các công cụ được kết nối.
Số liệu an toàn cho thấy tỷ lệ thành công tấn công được báo cáo thấp hơn Qwen.
Meta cũng báo cáo hai đánh giá liên quan đến an toàn: CI Memories và Siren AgentDojo. Biểu đồ sử dụng các thước đo khác nhau cho mỗi thử nghiệm.
Trên CI Memories, Meta liệt kê tỷ lệ vi phạm của Muse Glimmer là 26,4 và điểm bao phủ là 64,8. Gemma4-31B ghi nhận tỷ lệ vi phạm là 12,1 với điểm bao phủ là 53,0. Qwen3.6-27B có tỷ lệ vi phạm là 53,4 và điểm bao phủ là 66,9.
Kết quả Siren AgentDojo sử dụng tỷ lệ thành công tấn công và tiện ích. Meta đưa ra tỷ lệ thành công tấn công của Muse Glimmer là 28,4 và điểm tiện ích là 94,2. Gemma4-31B đạt 25,6 điểm về tỷ lệ thành công tấn công, với tiện ích là 90,8. Qwen3.6-27B ghi nhận 40,3 và 92,7 điểm.
Kết quả suy luận tổng quát bổ sung ngữ cảnh cho các tuyên bố về tác nhân.
Muse Glimmer dẫn đầu bốn trong sáu thử nghiệm về khả năng tổng quát và suy luận trong so sánh của Meta. Mô hình này đạt 77,0 điểm trên IFBench. Gemma4-31B ghi nhận 76,0 điểm và Qwen3.6-27B đạt 70,8 điểm.
Điểm AIME 2026 của Muse Glimmer là 94,7. Meta báo cáo 89,2 điểm cho Gemma4-31B và 94,1 điểm cho Qwen3.6-27B. Trên AA-LCR, Muse Glimmer đạt 80,0 điểm, vượt qua 68,3 và 73,3 điểm.
Mô hình này cũng dẫn đầu Beam 128K với 65,1 điểm. Qwen3.6-27B đạt 63,0 điểm. Gemma4-31B ghi nhận 58,2 điểm.
Gemma4-31B dẫn đầu GPQA Diamond với 85,7 điểm. Muse Glimmer đạt 83,5 điểm, tiếp theo là Qwen3.6-27B với 84,2 điểm. Gemma4-31B cũng đạt điểm cao nhất trên Humanity’s Last Exam, Text No Tools, với 23,6 điểm; Muse Glimmer đạt 22,0 điểm.
Không có mô hình nào dẫn đầu mọi thử nghiệm. Thay vào đó, kết quả của Meta cho thấy Muse Glimmer cạnh tranh sát sao với hai mô hình có kích thước tương tự trên một tập hợp hỗn hợp các đánh giá về tác nhân, mã hóa, thị giác, an toàn và suy luận.
Giới hạn bộ nhớ định hình thiết kế triển khai cục bộ.
Meta cho biết một mô hình 30 tỷ tham số độ chính xác đầy đủ sẽ yêu cầu hơn 55 GB bộ nhớ. Thay vào đó, Muse Glimmer sử dụng một
Nguồn tin: AI News — Tác giả: Ryan Daws. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.