Bỏ qua tới nội dung chính
Quay lại tin tức

Meta công bố mã nguồn mở Muse Glimmer: Mô hình tác nhân cục bộ 30B được tối ưu hóa cho việc thực thi trên thiết bị

InfoQ AI· Olimpiu Pop· 14/8/2026general

Meta AI Research đã giới thiệu Muse Glimmer, một mô hình mã nguồn mở với 30 tỷ tham số theo giấy phép Apache 2.0, được thiết kế cho các quy trình làm việc cục bộ. Mô hình này cho phép các tác nhân tự động và thực thi tác vụ phức tạp trên các GPU tiêu dùng mà không cần phụ thuộc vào các API đám mây. Muse Glimmer sử dụng phương pháp huấn luyện đa giai đoạn để đạt hiệu suất hiệu quả và hỗ trợ đầu vào đa phương thức, nâng cao các tác vụ lập trình và tự động hóa.

Trang chủ InfoQ Tin tức Meta công bố mã nguồn mở Muse Glimmer: Một mô hình tác nhân cục bộ 30B được tối ưu hóa cho việc thực thi trên thiết bị AI, ML & Kỹ thuật dữ liệu Meta công bố mã nguồn mở Muse Glimmer: Một mô hình tác nhân cục bộ 30B được tối ưu hóa cho việc thực thi trên thiết bị Ngày 14/8/2026 2 phút đọc Bởi Olimpiu Pop Theo dõi chúng tôi trên Youtube 232K người theo dõi Linkedin 26K người theo dõi Instagram Mới RSS 19K độc giả X 57.1k người theo dõi Facebook 21K lượt thích Bluesky Mới Nghe bài viết này - 0:00 Âm thanh sẵn sàng phát Trình duyệt của bạn không hỗ trợ phần tử âm thanh. 0:00 0:00 Thông thường 1.25x 1.5x Thích Danh sách đọc Meta AI Research đã công bố Muse Glimmer, một mô hình mã nguồn mở 30 tỷ tham số được phát hành theo giấy phép Apache 2.0. Được thiết kế đặc biệt cho các quy trình làm việc cục bộ luôn hoạt động, Muse Glimmer cho phép các nhà phát triển chạy các tác nhân tự động, gọi công cụ phức tạp, viết mã cục bộ và đánh giá LLM-as-a-judge trực tiếp trên GPU tiêu dùng và máy trạm mà không phụ thuộc vào các API đám mây. Kiến trúc mô hình Muse Glimmer 30B và các điểm chuẩn tác nhân. Nguồn: Sebastian Raschka Để cung cấp khả năng thực thi tác nhân trong giới hạn bộ nhớ nghiêm ngặt, Meta đã áp dụng chiến lược đào tạo đa giai đoạn bắt nguồn từ mô hình chủ lực lớn hơn của họ, Muse Spark: * **Chưng cất Logit (Tiền đào tạo):** Mô hình chuyển giao các khả năng suy luận nền tảng từ Muse Spark bằng cách sử dụng tập dữ liệu tiền đào tạo phù hợp. * **Đào tạo giữa kỳ:** Quá trình đào tạo được mở rộng trên các chuỗi ngữ cảnh dài chứa các dấu vết suy luận phức tạp, dữ liệu văn bản và hình ảnh xen kẽ, cùng các quỹ đạo gọi công cụ đa bước. * **Căn chỉnh sau đào tạo:** Sự kết hợp giữa Tinh chỉnh có giám sát (SFT), chưng cất theo chính sách và Học tăng cường (RL) tinh chỉnh hiệu suất đa miền trên các tác vụ tạo mã, sử dụng công cụ và lập kế hoạch có cấu trúc. Một bộ mã hóa nhận thức chuyên dụng 1,8 tỷ tham số cho phép Muse Glimmer xử lý các đầu vào đa phương thức xen kẽ một cách tự nhiên, cho phép các tác nhân cục bộ diễn giải ảnh chụp màn hình, sơ đồ và tài liệu trực tiếp trong quá trình thực thi mã hoặc tự động hóa quy trình làm việc. Các mô hình 30 tỷ tham số không nén thường yêu cầu hơn 55 GB VRAM, khiến chúng vượt quá khả năng của phần cứng tiêu dùng tiêu chuẩn. Muse Glimmer giải quyết vấn đề này thông qua hai tối ưu hóa thời gian chạy chính: Lượng tử hóa động: Sử dụng nén động 4-bit (K-Quant), dung lượng mô hình giảm xuống khoảng 17 GB đến 20 GB. Điều này tạo ra đủ không gian bộ nhớ đệm trong các giới hạn GPU/NPU tiêu chuẩn từ 24 GB đến 32 GB cho bộ nhớ đệm Key-Value (KV), các nhúng nhận thức và chi phí giải mã suy đoán. Giải mã suy đoán DFlash: Thay vì dự đoán từng token một, Muse Glimmer kết hợp với một mô hình "drafter" (bản nháp) nhẹ dựa trên kiến trúc DFlash. Drafter đề xuất các khối đa token mà mô hình cơ sở xác thực song song, mang lại hiệu suất tạo tăng tới 3,1 lần trên các phần cứng như Apple Silicon (M4/M5 Max) và card NVIDIA RTX 5090. Muse Glimmer được huấn luyện để thực hiện các kế hoạch dài hạn và xử lý các trạng thái lỗi không mong muốn. Khi một lệnh gọi API hoặc lệnh terminal trả về lỗi, mô hình sẽ chẩn đoán lỗi và thử các đường dẫn thay thế thay vì chấm dứt thực thi. Nó hỗ trợ các khung tác nhân như OpenClaw và có tính năng điều chỉnh mức độ nỗ lực suy luận, cho phép các nhà phát triển cân bằng giữa tốc độ thực thi và chất lượng quyết định. Trong các đánh giá chuẩn hóa – bao gồm SWE-Bench, DeepSearch QA, τ-Bench và MCP-Atlas – Muse Glimmer đạt tỷ lệ thành công cao so với các mô hình mở hàng đầu trong phân khúc 30B. Khi được đánh giá so với các mô hình cùng phân khúc như Gemma 4 31B và Qwen 3.6 27B, Muse Glimmer thể hiện độ tin cậy công cụ đa bước và khả năng phục hồi lỗi vượt trội, đồng thời duy trì năng lực lập trình và suy luận tổng quát cạnh tranh. Trọng số mô hình có sẵn trên Hugging Face. Meta đã hợp tác với cộng đồng mã nguồn mở để cung cấp khả năng thực thi gốc trên các khung cục bộ phổ biến, bao gồm llama.cpp, ExecuTorch, Apple MLX, Ollama, LM Studio và vLLM. Các quy trình tinh chỉnh cũng được hỗ trợ thông qua khung TorchTitan của PyTorch. Muse Glimmer đại diện cho một sự thay đổi đáng kể hướng tới các tác nhân AI cục bộ khả thi, có năng lực cao, bảo vệ quyền riêng tư dữ liệu đồng thời duy trì độ trễ thấp trong thực thi. Để chạy mô hình này hiệu quả trên máy tính cá nhân, khuyến nghị một hệ thống được trang bị 24 GB đến 32 GB bộ nhớ hợp nhất hoặc VRAM – chẳng hạn như máy Mac với chip M4/M5 Max hoặc PC với GPU hiện đại như RTX 5090 hoặc RTX 4090. Giới hạn phần cứng này đảm bảo đủ bộ nhớ cho các trọng số 4-bit đã được lượng tử hóa cùng với bộ mã hóa thị giác, drafter DFlash và bộ nhớ đệm ngữ cảnh KV cần thiết cho các phiên tác nhân kéo dài.

Nguồn tin: InfoQ AI — Tác giả: Olimpiu Pop. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.