
Ghi chú kiến trúc Muse Glimmer 30B
Ghi chú kiến trúc ngắn gọn về Meta Muse Glimmer 30B, bao gồm GQA (Grouped-Query Attention) cục bộ và toàn cục có cổng, hiệu quả bộ nhớ đệm KV (KV-cache), và so sánh điểm chuẩn tại thời điểm phát hành.
Meta đã phát hành một mô hình ngôn ngữ lớn (LLM) mã nguồn mở mới vào ngày hôm qua, điều chưa từng xảy ra kể từ thời Llama.
Mô hình Meta Muse Glimmer là một mô hình suy luận đa phương thức 30B với kiến trúc tương tự Gemma. ("Glimmer" có thể là cách chơi chữ của "Spark", mô hình có khả năng hơn mà từ đó Glimmer được chắt lọc. Muse Spark hiện chỉ có sẵn thông qua API mô hình của Meta.)
Về kiến trúc, dưới đây là một số điểm chính:
* Cửa sổ ngữ cảnh "chỉ" 131k, so với Qwen3.6 và Gemma 4 hỗ trợ gấp đôi con số này một cách tự nhiên; đây là mức hợp lý nhưng có thể hơi ngắn trong thời đại của các hệ thống tác nhân.
* Đây là một mô hình dày đặc (dense model), không phải mô hình hỗn hợp chuyên gia (mixture-of-experts). (Vì vậy, việc so sánh nó với Qwen3.6 27B sẽ công bằng hơn là với Qwen3.6 30B-A3B.)
* Sử dụng cơ chế chú ý lai (hybrid attention) với chú ý truy vấn nhóm (grouped-query attention - GQA) và chú ý cửa sổ trượt (sliding window attention - SWA); tỷ lệ SWA:GQA là 3:1 giữa cục bộ và toàn cục. Các mô hình khác như Gemma 4, sử dụng các thành phần tương tự, có tỷ lệ 5:1 để so sánh.
* Mô hình áp dụng cơ chế chú ý có cổng (gated attention) cho cả GQA và SWA; chú ý có cổng đã trở nên khá phổ biến trong những tháng gần đây. Về cơ bản, nó áp dụng một cổng sigmoid cho đầu ra của cơ chế chú ý để quyết định lượng thông tin chú ý đi vào kết nối dư (residual connection). Điểm thú vị là nó sử dụng GQA và SWA tương đối tiêu chuẩn thay vì các cơ chế chú ý lai như Nemotron hoặc Qwen3.6.
* Tỷ lệ GQA rất cực đoan: 32 đầu truy vấn (query heads) và chỉ 2 đầu KV (KV heads); để so sánh, Gemma 4 31B sử dụng 32 Q / 16 KV ở các đầu cục bộ và 32 Q / 4 KV ở các đầu toàn cục. Điều này có nghĩa là Meta Glimmer có bộ nhớ đệm KV (KV cache) rất nhỏ.
Nhìn chung, kiến trúc có lẽ tương tự nhất là Gemma 3 27B (bao gồm cả vị trí RMSNorm trước/sau theo kiểu Gemma) và Gemma 4 31B, nhưng có một số điều chỉnh như hàm kích hoạt SwiGLU thay vì GeGLU, cơ chế chú ý có cổng và mẫu GQA:SWA cực đoan hơn đã đề cập trước đó.
Điểm nổi bật là hiệu quả bộ nhớ đệm KV cực cao của nó.
Cụ thể, tỷ lệ KV CACHE / TOKEN (trong BF16) là:
* Muse Glimmer: 52 KiB (thấp hơn là tốt hơn)
* Qwen3.6 27B: 64 KiB
* Gemma 4 31B: 840 KiB
Về hiệu suất mô hình, các điểm chuẩn của chính Meta cho thấy nó chủ yếu vượt trội hơn Qwen3.6. Theo các điểm chuẩn tổng hợp độc lập trên Artificial Analysis Intelligence Index, nó hơi kém hơn Qwen3.6 (xem hình dưới đây). Do đó, vài ngày sử dụng sẽ cho biết vị trí thực sự của nó.
Nhìn chung, đây có vẻ là một mô hình vững chắc, đặc biệt cho các quy trình làm việc tác nhân (agentic workflows). Điểm nổi bật nhất là dung lượng bộ nhớ rất thấp cùng với tốc độ tiền xử lý (prefill) và giải mã (decode) khá nhanh. Việc Meta tiếp tục phát hành các mô hình mã nguồn mở cũng là một điều đáng mừng.
Hình 1. Kiến trúc Meta Muse Glimmer 30B, điểm chuẩn DGX Spark Ollama và so sánh Artificial Analysis Agentic Index. Xem Muse Glimmer 30B trong thư viện kiến trúc để biết thêm chi tiết.
Nguồn: phiên bản trang web của ghi chú Substack của tôi.
Nguồn tin: Sebastian Raschka. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.