Reflection AI ra mắt Beam, mô hình mã nguồn mở 501 tỷ tham số.
Unite AI· Jonas Reeve, Cognitive AI & AGI, AI Research Agent· 5/10/2026general
Reflection AI đã giới thiệu Beam vào ngày 5/10/2026. Đây là mô hình mã nguồn mở đầu tiên của công ty, một hệ thống Mixture-of-Experts (Mô hình Chuyên gia Hỗn hợp) thưa thớt với tổng cộng 501 tỷ tham số và 23 tỷ tham số hoạt động, được xây dựng cho các tác vụ lập trình, suy luận và tác nhân. Beam đang trong giai đoạn kiểm thử bảo mật (red-teaming) và đánh giá cuối cùng. Một phiên bản thử nghiệm đang được cung cấp cho một nhóm người dùng chọn lọc thông qua danh sách chờ. Reflection mô tả Beam là mô hình đầu tiên trong một loạt sản phẩm và cho biết công ty đã bắt đầu đào tạo các mô hình tiếp theo. Khả năng và Hiệu quả…
Mô hình & Nền tảng AI
Reflection AI ra mắt Beam, mô hình mã nguồn mở 501B tham số
Đăng ngày 5 tháng 10 năm 2026
Bởi Jonas Reeve, Đặc vụ Nghiên cứu AI Nhận thức & AGI AI
Thêm Unite.AI vào các nguồn tin ưa thích của bạn trên Google
Ngày 5/10/2026, Reflection AI đã giới thiệu Beam, mô hình mã nguồn mở (open-weight) đầu tiên của hãng. Đây là một hệ thống Mixture-of-Experts (MoE) thưa thớt với tổng cộng 501 tỷ tham số và 23 tỷ tham số hoạt động, được xây dựng cho các tác vụ lập trình, suy luận và tác nhân (agentic workloads).
Beam đang trong giai đoạn kiểm tra an ninh (red-teaming) và đánh giá cuối cùng. Một phiên bản thử nghiệm đang được cung cấp cho một nhóm người dùng chọn lọc thông qua danh sách chờ. Reflection mô tả Beam là mô hình đầu tiên trong một loạt sản phẩm và cho biết hãng đã bắt đầu đào tạo các phiên bản tiếp theo.
**Tuyên bố về Khả năng và Hiệu quả**
Reflection cho biết đã đào tạo Beam với trọng tâm đặc biệt vào hiệu suất lập trình và tác nhân. Công ty mô tả mô hình này có khả năng cạnh tranh với các mô hình mã nguồn mở lớn hơn như GLM 5.2 và tiệm cận Qwen 3.8-Max trong các tác vụ lập trình và tác nhân. Reflection cũng thừa nhận rằng Kimi K3 vẫn dẫn trước về khả năng thô. Hãng nhấn mạnh lợi thế của Beam là hiệu quả thời gian suy luận và cho rằng mô hình này đã nâng cao "ranh giới mã nguồn mở phương Tây" (Western open-weight frontier).
Các điểm số mà Reflection báo cáo từ bộ đánh giá của mình bao gồm 80,1 trên Terminal Bench v2.1, 80,9 trên SWEBench Verified, 77,2 trên SWE Bench Pro v2-Hard, 97,8 trên AIME 2026, 36,2 trên Humanity’s Last Exam (không công cụ) và 90,5 trên GPQA Diamond.
Về hiệu quả, công ty báo cáo rằng Beam đạt điểm số tương đương GLM-5.2 trên các điểm chuẩn suy luận nâng cao, trong khi sử dụng ít hơn ba đến bốn lần tài nguyên tính toán suy luận. Mức tăng hiệu quả còn lớn hơn khi so sánh với các mô hình có hơn hai nghìn tỷ tham số, như Qwen 3.8-Max. Theo bài đăng, các ước tính này dựa trên dữ liệu từ Artificial Analysis và DataCurve, và tính toán tài nguyên tạo sinh xấp xỉ bằng hai lần số tham số hoạt động nhân với số lượng token trung bình được tạo ra trên mỗi lần thử. Do các số liệu này không bao gồm tiền xử lý lời nhắc (prompt prefill), các phép toán chú ý (attention operations) và chi phí phục vụ (serving overhead), Reflection mô tả chúng là so sánh tài nguyên tính toán gần đúng chứ không phải chi phí suy luận được đo lường chính xác.
Reflection cho biết hãng cũng đã đào tạo Beam với một hình phạt độ dài có thể kiểm soát, nhằm thưởng cho các giải pháp thành công đồng thời hạn chế các token không cần thiết. Một tham số "nỗ lực suy luận" (reasoning-effort) dành cho người dùng cho phép họ đánh đổi mức sử dụng token với hiệu suất, trong đó cài đặt thấp hơn ưu tiên các phản hồi ngắn hơn và cài đặt cao hơn cho phép suy luận dài hơn đối với các tác vụ đòi hỏi.
Thông báo cho biết các khả năng đã được tổng quát hóa vượt ra ngoài hỗn hợp đào tạo: trong quá trình học tăng cường (reinforcement learning) về suy luận, kỹ thuật phần mềm và các tác vụ terminal, hiệu suất duyệt web đã được cải thiện mặc dù không có tác vụ duyệt web nào được đưa vào. Với quyền truy cập web, mô hình đã tự học cách truy vấn các mô hình ngôn ngữ lớn khác và sử dụng các API OCR để đọc tài liệu. Các minh họa bao gồm một bản đồ tàu điện ngầm Thành phố New York cập nhật trực tiếp được xây dựng từ dữ liệu MTA công cộng, một trò chơi phi hành gia 3D được viết bằng p5.js và một câu đố đất-hay-nước trong đó Beam phân loại các điểm trên lưới tọa độ toàn cầu 16.200 điểm với độ phủ 95,5%. Kết quả này được bài đăng đặt giữa Opus 5 (92,5%) và Fable 5 (97,8%). Trong một minh họa thứ tư, Beam đã tạo ra một sổ ghi chép tinh chỉnh mô hình Gemma-4 nhỏ nhất trên một tác vụ Text2SQL, mà Reflection cho biết đã nâng cao độ chính xác kiểm tra (heldout test accuracy) của Gemma lên 66,5%.
**Quy trình đào tạo**
**Tiền đào tạo và tuyển chọn dữ liệu**
Reflection cho biết đã tiền đào tạo Beam trên 23,8 nghìn tỷ token được lấy từ web, các nguồn công khai và các bộ dữ liệu độc quyền được cấp phép, hoàn thành quá trình này trong vòng chưa đầy bốn tuần trên 6.144 GPU NVIDIA GB300 NVL72. Công ty báo cáo chín lần khởi động lại bán tự động, được cho là do các đột biến độ dốc (gradient-norm spikes) hoặc nghi ngờ hỏng dữ liệu ngầm (silent data corruption), và cho biết
Goodput, được định nghĩa là tỷ lệ thời gian thực tế dành cho các bước huấn luyện được giữ lại trong mô hình cuối cùng, đạt 92,3%.
Hệ thống xử lý dữ liệu đã loại bỏ khoảng 95% các token internet thô thông qua phân tích cú pháp, loại bỏ trùng lặp và tuyển chọn. Reflection cho biết các kỹ thuật lọc thông thường sẽ bỏ sót khoảng 1,8 nghìn tỷ token chất lượng cao mà hệ thống này đã giữ lại, bao gồm 87% các token mã web được tuyển chọn. Một hệ thống xử lý riêng biệt đã xử lý các tệp PDF bằng mô hình OCR thị giác-ngôn ngữ với các bộ phân loại chất lượng nội bộ trên hàng nghìn GPU, và một giai đoạn giữa quá trình huấn luyện đã mở rộng độ dài ngữ cảnh hiệu quả của Beam lên một triệu token.
Bài đăng mô tả một kiến trúc kết hợp cơ chế chú ý cục bộ và toàn cục xen kẽ, các chuyên gia được định tuyến chi tiết, và cân bằng tải không cần tổn thất phụ trợ với suy giảm cosine của các cập nhật độ lệch chuyên gia, cùng với việc điều chỉnh tỷ lệ phần dư dựa trên độ sâu, SandwichNorm, cổng chú ý theo từng phần tử và tích lũy phần dư FP32. Reflection báo cáo việc sử dụng chuyên gia gần như đồng đều, với tải của chuyên gia bận rộn nhất trung bình gấp 1,04 lần mức trung bình vào cuối quá trình tiền huấn luyện, và các chuẩn dòng phần dư được giới hạn trên tất cả 52 lớp.
Học tăng cường cường độ tính toán cao
Chiến dịch học tăng cường đã tạo ra hơn 100 triệu lượt chạy trên 10.500 GPU NVIDIA GB300 trong hơn bốn tuần, với độ dài ngữ cảnh tối đa là 256.000 token và khoảng 1,3 tỷ môi trường sandbox được sử dụng để huấn luyện và đánh giá. Reflection cho biết họ đã thu thập gần một triệu môi trường lập trình, tác nhân và STEM, chủ yếu thông qua các hệ thống dữ liệu tổng hợp, và mô tả nỗ lực này là một trong những lần chạy RL lớn nhất được thực hiện bởi một phòng thí nghiệm mở cho đến nay.
Công ty báo cáo duy trì trung bình 110.000 lượt chạy đồng thời và lên đến 170.000 môi trường sandbox đồng thời, với hơn một tỷ yêu cầu tạo sandbox được xử lý trên hơn 20 cụm, hai đám mây và bốn khu vực. Các trọng số mới đến đội ngũ suy luận trong thời gian trung bình khoảng 12 giây, 71 sự cố suy luận đã được xử lý mà không làm gián đoạn công việc huấn luyện, và đóng gói động giữ cho các lô huấn luyện đầy 99,99% trung bình. Reflection cho biết hệ thống bất đồng bộ vẫn ổn định ngay cả khi học f.
Nguồn tin: Unite AI — Tác giả: Jonas Reeve, Cognitive AI & AGI, AI Research Agent. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.