Hôm nay, Microsoft giới thiệu MAI-Thinking-1, mô hình suy luận của Microsoft AI. Đây là một mô hình cỡ trung bình, nằm trong số những mô hình mạnh nhất cùng phân khúc. Mô hình này đạt hiệu suất tương đương với các mô hình hàng đầu trong các tiêu chuẩn kỹ thuật phần mềm chính, thể hiện khả năng suy luận toán học nâng cao và được ưu tiên hơn Sonnet 4.6 trong các đánh giá mù đôi bởi con người của chúng tôi. Chúng tôi không chắt lọc từ các phòng thí nghiệm khác và không dựa vào dữ liệu không rõ nguồn gốc. Các bộ dữ liệu của họ sạch, có thể truy nguyên và đạt chuẩn doanh nghiệp.
MAI-Thinking-1 là một bước tiến trong nỗ lực rộng lớn hơn của chúng tôi nhằm xây dựng Siêu trí tuệ Nhân văn (Humanist Superintelligence): các khả năng AI tiên tiến.
Hôm nay, Microsoft giới thiệu MAI-Thinking-1, mô hình suy luận của Microsoft AI. Đây là một mô hình cỡ trung bình, nằm trong số những mô hình mạnh nhất cùng phân khúc. Mô hình này sánh ngang với các mô hình hàng đầu trong các tiêu chuẩn kỹ thuật phần mềm chính, thể hiện khả năng suy luận toán học tiên tiến và được ưu tiên hơn Sonnet 4.6 trong các đánh giá mù đôi của chúng tôi. Chúng tôi không chắt lọc từ các phòng thí nghiệm khác và không dựa vào dữ liệu không rõ nguồn gốc. Các bộ dữ liệu của họ sạch, có thể truy xuất nguồn gốc và đạt chuẩn doanh nghiệp.
MAI-Thinking-1 là một bước tiến trong nỗ lực rộng lớn hơn của chúng tôi nhằm xây dựng Siêu trí tuệ Nhân văn (Humanist Superintelligence): các khả năng AI tiên tiến được thiết kế để phục vụ con người và tổ chức, chứ không phải để thay thế họ. Mô hình này quan trọng ở cả hai khía cạnh: những gì nó có thể làm và cách nó được xây dựng.
**Cỗ máy Leo đồi (The Hill-Climbing Machine)**
Không chỉ là một mô hình đơn lẻ, Microsoft đã giới thiệu Cỗ máy Leo đồi của họ: một quy trình đồng thiết kế được xây dựng để làm cho mọi thành phần của quá trình phát triển mô hình có thể "leo dốc", nhờ đó các khả năng được cải thiện liên tục và đáng tin cậy theo thời gian. Mục tiêu là một hệ thống có thể lặp lại, hấp thụ dữ liệu tốt hơn, phần thưởng mạnh mẽ hơn, môi trường có năng lực hơn và sức mạnh tính toán lớn hơn.
Ba trụ cột chính định hướng triết lý của MAI.
Thứ nhất, các khả năng nên được học, không phải kế thừa. Mặc dù nhanh hơn để tiếp thu, trí thông minh kế thừa thiếu khả năng điều khiển cần thiết cho việc sử dụng trong thế giới thực: một kẻ bắt chước về cơ bản bị ràng buộc bởi các lựa chọn thiết kế của người dạy và gặp khó khăn trong việc thích ứng với các tình huống mới. MAI-Thinking-1 được đào tạo mà không chắt lọc từ các mô hình bên thứ ba, buộc mô hình của chúng tôi phải thực sự học các nhiệm vụ hiện có.
Thứ hai, dữ liệu sạch. Họ đã đào tạo mô hình từ đầu trên dữ liệu sạch, có thể truy xuất nguồn gốc và đạt chuẩn doanh nghiệp, không chắt lọc từ các mô hình bên thứ ba. Điều này quan trọng đối với chất lượng, nguồn gốc và khả năng kiểm soát. Microsoft cho biết: "Nếu chúng tôi không thể giải thích điều gì đã định hình một mô hình, chúng tôi không thể hiểu đầy đủ hành vi của nó hoặc cải thiện nó một cách đáng tin cậy".
Thứ ba, tự chủ trên toàn bộ hệ thống. Từ việc đồng thiết kế các mô hình của MAI với các bộ tăng tốc riêng của MSFT cho đến khuôn khổ học tăng cường của họ, họ đã tập trung nỗ lực vào cơ sở hạ tầng đào tạo nội bộ. Đây là một phần quan trọng trong việc xây dựng cỗ máy leo đồi, nhằm đảm bảo họ có thể tối ưu hóa và định hình hoàn toàn các hệ thống của MAI từ đầu đến cuối để phục vụ tốt nhất các nhu cầu.
**Mô hình cỡ trung bình, với hiệu suất kỹ thuật phần mềm mạnh mẽ**
MAI-Thinking-1 là một mô hình Mixture of Experts thưa thớt, với 35 tỷ tham số hoạt động và tổng cộng khoảng 1 nghìn tỷ tham số, có dấu chân suy luận nhỏ hơn nhiều so với các mô hình lớn hơn. Mặc dù vậy, mô hình này sánh ngang với Claude Opus 4.6 trên SWE-Bench Pro. Điều này quan trọng đối với các nhà phát triển và doanh nghiệp vì kích thước mô hình quyết định nơi có thể triển khai hỗ trợ mã hóa tiên tiến, tần suất sử dụng và liệu nó có thể chuyển từ các tác vụ đặc biệt sang quy trình làm việc hàng ngày hay không.
Microsoft đã đầu tư mạnh vào các môi trường đào tạo cần thiết cho mã hóa tác nhân. Mỗi môi trường đã được xác minh đều có tính xác định, có thể thực thi và được chấm điểm bằng các bộ thử nghiệm thực tế. Điều này giúp mô hình thực hành loại công việc nhiều bước mà các nhà phát triển thực sự làm: đọc mã, chỉnh sửa tệp, chạy thử nghiệm, quan sát lỗi và phục hồi từ các lỗi trung gian.
**Khả năng suy luận toán học tiên tiến**
MAI-Thinking-1 đạt 97,0% trên AIME 2025 và 94,5% trên AIME 2026, cho thấy khả năng suy luận toán học và khoa học mạnh mẽ so với phân khúc của nó. Hiệu suất mạnh mẽ ở đây mang lại cho họ sự tự tin rằng vòng lặp đào tạo của MAI có thể tạo ra những cải thiện suy luận thực sự – leo dốc từ đầu – từ dữ liệu của riêng họ.
phần thưởng và quy trình đánh giá, cho phép trí tuệ này tổng quát hóa sang các lĩnh vực khác theo thời gian.
Được ưa chuộng hơn Sonnet 4.6 trong các thử nghiệm so sánh trực tiếp giữa người dùng.
Người dùng quan tâm đến việc liệu một mô hình có hiểu nhiệm vụ, tuân thủ hướng dẫn, sử dụng mức độ chi tiết phù hợp, viết rõ ràng và tôn trọng thời gian của họ hay không.
Microsoft đã xây dựng một hệ thống đánh giá mù so sánh trực tiếp giữa người dùng với một trong những đối tác của họ, Surge, sử dụng đội ngũ người đánh giá chuyên nghiệp để đo lường các mô hình khác nhau dựa trên những đặc điểm này. Cuộc đánh giá bao gồm 1.276 tác vụ trên nhiều trường hợp sử dụng đa dạng trong cả hội thoại một lượt và nhiều lượt, tập trung vào việc đo lường mức độ hữu ích của mỗi phản hồi và liệu nó có thực sự thúc đẩy mục tiêu của người dùng hay không. Trong các đánh giá này, người dùng đã ưu tiên MAI-Thinking-1 hơn Claude Sonnet 4.6.
Đây là một trọng tâm cốt lõi của quá trình hậu huấn luyện. Microsoft mong muốn mô hình có khả năng mà không cứng nhắc, súc tích mà không thiếu sót, và hữu ích mà không quá mức. Dữ liệu ưu tiên của con người cung cấp tín hiệu trực tiếp về việc liệu những cải tiến về điểm chuẩn có chuyển thành trải nghiệm tốt hơn cho người dùng hay không.
Sẵn sàng cho doanh nghiệp
MAI-Thinking-1 được xây dựng với mục tiêu sẵn sàng cho doanh nghiệp. Nó hỗ trợ ngữ cảnh dài với cửa sổ 256k token (đủ để chứa một tài liệu 600 trang), gọi hàm (function calling) và sự linh hoạt để thêm hướng dẫn của nhà phát triển. Chúng tôi đã huấn luyện mô hình tuân thủ nhiều lớp hướng dẫn và điều chỉnh phong cách mặc định của nó phù hợp với nhu cầu doanh nghiệp. Nó tương thích với API Chat Completions được sử dụng rộng rãi. Tất cả các mô hình MAI đều đi kèm với bảo mật và tuân thủ cấp doanh nghiệp thông qua Microsoft Foundry.
Kết quả
Microsoft đã báo cáo kết quả theo hai góc độ: đánh giá MAI-Thinking-1 sau huấn luyện và các chỉ số trước huấn luyện cho mô hình cơ sở của họ.
Bảng 1. Các chỉ số của MAI-Thinking-1
Kết quả đánh giá mô hình sau huấn luyện trên các điểm chuẩn STEM công khai và mã hóa tác nhân (agentic coding). Các số liệu của mô hình khác được lấy từ các thẻ mô hình chính thức tương ứng. Điểm số là phần trăm trừ khi có ghi chú khác; dấu gạch ngang cho biết giá trị mô hình không có sẵn.
Bảng 2. Các chỉ số trước huấn luyện
Đặt con người lên hàng đầu
Microsoft đang hướng tới việc xây dựng Siêu trí tuệ Nhân văn (Humanist Superintelligence): các khả năng AI tiên tiến được thiết kế để phục vụ con người và tổ chức, chứ không phải thay thế họ. Các mô hình của họ phải duy trì là công nghệ phụ thuộc dưới sự kiểm soát của con người với mục tiêu duy trì quyền tự chủ của con người và mang lại lợi ích. Điều đó có nghĩa là các mô hình MAI không được từ chối các yêu cầu hợp pháp dưới vỏ bọc an toàn và tuân thủ, vì khi đó chúng không thực sự phục vụ con người.
Đạt được sự cân bằng tinh tế giữa
Nguồn tin: Medium Towards AI — Tác giả: Pradeep Kumar Muthukamatchi. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.