Bỏ qua tới nội dung chính
Quay lại tin tức

[AINews] SpaceXAI Grok 4.6 và Grok @Bot

Latent Space· 13/8/2026models

Một trong những chủ đề nổi bật xuyên suốt năm qua là các tác nhân mã hóa (coding agents) đang mở rộng phạm vi hoạt động sang lĩnh vực công việc tri thức. Rõ ràng, không gian AI đồng đội/đa người chơi/đa tác nhân (AI teammate/multiplayer/multiagent) là chiến trường lớn tiếp theo của AI. Với việc Claude Tag ra mắt nhận được nhiều ý kiến trái chiều và Buzz của Block đòi hỏi người dùng có kiến thức kỹ thuật hơn, thị trường vẫn còn chỗ cho một nhà lãnh đạo danh mục mới. Đội ngũ Cursor→SpaceX hiện đã khéo léo ra mắt sản phẩm của mình và nhận được những đánh giá rất tích cực: Sản phẩm này được hỗ trợ bởi mô hình mới nhất của họ, Grok 4.6, ra mắt hôm nay và được cho là mô hình công việc tri thức tốt thứ hai trên thế giới (cả đối thủ cạnh tranh Cog

Một trong những chủ đề nổi bật xuyên suốt năm nay là các tác nhân mã hóa (coding agents) đã vượt ra khỏi phạm vi công việc lập trình để thâm nhập vào các công việc tri thức. Rõ ràng, không gian AI đồng đội/đa người chơi/đa tác nhân (AI teammate/multiplayer/multiagent) đang là chiến trường lớn tiếp theo của AI. Với việc Claude Tag ra mắt nhận được nhiều ý kiến trái chiều và Buzz của Block đòi hỏi người dùng có kỹ năng kỹ thuật cao hơn, thị trường vẫn còn chỗ cho một nhà lãnh đạo danh mục mới. Đội ngũ Cursor→SpaceX hiện đã khéo léo ra mắt sản phẩm của mình và nhận được những đánh giá rất tích cực: Sản phẩm này được hỗ trợ bởi mô hình mới nhất của họ, Grok 4.6, ra mắt hôm nay và được cho là mô hình công việc tri thức tốt thứ hai trên thế giới (như cả đối thủ Cognition và Elon đều thừa nhận)… mặc dù chắc chắn nó đứng đầu về hiệu quả: Grok 4.6 là một mô hình 1.5T đã được xác nhận, "được xây dựng dựa trên Grok 4.5 với trọng tâm đặc biệt vào các tác nhân chạy dài (long-running agents) và các công việc tương tác, trực quan đầy tham vọng hơn". Thông tin duy nhất về quá trình huấn luyện có thể được trích dẫn đầy đủ (chúng tôi nhấn mạnh): Grok 4.6 đã trải qua một quá trình huấn luyện bổ sung dài hơn Grok 4.5, với dữ liệu do mô hình tạo ra được chọn lọc kỹ lưỡng cho các hoạt động suy luận và các khái niệm kỹ thuật nâng cao, dữ liệu kỹ thuật chất lượng cao, cùng với một bộ tối ưu hóa và công thức huấn luyện được cải tiến. Điều này đã tạo ra một nền tảng vững chắc hơn cho các giai đoạn SFT (Supervised Fine-Tuning) và RL (Reinforcement Learning) tiếp theo. Sau đó, chúng tôi đã sử dụng Grok 4.5 để tạo lại các quỹ đạo SFT trong các nỗ lực suy luận, các bộ điều khiển tác nhân (agent harnesses) và các lĩnh vực như STEM, kỹ thuật phần mềm và công việc tri thức, đồng thời lọc bỏ các dấu vết có vấn đề bằng các kiểm tra dựa trên mô hình. Điểm kiểm tra SFT thu được cho thấy hiệu suất mạnh mẽ và hành vi được cải thiện. Grok 4.6 được huấn luyện trên nhiều nhiệm vụ RL mang tính tác nhân (agentic RL), bao gồm công việc tri thức, lập trình tổng quát và các môi trường chuyên biệt cho tối ưu hóa nhân (kernel optimization), phát triển web, thiết kế có sự hỗ trợ của máy tính (CAD), v.v. Hiện tại vẫn chưa rõ liệu việc không có sự cố thoát khỏi sandbox (sandbox escape incidents) trong quá trình huấn luyện Grok 4.6 là minh chứng cho các kỹ sư hạ tầng của họ hay là một sự tố cáo các nhà nghiên cứu của họ. (đây là một câu nói đùa về các sự kiện hiện tại, đừng tức giận) Tin tức AI ngày 11/8/2026-12/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có Discord nào khác. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo trước đây. Xin nhắc lại, AINews hiện là một phần của Latent Space. Bạn có thể chọn nhận/không nhận email theo tần suất mong muốn! Tóm tắt tin tức AI trên Twitter Ngày mô hình tiên phong: Grok 4.6, Qwen3.8-Max, DeepSeek V4 Pro và MAI-Thinking-1 của Microsoft Grok 4.6 đạt đến ngưỡng tiên phong về giá/hiệu suất: xAI đã phát hành Grok 4.6, được mô tả là một bước tiến lớn so với phiên bản 4.5 với cùng mức giá. Các đánh giá độc lập từ Artificial Analysis xếp hạng mô hình này ở mức 61 trên Chỉ số Thông minh (Intelligence Index), tương đương với GPT-5.6 Sol Max, nhưng vẫn đứng sau Claude Opus/Fable. Grok 4.6 cho thấy kết quả tác nhân mạnh mẽ, bao gồm 88,4% trên Terminal-Bench v2.1, 1753 GDPval-AA v2 Elo và hiệu suất AA-Briefcase cạnh tranh với chi phí thấp hơn đáng kể (ghi chú AA-Briefcase). Dữ liệu ban đầu từ Code Arena cũng xếp Grok 4.6 gần GPT-5.6 Sol và Claude Fable trong các tác vụ phát triển web. Giá cả là một chủ đề trọng tâm: AA nhấn mạnh mức giá 2 USD/6 USD cho 1 triệu token đầu vào/đầu ra, thấp hơn đáng kể so với các đối thủ tiên phong. Các chuyên gia ngay lập tức coi đây là lựa chọn mặc định mới cho các tác vụ lập trình và tìm lỗi (Pawel Huryn, tính khả dụng của Cognition trong Devin). xAI cho biết những cải tiến này đến từ một quá trình huấn luyện bổ sung dài hơn, các dấu vết SFT được tạo lại và RL tác nhân trên các tác vụ lập trình, web, CAD và tối ưu hóa nhân (kernel optimization). Họ cũng báo cáo hành vi tự kiểm tra nhiều hơn trong các tác vụ dài (@kimmonismus tóm tắt). Elon Musk cũng cho biết Grok 4.7 đã được triển khai, với quá trình huấn luyện ban đầu đã hoàn tất và kế hoạch huấn luyện bổ sung trên dữ liệu nội bộ của SpaceX. Qwen3.8-Max mã nguồn mở đã được phát hành: Qwen3.8-Max của Alibaba đã được ra mắt dưới dạng mô hình mã nguồn mở với tổng số 2,4 nghìn tỷ tham số và 95 tỷ tham số hoạt động (MoE). Cộng đồng nhấn mạnh quy mô, khả năng phục vụ ngay lập tức và định hướng ngữ cảnh dài/tác nhân của mô hình này: Yuchen Jin gọi đây là một trong những bản phát hành mã nguồn mở lớn nhất từ trước đến nay; vLLM đã hỗ trợ ngay lập tức cùng với các điểm kiểm tra 4-bit dành riêng cho nhà cung cấp cho NVIDIA B300 và AMD MI355X; Together AI và Baseten cũng công bố hỗ trợ ngay lập tức. Một lưu ý quan trọng từ người dùng: biến thể mã nguồn mở được phát hành dường như chỉ hỗ trợ văn bản, không có đầu vào thị giác trong lần ra mắt ban đầu (skalskip92). DeepSeek V4 Pro GA hạ giá thị trường: Việc DeepSeek V4 Pro GA ra mắt ngay lập tức thu hút sự chú ý không phải vì "điểm chuẩn tốt nhất ở mọi cột" mà vì yếu tố kinh tế. Nhiều nhà quan sát đã nhấn mạnh mức giá khoảng 0,435 USD/triệu token đầu vào và 0,87 USD/triệu token đầu ra (kimmonismus). Cline gọi đây là mô hình rẻ hơn khoảng 57 lần so với Fable 5, đồng thời báo cáo những cải tiến đáng kể so với phiên bản xem trước, bao gồm tăng 15,8% trên Terminal Bench. Phản ứng về khả năng của mô hình khá trái chiều: một số người dùng ban đầu thấy nó ổn định nhưng không rõ ràng vượt trội hơn Kimi/Flash trong tất cả các tác vụ (tổng hợp của Yuchen Jin, scaling01, teortaxesTex), cho thấy những cải tiến tiếp theo của DeepSeek có thể phụ thuộc nhiều hơn vào môi trường RL và công việc tác nhân hơn là quy mô thô. Microsoft tham gia với mô hình suy luận riêng: Mustafa Suleyman đã công bố MAI-Thinking-1, mô hình suy luận đầu tiên của Microsoft "được xây dựng từ đầu", hiện đã có sẵn trong Foundry. Yêu cầu ban đầu từ nhóm đặc biệt thực tế – Finbarr Timbers đã yêu cầu phản hồi cụ thể về việc sử dụng công cụ – điều này cho thấy Microsoft đang định vị đây là một mô hình suy luận ứng dụng chứ không chỉ là một đối thủ cạnh tranh điểm chuẩn. Solar Pro 4 cũng thăng hạng: Artificial Analysis báo cáo rằng Solar Pro 4 của Upstage đã tăng từ 14 lên 42 trên Chỉ số Thông minh, với những cải thiện đặc biệt lớn trong các tác vụ tác nhân và ngữ cảnh dài, mặc dù vẫn đứng sau các mô hình tiên phong hàng đầu hiện tại và các mô hình mã nguồn mở về cả điểm số thô và giá cả. Mô hình đa phương thức và mô hình biên mã nguồn mở: Video, thị giác, giọng nói và suy luận cục bộ LTX-2.5 và hệ thống video mã nguồn mở tiếp tục được cải tiến: @RisingSayak đã nhấn mạnh rằng LTX-2.5 của Lightricks đã được tích hợp vào Diffusers với một số tính năng thực tế quan trọng cho quy trình làm việc cục bộ: tạo video và âm thanh 48 kHz đồng thời, kiểm soát độ dài clip bằng lời nhắc, chế độ chất lượng 2 lượt, kết xuất theo ô để giảm mức sử dụng bộ nhớ và tiền xử lý nén lại hình ảnh đầu vào để phù hợp hơn.

Nguồn tin: Latent Space. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.