
GLM-5.3: Các phòng thí nghiệm Trung Quốc bắt kịp với những tiến bộ mới nhất như thế nào
Thông báo: Tôi đang đi công tác nên không thể thực hiện bản ghi âm cho bài viết này. CHỈNH SỬA — Tôi đã thêm gạch đầu dòng thứ 5 về ngành dữ liệu Trung Quốc sau khi gửi email. Hôm nay, Z.ai đã công bố mô hình GLM-5.3 của họ, hiện chỉ có sẵn trong gói lập trình, sẽ sớm ra mắt API và trong hai tuần tới sẽ có mặt trên Hugging Face (mã nguồn mở). Mô hình này có vẻ đặc biệt, với sự gia tăng điểm số đáng kinh ngạc. Trên nhiều tiêu chuẩn, mô hình này đã vượt qua Kimi K3 của Moonshot AI và trên một số tiêu chuẩn, nó đã vượt qua Claude Fable 5 hoặc GPT-5.6-Sol. Dưới đây là bảng so sánh đầy đủ hơn:
Thông báo: Tôi đang đi công tác nên không thể lồng tiếng cho bài đăng này. CHỈNH SỬA — Tôi đã thêm gạch đầu dòng thứ 5 về ngành dữ liệu Trung Quốc sau khi gửi email.
Hôm nay, Z.ai đã công bố mô hình GLM-5.3 của họ, hiện chỉ có sẵn trong gói lập trình, sẽ sớm ra mắt API của họ và trong hai tuần tới sẽ có mặt trên Hugging Face (mã nguồn mở). Mô hình này có vẻ đặc biệt, với sự gia tăng điểm số đáng kinh ngạc. Trên nhiều tiêu chuẩn, mô hình này đã vượt qua Kimi K3 của Moonshot AI và trên một số tiêu chuẩn, nó đã vượt qua Claude Fable 5 hoặc GPT-5.6-Sol.
Dưới đây là so sánh đầy đủ hơn:
Điều này đưa mô hình này gần như đạt đến đỉnh cao của các tiêu chuẩn lập trình tác nhân, với chỉ khoảng 750 tỷ tham số – bằng một phần ba so với Kimi K3! Bài đăng trên blog của Z.ai khá thẳng thắn và bắt đầu bằng một câu mạnh dạn:
"Mở rộng quy mô sau huấn luyện là tất cả những gì chúng tôi đã làm cho GLM-5.3."
GLM-5.3 là cùng một mô hình cơ sở với GLM-5.2 nhưng được mở rộng đáng kể quá trình sau huấn luyện. Để đơn giản hóa quá mức, Z.ai dường như có thế mạnh trong quá trình sau huấn luyện so với Kimi, vốn là một kiệt tác tiền huấn luyện hơn. Sau bản phát hành này, đã có rất nhiều cuộc thảo luận thắc mắc làm thế nào Trung Quốc có thể duy trì tốt như vậy? Làm thế nào một mô hình nhỏ như vậy có thể sánh ngang với các mô hình công khai hàng đầu của Mỹ? Những kết quả này có thật không?
Đăng ký ngay
Giải thích đơn giản nhất là Z.ai rất giỏi trong những gì họ làm – đáng nhớ là họ đã nghiên cứu dòng mô hình này lâu hơn hầu hết bất kỳ ai trong ngành. Dưới đây là lịch sử tóm tắt của các mô hình GLM.
Zhipu AI được thành lập – 2019
GLM (General Language Model) — Tháng 3/2021 — được phát hành bởi THUDM, nhóm Khai thác dữ liệu / Kỹ thuật tri thức của Đại học Thanh Hoa. Mã nguồn
GLM-130B — Tháng 8/2022 — Phiên bản mở rộng. Báo cáo kỹ thuật cho GLM-130B đến GLM-4 — Mã nguồn
ChatGLM — Ngày 14/3/2023 — phiên bản trò chuyện đầu tiên. Mã nguồn
ChatGLM2 — Ngày 25/6/2023 — Mã nguồn
ChatGLM3 — Ngày 27/10/2023 — Mã nguồn
GLM-4 — Ngày 16/1/2024 — đổi tên thành GLM; GLM-4-9B mã nguồn mở ra mắt sau đó vào tháng 6. Mã nguồn
GLM-5 — Ngày 11/2/2026 — thế hệ chính mới nhất. Mã nguồn
GLM 5.2, ra mắt vào ngày 22/6 năm nay, đã tạo tiếng vang lớn. Nhiều tuần sau khi phát hành, các nhà nghiên cứu AI mà tôi quen biết vẫn thường xuyên sử dụng mô hình này nhờ tốc độ (một số triển khai mô hình trên các cụm máy chủ nội bộ để đạt tốc độ nhanh hơn so với các dịch vụ công cộng) và sự đơn giản (là một mô hình không có các bản hoàn tác, v.v., khi làm việc với các hệ thống AI tiên tiến). GLM-5.2 đã hoàn toàn đáp ứng được kỳ vọng.
Tôi cũng từng trải qua sự hoài nghi tương tự, tự hỏi "làm thế nào họ có thể liên tục làm được điều này? Chắc chắn các mô hình không tốt như vẻ ngoài của chúng." Có điều gì đó hơi khó chịu khi các công ty Mỹ có lợi thế tài nguyên vượt trội nhưng dường như không thể tạo ra sự khác biệt lớn về năng lực. Câu trả lời phổ biến là chưng cất (distillation), một chủ đề tôi đã viết nhiều, nhưng tôi cho rằng đây không phải là yếu tố chính. Về vấn đề này, gần đây có một bài báo cho thấy các phương pháp đơn giản để trích xuất dấu vết suy luận từ các mô hình tiên tiến – đây là loại kỹ thuật mà các phòng thí nghiệm Trung Quốc chắc chắn có thể sử dụng ở quy mô lớn. Tôi băn khoăn tại sao các phòng thí nghiệm ở Mỹ không khắc phục hành vi này nhanh hơn; thay vào đó, họ lại tìm đến chính phủ để xin hỗ trợ chính sách. Điều này không hợp lý đối với tôi.
Bài đăng trên blog của Z.ai trực tiếp và phù hợp với một chế độ huấn luyện chủ yếu dựa trên học tăng cường (RL). Họ cho biết đã sử dụng "nhiều môi trường hơn, các tác vụ đa dạng hơn và nhiều tài nguyên tính toán hơn để huấn luyện chúng." Không thể đơn giản "chưng cất" các môi trường RL, cơ sở hạ tầng để chạy chúng ở quy mô lớn, hoặc các thuật toán để kết hợp chúng một cách hiệu quả.
Interconnects AI là một ấn phẩm được độc giả hỗ trợ. Hãy cân nhắc trở thành người đăng ký.
Vậy, các phòng thí nghiệm Trung Quốc làm điều đó như thế nào nếu không phải bằng chưng cất? Họ có đang "benchmaxxing" không? Một định nghĩa được chấp nhận của benchmaxxing là tập trung mô hình vào các bộ dữ liệu thử nghiệm, sao cho hiệu suất thực tế khác biệt đáng kể so với điểm số trên giấy tờ. Các yếu tố quyết định mang tính tổng thể hơn là kỹ thuật (đúng, các chi tiết kỹ thuật chắc chắn quan trọng, nhưng khó phân biệt giữa các phòng thí nghiệm):
Thời gian phát hành của Z.ai có thể tính bằng ngày, không phải bằng tháng như OpenAI hay Anthropic. Rất, rất có thể OpenAI và Anthropic có các mô hình nội bộ tốt hơn nhiều so với Z.ai và Moonshot AI. Tuy nhiên, các công ty Mỹ này thường mất nhiều tháng để phát hành mô hình ra công chúng, điều này tạo lợi thế lớn cho các phòng thí nghiệm Trung Quốc trong các quyết định áp dụng ở ranh giới công nghệ. Nói một cách đơn giản – các phòng thí nghiệm Trung Quốc sử dụng toàn bộ thời gian mà các phòng thí nghiệm Mỹ dành cho việc thử nghiệm trước khi phát hành để tiếp tục cải thiện trên các điểm chuẩn (SpaceXAI có lẽ gần với các phòng thí nghiệm Trung Quốc hơn ở đây). Với tốc độ tiến bộ nhanh chóng, đây có thể là yếu tố quyết định lớn nhất lý do tại sao các phòng thí nghiệm Trung Quốc vẫn duy trì ở ranh giới công nghệ. Điều này, cho đến nay, vẫn được các phòng thí nghiệm Mỹ chấp nhận về mặt kinh tế, vì họ vẫn có nhu cầu rất lớn đối với các mô hình của mình.
Khi các vòng lặp tự cải thiện mô hình tăng tốc trong các phòng thí nghiệm xây dựng LLM, nếu bất kỳ vòng phản hồi nào trong số này yêu cầu dữ liệu người dùng, chu kỳ phát hành nhanh hơn này có thể mang lại lợi thế lớn cho các phòng thí nghiệm Trung Quốc, giúp các sản phẩm của họ có vòng đời dài hơn trước khi mô hình vượt trội tiếp theo ra đời, làm giảm nhu cầu đối với các mô hình của họ.
Đây rõ ràng là động lực cạnh tranh mà nhiều người trong ngành lo ngại. Với rất nhiều phòng thí nghiệm đang xây dựng các mô hình tiên tiến với năng lực hàng đầu, thật khó để thấy điều này sẽ giảm bớt trong tương lai gần.
Đúng vậy, Z.ai có lẽ quan tâm đến các điểm chuẩn công khai nhiều hơn một chút so với OpenAI hay Anthropic. Những điểm chuẩn này, ví dụ như đạt điểm cao trên Chỉ số Trí tuệ Phân tích Nhân tạo (Artificial Analysis Intelligence Index) hoặc các công cụ tổng hợp tương tự, có tác động rất trực tiếp đến giá cổ phiếu của họ. Họ cần phải làm điều này để tiếp tục huy động vốn và duy trì tinh thần đội ngũ, vì việc trở thành một đối thủ yếu thế nhưng có thể sánh ngang với các công ty Mỹ.


Nguồn tin: Interconnects Newsletter — Tác giả: Nathan Lambert. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.