Bỏ qua tới nội dung chính
Quay lại tin tức

Đọc kết quả GLM-5.3 của Zhipu vượt quá số tiêu đề

AI News· Dashveenjit Kaur· 18/8/2026general

Ghi chú phát hành của Zhipu cho GLM-5.3 có một câu không được đưa vào hầu hết các nội dung. Mô tả kết quả an ninh mạng của chính mình, công ty Bắc Kinh viết rằng khả năng “đang phát triển nhanh nhất chính xác ở nơi chúng tôi kém xa nhất”. Zhipu, còn có tên giao dịch là Z.ai, là một trong số ít các phòng thí nghiệm của Trung Quốc phát hành các mẫu máy cạnh tranh với biên giới Mỹ. Vào ngày 14 tháng 8, hãng đã ra mắt GLM-5.3, một mẫu máy tập trung vào mã hóa và xuất bản một ghi chú phát hành kỹ thuật nêu rõ cách thức hoạt động của mẫu máy này so với các đối thủ của nó. Ghi chú đó là nguồn cho mọi thứ được báo cáo ở đây.

Ghi chú phát hành của Zhipu cho GLM-5.3 có một câu không được đưa vào hầu hết các nội dung. Mô tả kết quả an ninh mạng của chính mình, công ty Bắc Kinh viết rằng khả năng “đang phát triển nhanh nhất chính xác ở nơi chúng tôi kém xa nhất”. Zhipu, còn có tên giao dịch là Z.ai, là một trong số ít các phòng thí nghiệm của Trung Quốc phát hành các mẫu máy cạnh tranh với biên giới Mỹ. Vào ngày 14 tháng 8, hãng đã ra mắt GLM-5.3, một mẫu máy tập trung vào mã hóa và xuất bản một ghi chú phát hành kỹ thuật nêu rõ cách thức hoạt động của mẫu máy này so với các đối thủ của nó. Ghi chú đó là nguồn cho mọi thứ được báo cáo ở đây. Tuyên bố được đưa ra là về an ninh. Bên cạnh các kết quả mã hóa, Zhipu cho biết GLM-5.3 đã trở nên xuất sắc một cách bất ngờ trong việc tìm ra các lỗ hổng phần mềm, đạt 84,5% trên điểm chuẩn có tên CyberGym so với 83,8% của Mythos 5 của Anthropic và 83,6% của GPT-5.6 Sol của OpenAI. Các tiêu đề tiếp theo đưa tin rằng một người mẫu Trung Quốc hiện đã vượt qua người Mỹ trong việc săn lỗi. Lý do khiến kết quả điểm chuẩn khó đạt được hơn thông thường là do việc phát hiện lỗ hổng đã trở thành. Một mô hình có thể đọc cơ sở mã và xác định các lỗ hổng có thể khai thác sẽ hữu ích cho người bảo vệ kiểm tra phần mềm của chính họ và hữu ích cho bất kỳ ai làm điều tương tự với phần mềm của người khác. Tác phẩm tương đương của Anthropic bị hạn chế truy cập vì lý do đó, trong khi Zhipu dự định xuất bản trọng lượng của GLM-5.3 cho bất kỳ ai tải xuống. Bản phát hành của chính Zhipu được đo lường nhiều hơn mức độ phủ sóng mà nó tạo ra. Số CyberGym là có thật và có trên báo. Đây cũng là kết quả thu hẹp nhất trong số ba kết quả về an ninh mạng mà công ty đã công bố và Zhipu thẳng thắn cho rằng hai kết quả còn lại sẽ đi theo hướng khác. Ba điểm chuẩn, ba bức ảnh khác nhau CyberGym bắt đầu từ mã nguồn mà mô hình có thể đọc và kiểm tra xem liệu nó có thể tìm thấy lỗ hổng hay không và xác nhận lỗ hổng đó là có thật. Đó là kết quả đã đạt được và tỷ suất lợi nhuận là bảy phần mười điểm phần trăm. ExploitBench yêu cầu một điều gì đó khó hơn, yêu cầu mô hình phải suy luận về một lỗ hổng thực sự và cách khai thác lỗ hổng đó. GLM-5.3 đạt 54,4%, cao hơn gấp đôi so với 24,4% của người tiền nhiệm. Mythos 5 đạt 78,0% và GPT-5.6 Sol 76,5%. ExploitGym đếm số lượng nhiệm vụ khai thác mà một mô hình hoàn thành trong một khoảng thời gian cố định. GLM-5.3 hoàn thành 105 nhiệm vụ trong hai giờ và 130 nhiệm vụ trong sáu giờ. Mythos 5 hoàn thành 181 và 247. Hai kết quả đó được báo cáo rất ít và chúng là những kết quả mô tả khoảng cách. Tìm ra lỗ hổng và xây dựng cách khai thác hiệu quả từ nó là những công việc khác nhau. Zhipu đọc rằng thử nghiệm càng tiến xa trong chuỗi đó thì mô hình của nó càng đi sau và công ty đã nói như vậy trong bản phát hành thay vì để nó được phát hiện. So sánh riêng của Zhipu qua ba tiêu chuẩn an ninh mạng. GLM-5.3 dẫn đầu về CyberGym, thử nghiệm phát hiện lỗ hổng và tụt lại phía sau Mythos 5 của Anthropic về cả hai biện pháp khai thác. Nguồn: Z.ai. Mô hình nhân loại nào và tại sao nó liên tục thay đổi Một phần của sự nhầm lẫn trong phạm vi đưa tin đến từ việc Zhipu so sánh ba mô hình Nhân chủng học khác nhau ở ba địa điểm khác nhau. Bảng điểm chuẩn chính đặt GLM-5.3 so với Opus 4.8. Biểu đồ hiệu suất sử dụng Fable 5. Phần an ninh mạng sử dụng Mythos 5. Bất kỳ ai đọc sẽ nhanh chóng nhận ra một so sánh duy nhất không tồn tại. Về mã hóa, hình ảnh được trộn lẫn chứ không phải chiếm ưu thế. GLM-5.3 dẫn đầu Opus 4.8 trong một số thử nghiệm và theo dõi nó ở những thử nghiệm khác, và Zhipu tuyên bố rõ ràng rằng mô hình của nó vẫn xếp sau Claude Fable 5 trên tiêu chuẩn mã hóa nội bộ của chính công ty. Các bài kiểm tra đã được chạy như thế nào Các chú thích ở cuối trang về phương pháp luận có chứa nội dung nào đó mà phần tóm tắt đã bỏ qua. Zhipu đã đánh giá GLM-5.3 trên CyberGym, ExploitGym, ExploitBench, Terminal Bench và một số tác vụ khác trong Claude Code 2.1.207, tác nhân mã hóa của Anthropic. Điều đó không phải là không đúng đắn. Việc sử dụng dây nịt chung giữa các mẫu xe là cách so sánh công bằng và Zhipu ghi lại các cài đặt mà nó đã sử dụng. Dù sao thì nó cũng đáng được chú ý. Các tuyên bố về biên giới của một mô hình trọng lượng mở của Trung Quốc đang được đo lường thông qua phần mềm đại lý của Mỹ, điều này nói lên điều gì đó về vị trí của lớp công cụ trong cuộc cạnh tranh này mà mô hình không cho điểm. Hai chi tiết nữa đáng được chú ý trước khi kết quả CyberGym được coi là đã được giải quyết. Điểm được tính cho một lần chạy, được báo cáo là pass@1 trên 1.507 nhiệm vụ, không đưa ra số liệu phương sai. Khoảng cách bảy phần mười điểm giữa hai lần chạy đơn không phải là khoảng cách mà bất kỳ ai cũng nên dựa vào. Và ngân sách thời gian của ExploitGym đã được chuẩn hóa bằng cách sử dụng tỷ lệ thông lượng từ Phân tích nhân tạo, với các hệ số thay đổi tỷ lệ được liệt kê cho GLM-5.3, Kimi K3 và Qwen3.8 Max, nhưng không dành cho Mythos 5. Số lượng lỗ hổng và số bị thiếu Ngoài các điểm chuẩn, Zhipu cho biết họ đã làm việc với các nhóm bảo mật ở Trung Quốc để chạy các mô hình của mình dựa trên các cơ sở mã thực, xác định 2.436 lỗ hổng trên 269 dự án nguồn mở. Sự phân chia mức độ nghiêm trọng là 107 nghiêm trọng, 990 cao, 1.286 trung bình và 53 thấp. Lỗ hổng lâu đời nhất có từ năm 1981 và lỗ hổng trung bình đã tồn tại trong mã 26,6 năm trước khi được tìm thấy. Bản tóm tắt tiết lộ của Zhipu. Bảng đánh giá 1.097 phát hiện là nghiêm trọng và cao, phù hợp với phân tích mức độ nghiêm trọng là 107 nghiêm trọng và 990 cao. Nội dung của cùng một bản phát hành mô tả hình ảnh ở mức trung bình đến cao. Nguồn: Z.ai. Một sự khác biệt đáng được thực hiện cẩn thận. Bảng tóm tắt của Zhipu đánh giá 1.097 phát hiện là nghiêm trọng và cao, phù hợp với bảng mức độ nghiêm trọng. Nội dung của cùng một bản phát hành mô tả 1.097 đó là từ trung bình đến cao. Một số cửa hàng đã sao chép phiên bản thứ hai. Số lượng cũng đến sau những gì Zhipu mô tả là đánh giá, sàng lọc và loại bỏ trùng lặp của chuyên gia, vì vậy kết quả đầu ra của mô hình thô không phải là những gì đang được báo cáo. Trong số 2.436 phát hiện, 53 phát hiện đã được tiết lộ công khai và 2.383 phát hiện vẫn đang bị cấm vận. Bản phát hành không cho biết có bao nhiêu cuốn trước đây chưa được biết đến và cũng không cho biết có bao nhiêu cuốn đã được sao chép độc lập. Đó là một

Nguồn tin: AI News — Tác giả: Dashveenjit Kaur. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.