Bỏ qua tới nội dung chính
Quay lại tin tức

Các mô hình AI mã nguồn mở đang bắt kịp các mô hình tiên tiến. Khoảng cách về an toàn vẫn còn.

TechCrunch AI· Rebecca Bellan· 4/8/2026startup

Báo cáo mới của SaferAI cho thấy mô hình GLM-5.2 mã nguồn mở của Z.ai đang tiếp cận khả năng của các hệ thống AI tiên tiến nhưng lại thiếu các biện pháp giảm thiểu rủi ro an toàn quan trọng. Điều này làm dấy lên lo ngại rằng các mô hình mở mạnh mẽ có thể vượt xa khả năng quản lý và các biện pháp bảo vệ.

Trong bối cảnh các nhà hoạch định chính sách đang tranh luận về cách quản lý các hệ thống AI ngày càng mạnh mẽ như GPT-5.6 Sol của OpenAI và Mythos của Anthropic, một mô hình mã nguồn mở của Trung Quốc đã thu hẹp khoảng cách với các nhà lãnh đạo ngành. Theo báo cáo mới từ tổ chức phi lợi nhuận về an toàn AI SaferAI, GLM-5.2, mô hình AI mã nguồn mở của Z.ai (Trung Quốc), chỉ kém vài tháng so với GPT-5.5 của OpenAI và Claude Opus 4.7 của Anthropic về khả năng an ninh mạng và sinh học. Tuy nhiên, khoảng cách giữa khả năng tiên tiến và các biện pháp an toàn đang ngày càng lớn. Theo đánh giá của SaferAI, được thực hiện thông qua API công khai của Z.ai, GLM-5.2 đã không từ chối bất kỳ tác vụ an ninh mạng tấn công hoặc sinh học lưỡng dụng nào được giao. Trong khi đó, Claude Opus 4.7 “từ chối một cách nhất quán đến mức SaferAI không thể hoàn thành CyberGym trên đó.” (CyberGym là một tiêu chuẩn đánh giá khả năng an ninh mạng. OpenAI đã sử dụng nó trong đánh giá trước vụ vi phạm Hugging Face vào tháng trước.) Đây là một lời nhắc nhở rõ ràng về những gì một số nhà phê bình đã cảnh báo trong nhiều năm: các mô hình AI mã nguồn mở có thể đưa AI có khả năng cao vào tay những kẻ tấn công tiềm năng, mà không có cách nào để kiểm soát cách họ sử dụng công nghệ sau khi tải xuống các trọng số. Với việc các mô hình mã nguồn mở đang nhanh chóng tiếp cận khả năng của các hệ thống AI hàng đầu thế giới, cuộc tranh luận đang chuyển từ việc liệu chúng có thể cạnh tranh hay không sang việc xã hội quản lý rủi ro như thế nào sau khi chúng được phát hành. Ông Henry Papadatos, Giám đốc điều hành của SaferAI, chia sẻ với TechCrunch: “Ranh giới của khả năng không phải là ranh giới của rủi ro, vì vậy chúng ta phải tính đến tình trạng của các biện pháp giảm thiểu để đánh giá rủi ro một cách chính xác.” Mặc dù Z.ai có thể áp dụng các biện pháp an toàn cho API được lưu trữ của mình, nhưng những biện pháp bảo vệ đó trở nên không thể thực thi một khi ai đó chạy các trọng số trên phần cứng của riêng họ, nơi họ có thể loại bỏ hoặc sửa đổi bất kỳ biện pháp bảo vệ nào, tinh chỉnh các mô hình hoặc thay đổi lời nhắc hệ thống. Các nhà phát triển tiên phong như OpenAI và Anthropic thường dựa vào các biện pháp bảo vệ như bộ phân loại, huấn luyện từ chối và kiểm soát cấp API để hạn chế hỗ trợ an ninh mạng và sinh học nguy hiểm. Những biện pháp đó còn lâu mới hoàn hảo: các cuộc tấn công jailbreak thường xuyên vượt qua các biện pháp bảo vệ trên các mô hình đã triển khai. Far.ai, một tổ chức phi lợi nhuận về an toàn AI, đã tìm thấy hàng trăm cuộc tấn công jailbreak phổ biến – được định nghĩa là các khóa có thể tái sử dụng thành công trên hầu hết các yêu cầu có hại – trong các mô hình tiên tiến như Grok 4.5 của xAI và Gemini 3.1 Pro của Google DeepMind. Theo báo cáo, các cuộc tấn công jailbreak thành công khi kẻ tấn công kết hợp nhiều kỹ thuật thao túng – bao gồm đóng vai, mạo danh quyền hạn, lịch sử trò chuyện giả mạo và lời nhắc tiếp theo – để khuếch đại các điểm yếu trong hệ thống phòng thủ của mô hình. Tuy nhiên, các biện pháp bảo vệ được áp dụng cho các mô hình đóng hoàn toàn không hoạt động trên các mô hình mã nguồn mở, vốn được thiết kế để chạy trên bất kỳ cơ sở hạ tầng nào với bất kỳ bộ biện pháp bảo vệ nào – hoặc không có biện pháp bảo vệ nào. Ông Papadatos cho biết: “Mục tiêu rõ ràng phải là các khả năng tốt – an toàn – có thể tiếp cận được với bất kỳ ai, và sau đó chúng ta cố gắng loại bỏ những khả năng xấu, ngay cả theo cách mã nguồn mở.” Một kỹ thuật mà ông Papadatos lưu ý có thể hữu ích là “lọc dữ liệu tiền huấn luyện”, tức là khi một công ty AI loại bỏ thông tin an ninh mạng tấn công khỏi dữ liệu huấn luyện của họ và sau đó huấn luyện mô hình trên tập dữ liệu đã được chọn lọc. Một số nghiên cứu cho thấy điều này có thể làm giảm kiến thức sinh học nguy hiểm mà không ảnh hưởng đến hiệu suất tổng thể của mô hình. Tuy nhiên, đối với an ninh mạng, việc lọc dữ liệu ít thực tế hơn nhiều. Việc đào tạo một mô hình tổng quát xuất sắc trong lập trình nhưng không phải là một hacker giỏi là điều khó khăn. Do lập trình đã trở thành nguồn thu lớn nhất của AI, các nhà phát triển phải đối mặt với áp lực không ngừng cải thiện các khả năng này ngay cả khi họ tìm cách hạn chế việc lạm dụng. Vì lý do đó, các nhà phát triển tiên phong ngày càng dựa vào các biện pháp giảm thiểu khác. Một cách tiếp cận là hạn chế có chọn lọc các loại hỗ trợ an ninh mạng mà các mô hình sẽ cung cấp. Ví dụ, Opus 5 của Anthropic có thể tìm kiếm lỗ hổng trong mã nguồn chưa biên dịch, nhưng không thể tìm kiếm trong phần mềm đã biên dịch, theo thẻ hệ thống của mô hình. Lý do là điều này khiến việc sử dụng Opus 5 cho các mục đích tấn công trở nên khó khăn hơn. Các biện pháp khác bao gồm đánh giá an toàn nghiêm ngặt trước khi triển khai, công bố đánh giá rủi ro và giữ lại trọng số mô hình nếu một hệ thống được cho là quá nguy hiểm. Trong trường hợp của GLM-5.2, SaferAI cho biết Z.ai đã không công bố khuôn khổ an toàn, cam kết thử nghiệm trước khi triển khai hoặc đánh giá rủi ro cho mô hình. TechCrunch đã hỏi Z.ai liệu họ có tiến hành các đánh giá an toàn tiên phong nội bộ hoặc của bên thứ ba trước khi phát hành hay không, nhưng không nhận được phản hồi. Các nhà lãnh đạo Trung Quốc ngày càng thừa nhận rủi ro của AI tiên tiến. Tại Hội nghị AI Thế giới tháng trước, Chủ tịch Trung Quốc Tập Cận Bình đã nhấn mạnh tầm quan trọng của các mô hình mã nguồn mở, đồng thời nhấn mạnh sự cần thiết phải đảm bảo AI vẫn là một công cụ dưới sự kiểm soát chặt chẽ của con người. Graham Webster, người nghiên cứu chính sách AI của Trung Quốc tại Trung tâm Chính sách Mạng Stanford, nói với TechCrunch rằng Trung Quốc có các quy định mạnh mẽ quản lý AI, nhưng các quy tắc đó trong lịch sử đã tập trung vào nội dung nhạy cảm về chính trị, thông tin sai lệch và ổn định xã hội hơn là các rủi ro AI thảm khốc như khả năng tấn công mạng và lạm dụng sinh học. Ông Webster cho biết: “Các nhà tư tưởng AI của Hoa Kỳ, nhìn chung, quan tâm nhiều hơn đến ý tưởng thảm khốc mang tính tồn tại này hơn là cộng đồng Trung Quốc”, đồng thời nói thêm rằng nhiều nhà nghiên cứu chính sách Trung Quốc tin rằng nếu thực sự có một rủi ro tiên phong mới, các công ty Mỹ có thể sẽ gặp phải nó trước tiên. Ông Webster tiếp tục: “Hệ thống Trung Quốc tự tin rằng họ kiểm soát việc sử dụng các công nghệ này bên trong Trung Quốc. Việc trực tuyến ở Trung Quốc là điều bạn làm với tên thật của mình, và các công ty có thể bị quy trách nhiệm, người dùng có thể bị quy trách nhiệm”. Ông Webster suy đoán rằng cơ chế mà các nhà cung cấp mô hình sử dụng để từ chối tham gia vào một số chủ đề chính trị nhất định có thể được điều chỉnh để đảm bảo các mô hình từ chối hoàn thành các cuộc tấn công mạng hoặc sẽ không cung cấp các tác nhân sinh học bất lợi.

Nguồn tin: TechCrunch AI — Tác giả: Rebecca Bellan. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.