Anthropic tuyên bố mô hình AI phổ biến của Trung Quốc có khả năng tấn công mạng cấp độ Mythos.
URL bài viết: https://www.tomshardware.com/tech-industry/artificial-intelligence/anthropic-claims-popular-chinese-ai-model-has-mythos-class-hacking-abilities-frontier-red-teaming-report-details-weak-safeguards-on-open-weight-ai URL bình luận: https://news.ycombinator.com/item?id=49943381 Điểm: 2 Bình luận: 0
Ngành Công nghệ
Trí tuệ nhân tạo
Anthropic tuyên bố mô hình AI phổ biến của Trung Quốc có khả năng tấn công mạng cấp độ Mythos — báo cáo kiểm thử đỏ (red teaming) tiền tuyến chỉ rõ các biện pháp bảo vệ yếu kém trên AI mã nguồn mở
ĐỘC QUYỀN DÀNH CHO THÀNH VIÊN
Phân tích tin tức
Bởi
Sayem Ahmed
Đăng tải
Ngày 30 tháng 9 năm 2026
Mô hình GLM-5.3 của Zhipu AI được Anthropic đưa vào tầm ngắm.
Khi bạn mua hàng qua các liên kết trên trang web của chúng tôi, chúng tôi có thể kiếm được hoa hồng liên kết. Đây là cách hoạt động.
(Nguồn ảnh: Getty Images / Bloomberg)
Chia sẻ
Sao chép liên kết
Facebook
X
Whatsapp
Reddit
Pinterest
Flipboard
Email
Chia sẻ bài viết này
Tham gia thảo luận
Theo dõi chúng tôi
Thêm chúng tôi làm nguồn ưu tiên trên Google
Bản tin
Đăng ký nhận bản tin của chúng tôi
Anthropic đã công bố một báo cáo mới, tuyên bố rằng mô hình AI GLM-5.3 của Zhipu AI có thể được sử dụng để tạo ra nội dung độc hại, với các biện pháp bảo vệ yếu kém. Công ty này khẳng định mô hình AI có thể được dùng cho các cuộc tấn công mạng và các biện pháp bảo vệ của nó có thể bị vượt qua bằng nhiều phương pháp.
Báo cáo của Anthropic được đưa ra trong bối cảnh nhiều lời kêu gọi làm chậm quá trình phát triển AI, với việc công ty này đang tìm kiếm sự quản lý và quy định. Mặc dù Giám đốc điều hành Dario Amodei đã kêu gọi điều chỉnh tốc độ phát triển AI tiên tiến, các mô hình Claude Opus 5.5 và Claude Sonnet 5.5 vẫn được phát hành chỉ vài ngày sau khi các cảnh báo được đưa ra.
Hiện tại, công ty AI mã nguồn đóng này, đang có kế hoạch IPO, cho biết các mô hình mã nguồn mở của Trung Quốc có thể bị lạm dụng và tạo ra nội dung độc hại. Anthropic trích dẫn báo cáo của Trung tâm Tiêu chuẩn và Đổi mới AI (Center for AI Standards and Innovation), được công bố vào cuối tháng 9, trong đó tuyên bố rằng GLM-5.3 có thể tự động hóa hoàn toàn các cuộc khai thác ở mức độ tương tự như mô hình AI Claude Mythos chưa được phát hành của Anthropic. Điều này đã thúc đẩy công ty phát triển Dự án Glasswing, một nỗ lực cho phép các nhà phát triển tiếp cận mô hình AI cấp độ Mythos để vá lỗi và khắc phục các lỗ hổng trước khi các mô hình AI như vậy được phát hành.
Video mới nhất từ Tom's Hardware
Xem video đầy đủ tại đây:
Anthropic đã chạy các thử nghiệm riêng trên GLM-5.3 trong Exploitbench, nơi các mô hình AI, trong môi trường hộp cát (sandboxed environment), có thể phát triển các khai thác cho Google Chrome. GLM-5.3 đã phát triển các khai thác đầu cuối (end-to-end exploits) 50 lần trong 410 lượt chạy, với Mythos dẫn đầu với 56 khai thác thành công trong 410 lần thử. Mô hình của Zhipu AI tiếp tục được thử nghiệm trong một trong các tiêu chuẩn nội bộ của Anthropic, nhằm mục tiêu phát triển "các cuộc chiếm quyền điều khiển luồng điều khiển hoàn toàn" (full control-flow hijacks). GLM 5.3 hoạt động chỉ kém Mythos một chút, với tỷ lệ thành công 4%, so với 6% của Mythos. Đáng chú ý, các mô hình mã nguồn mở phổ biến khác như Kimi K3 và DeepSeek V4.1 Flash đạt 0% theo cùng các tiêu chí này.
Anthropic cũng lưu ý cách GLM-5.3 đã có thể phát triển thành công các khai thác chuỗi (chained exploits) một cách tự động, với biến thể "Flash" nhẹ hơn của nó cũng có khả năng phát triển các khai thác chuỗi trong các lỗi đã biết, với chi phí token hóa chỉ 20,40 USD. Tùy thuộc vào số dư, điều đó tương đương với việc GLM-5.3-Flash có khả năng phát triển các khai thác chuỗi (đã biết) bằng cách sử dụng từ 100 đến 300 triệu token, tùy thuộc vào tỷ lệ đầu vào so với đầu ra.
Bạn có thể thích
Các nhà lãnh đạo AI xung đột về nỗi lo an toàn sau khi người tố giác của Anthropic nói AI có thể 'giết chết tất cả chúng ta' vào năm 2030
Việc OpenAI bị xâm nhập HuggingFace báo trước một kỷ nguyên chiến tranh mạng AI chưa từng có
OpenAI và Anthropic được cho là đang điều tra hàng chục nghìn sự cố bảo mật AI; OpenAI tạm dừng thử nghiệm sau khi 'công tắc tiêu diệt' AI không ngăn được một tác nhân bất hảo
Anthropic cũng lưu ý rằng, khi sử dụng mô hình AI GLM-5.3 nguyên bản, việc vượt qua các cơ chế bảo vệ của mô hình (guardrails) rất đơn giản thông qua nhiều phương pháp khác nhau. Công ty này nêu chi tiết rằng có thể thực hiện điều này bằng hai cách: đưa ra một lời nhắc đánh lừa, trong đó AI đóng vai trò là một tác nhân tự trị đối địch, đạt tỷ lệ thành công 64%; và điền trước các mã thông báo suy nghĩ của mô hình (thinking tokens) để đảm bảo phản hồi được tiếp tục, đạt tỷ lệ thành công 92%. Công ty cũng mô tả chi tiết phương pháp thứ ba, được gọi là "abliteration" (vô hiệu hóa).
Vô hiệu hóa cơ chế bảo vệ
Anthropic cáo buộc rằng GLM-5.3 của Zhipu AI có các biện pháp bảo vệ yếu kém, và mô hình AI nguyên bản này thường từ chối các yêu cầu tạo nội dung độc hại. Tuy nhiên, vì Anthropic phát triển các mô hình mã nguồn đóng, sản phẩm của họ không thể bị can thiệp. Do GLM-5.3 có thể tải xuống miễn phí, mô hình này có thể được điều chỉnh và loại bỏ hoàn toàn các cơ chế bảo vệ. Khi được coi là mô hình phát hành chính thức, GLM-5.3 đạt tỷ lệ từ chối tương đương với các mô hình của Anthropic.
Tuy nhiên, Anthropic đã "vô hiệu hóa" GLM-5.3, tức là cố ý loại bỏ các cơ chế bảo vệ của mô hình, và cho thấy rằng sau khi vô hiệu hóa, tỷ lệ từ chối của mô hình giảm xuống chỉ còn 6% đối với GLM-5.3 và 14% đối với GLM-5.3-Flash. Không hiếm khi gặp các mô hình mã nguồn mở đã bị vô hiệu hóa trên HuggingFace, vốn chủ yếu được phát triển để hỗ trợ trong các môi trường thử nghiệm tấn công mô phỏng (simulated red teaming environments), nhưng chúng cũng có thể được sử dụng cho các cuộc tấn công trong thế giới thực. Điều này khiến "khám phá" của Anthropic ít gây ngạc nhiên hơn.
Ngoài ra, sẽ cần một lượng lớn sức mạnh tính toán để chạy phiên bản GLM-5.3 đã bị vô hiệu hóa ở mức độ hoạt động hiệu quả. Trọng số của mô hình yêu cầu 306 GB VRAM ở độ chính xác đầy đủ FP8, và người dùng nên dự kiến phân bổ một lượng VRAM tương tự cho bộ nhớ đệm KV (KV cache) để mang ngữ cảnh. Chạy mô hình với tốc độ ước tính 100 TPS (tokens per second - mã thông báo mỗi giây) không chỉ yêu cầu băng thông bộ nhớ tối thiểu 4 TB/s, mà còn đòi hỏi phần cứng mạnh mẽ, như một cụm tám bộ tăng tốc AI Nvidia H200. Chi phí cần thiết cho loại phần cứng đó lên tới hàng trăm nghìn đô la. Các tác nhân quốc gia đối địch có thể sử dụng thiết lập như vậy, nếu họ có được phần cứng.
Tuy nhiên, đối với một tin tặc cá nhân thông thường? Có thể sẽ cần thuê sức mạnh tính toán, vô hiệu hóa mô hình, và sau đó chạy nó, điều này cũng cực kỳ tốn kém. Anthropic cho biết việc vô hiệu hóa mô hình GLM-5.3-Flash mất 2.200 giờ GPU, mà họ ước tính chi phí là 4.400 USD, hoặc khoảng 2 USD mỗi giờ GPU, phù hợp với chi phí thuê phần cứng.
Đọc thêm
OpenAI mất mười ngày để thông báo cho Hugging Face rằng các mô hình của họ đứng sau vụ tấn công cuối tuần ngày 11/7, báo cáo tuyên bố




Nguồn tin: Hacker News AI — Tác giả: dgellow. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.