
Mistral AI đã công bố Shieldstral, một mô hình ngôn ngữ lớn (LLM) mã nguồn mở được thiết kế để phát hiện nội dung độc hại. Shieldstral có khả năng sánh ngang với các mô hình an toàn lớn hơn nhiều, nhưng chỉ với một phần nhỏ kích thước. Shieldstral được xây dựng dựa trên Mistral 7B, một mô hình ngôn ngữ nhỏ gọn nhưng mạnh mẽ. Mistral AI đã tinh chỉnh Mistral 7B bằng cách sử dụng tập dữ liệu được tạo ra từ các mô hình an toàn độc quyền của họ. Điều này cho phép Shieldstral học cách nhận diện và phân loại các loại nội dung độc hại khác nhau, bao gồm ngôn ngữ kích động thù địch, bạo lực, phân biệt đối xử và thông tin sai lệch. Mặc dù có kích thước nhỏ gọn, Shieldstral đã chứng minh hiệu suất ấn tượng trong các thử nghiệm nội bộ. Mô hình này đạt được độ chính xác cao trong việc phát hiện nội dung độc hại, đồng thời duy trì tốc độ xử lý nhanh. Điều này khiến Shieldstral trở thành một giải pháp lý tưởng cho các ứng dụng yêu cầu khả năng phát hiện nội dung độc hại theo thời gian thực, chẳng hạn như kiểm duyệt nội dung trên mạng xã hội hoặc lọc thư rác. Việc Mistral AI phát hành Shieldstral dưới dạng mã nguồn mở là một bước tiến quan trọng trong lĩnh vực an toàn AI. Bằng cách cung cấp một công cụ mạnh mẽ và dễ tiếp cận để phát hiện nội dung độc hại, Mistral AI đang góp phần thúc đẩy sự phát triển của các hệ thống AI an toàn và có trách nhiệm hơn.
Mô hình Shieldstral 3B mới của Mistral kiểm tra các vi phạm an toàn trong đầu vào và đầu ra của AI bằng cách sử dụng các câu hỏi có/không bằng ngôn ngữ tự nhiên thay vì các danh mục cố định. Mô hình này đạt hiệu suất tương đương với các mô hình lớn gấp bảy lần về một số tiêu chí. Các nhà vận hành có thể tự đặt ra tiêu chí của riêng mình trong thời gian chạy thay vì phụ thuộc vào hệ thống danh mục của bên thứ ba, và mô hình có thể chạy cục bộ. Bài viết Mô hình mở Shieldstral của Mistral đạt hiệu suất tương đương với các mô hình an toàn lớn hơn nhiều với kích thước nhỏ hơn đáng kể xuất hiện lần đầu trên The Decoder.
Nghiên cứu AI
Sao chép URL vào khay nhớ tạm
Chia sẻ bài viết này
Đến phần bình luận
Mô hình mở Shieldstral của Mistral có hiệu suất tương đương với các mô hình an toàn lớn hơn nhiều nhưng với kích thước nhỏ hơn đáng kể
Jonathan Kemper
Xem hồ sơ LinkedIn của Jonathan Kemper
Ngày 5/8/2026
GPT-Image-2 được tạo bởi THE DECODER
Hỏi về bài viết này…
Tìm kiếm
Một bài báo mới đề xuất thay thế các danh mục an toàn cố định bằng các câu hỏi có/không mà người vận hành có thể định nghĩa trong thời gian chạy mà không cần đào tạo lại bộ phân loại.
Theo bài báo, Shieldstral, một mô hình 3 tỷ tham số từ công ty AI Mistral của Pháp, có hiệu suất tương đương với các mô hình lớn gấp ba lần về các tiêu chuẩn an toàn văn bản. Mistral cho biết mô hình này cũng đạt điểm cao mới trong phân loại văn bản và hình ảnh kết hợp.
Các quy tắc thời gian chạy cho phép người vận hành tùy chỉnh kiểm tra an toàn
Nhiều mô hình bảo vệ phân loại nội dung bằng cách sử dụng các phân loại cố định. Các tác giả của bài báo, bao gồm đồng sáng lập Mistral Guillaume Lample, chỉ ra hai vấn đề với phương pháp này: các tập dữ liệu an toàn công cộng nhóm các rủi ro quá khác nhau để hỗ trợ một phân loại chung, và cùng một quy tắc không phù hợp với mọi trường hợp sử dụng. Nội dung phù hợp với công cụ an ninh mạng có thể gây hại trên nền tảng sức khỏe tâm thần.
Người vận hành viết các tiêu chí đánh giá bằng ngôn ngữ tự nhiên. Shieldstral trả về một token, tạo ra điểm an toàn từ 0 đến 1. | Hình ảnh: Mistral
Người vận hành cho Shieldstral biết cần kiểm tra gì bằng các câu hỏi ngôn ngữ tự nhiên như "Nội dung này có khuyến khích bạo lực không?". Mô hình chỉ trả lời "có" hoặc "không", và hệ thống sử dụng xác suất của mỗi phản hồi để tính điểm an toàn từ 0 đến 1.
Dữ liệu tổng hợp giúp mô hình xử lý các quy tắc mới
Các nhà nghiên cứu đã kết hợp khoảng 54,1 triệu ví dụ bao gồm an toàn, nội dung độc hại và các nỗ lực thao túng vào một định dạng. Họ áp dụng các tiêu chuẩn nghiêm ngặt cho thao túng có mục tiêu, tiêu chuẩn vừa phải cho dữ liệu an toàn chung và tiêu chuẩn linh hoạt cho chất lượng phản hồi.
Mỗi ví dụ đào tạo bao gồm hướng dẫn nhiệm vụ, một câu hỏi có/không cụ thể và nội dung đang được xem xét. Câu trả lời là một token duy nhất. | Hình ảnh: Mistral
Để dạy Shieldstral các phân biệt tinh tế hơn, nhóm đã sử dụng một mô hình ngôn ngữ khác để viết lại văn bản an toàn thành các biến thể không an toàn. Mỗi ví dụ cũng bao gồm một danh mục tương tự nhưng khác phải bị từ chối, điều này đào tạo mô hình tách các quy tắc liên quan chặt chẽ thay vì chỉ đưa ra một phán đoán an toàn hoặc không an toàn chung.
Các tác giả đã tạo ra các danh mục kiểm tra khả năng thích ứng riêng biệt với tập huấn luyện, sử dụng các tên và mức độ chi tiết khác nhau. Không có danh mục kiểm tra chi tiết nào trực tiếp khớp với danh mục huấn luyện, mặc dù 10 trong số 12 lớp rộng hơn có các đối tác tương ứng, họ cho biết.
Mô hình 3B có hiệu suất tương đương với mô hình lớn gần gấp bảy lần
Trên các tiêu chuẩn văn bản kết hợp, Shieldstral đạt điểm F1 là 84,9%. F1 kết hợp độ chính xác và độ thu hồi thành một chỉ số, với 100% đại diện cho một điểm hoàn hảo. Kết quả đó tương đương với GPT-OSS-Safeguard-20B của OpenAI, lớn hơn khoảng bảy lần, và đánh bại Qwen3Guard-8B với 84,0%, Nemotron-3.5-Safety-4B với 83,3% và LlamaGuard-4-12B với 69,1%.
Trên hình ảnh và kết hợp hình ảnh-văn bản, Shieldstral đạt 83,8%, vượt qua OmniGuard-7B với 77,6% và LlavaGuard-7B với 71,6%.
Trên các tiêu chuẩn văn bản, Shieldstral có hiệu suất tương đương với một mô hình của OpenAI có kích thước lớn hơn khoảng bảy lần. | Ảnh: Mistral
GPT-OSS-Safeguard-20B dẫn đầu tiêu chuẩn về khả năng thích ứng với 94,1%, so với 91,3% của Shieldstral. Thử nghiệm này sử dụng các quy tắc khác biệt so với các danh mục đào tạo hoặc hoàn toàn mới. Các tác giả vẫn đánh giá Shieldstral thực tế hơn GPT-OSS-Safeguard-20B và Nemotron-3.5-Safety, vì cả hai mô hình này đều tạo ra các chuỗi lập luận trung gian dài làm tăng chi phí tính toán, trong khi Shieldstral chỉ trả về một từ.
Đối với các chính sách không có trong quá trình đào tạo, Shieldstral xếp sau hai mô hình tạo ra lập luận trung gian trước khi trả lời. | Ảnh: Mistral
Shieldstral được xây dựng dựa trên Ministral-3B của Mistral với bộ mã hóa thị giác Pixtral. Trong một thử nghiệm xác thực với các danh mục chi tiết, dữ liệu danh mục tổng hợp đã nâng điểm F1 lên 23,3 điểm phần trăm, mà các nhà nghiên cứu cho rằng đây là yếu tố chính thúc đẩy khả năng thích ứng với các quy tắc mới của mô hình.
Shieldstral có sẵn dưới dạng mô hình mã nguồn mở theo giấy phép Apache 2.0.
Các quy tắc tùy chỉnh có thể hạn chế các lỗi lọc tốn kém
Các bộ phân loại an toàn nằm ở hai phía của mô hình ngôn ngữ chính, sàng lọc các lời nhắc trước khi xử lý và các phản hồi trước khi chúng đến tay người dùng. Các nhà vận hành có thể cập nhật các quy tắc này mà không cần đào tạo lại mô hình chính. Tuy nhiên, vì mọi yêu cầu đều đi qua bộ phân loại, kích thước, tốc độ và chi phí của nó sẽ tăng lên nhanh chóng.
Claude Fable 5 của Anthropic đã cho thấy các bộ lọc được điều chỉnh kém có thể ảnh hưởng đến việc sử dụng thực tế như thế nào. Artificial Analysis phát hiện ra rằng hệ thống tự động định tuyến 8 đến 9% tác vụ đến một mô hình yếu hơn. Một nhà vật lý y tế đã gọi Fable 5 là không thể sử dụng được vì công việc của ông thường bao gồm từ "hạt nhân". Những người dùng khác báo cáo rằng hệ thống đã gắn cờ phân tích MRI là khủng bố sinh học.
Anthropic đã thắt chặt bộ lọc sau khi xác định một vấn đề an toàn và cho biết kể từ đó đã chặn các tác vụ mã hóa vô hại thường xuyên hơn. Shieldstral cung cấp cho các nhà vận hành nhiều quyền kiểm soát hơn đối với sự đánh đổi đó. Họ có thể viết các tiêu chí sàng lọc trong thời gian chạy và điều chỉnh bộ lọc cho một ứng dụng cụ thể thay vì áp dụng các danh mục của người khác.
Các bộ phân loại này đã đóng một vai trò ngày càng tăng trong toàn ngành. OpenAI sử dụng chúng để phát hiện tuổi tự động trong ChatGPT và định tuyến các yêu cầu cảm xúc thông qua bộ lọc an toàn đến các mô hình nghiêm ngặt hơn. Claude Code sử dụng bộ phân loại để chặn các tập lệnh bên ngoài, triển khai sản xuất và đẩy mạnh. Đánh giá Fable 5 của Anthropic cũng yêu cầu công ty lưu trữ đầu vào và đầu ra trong tối đa 30 ngày, hoặc tối đa hai năm sau khi vi phạm quy tắc.



Nguồn tin: The Decoder — Tác giả: Jonathan Kemper. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.