
Cloudflare cho biết mô hình Clef mới của họ đồng nghĩa với việc con người không còn cần tham gia vào quy trình hoạt động của các tác nhân AI.
Với Clef và Clef-flash, Cloudflare đang thách thức mô hình quyết định Jev của TypeSafe AI. Clef-flash cung cấp các phân loại trong khoảng 39 mili giây, nhanh hơn Jev hơn mười lần. Cả hai mô hình đều được xây dựng trên Qwen, cấp phép theo Apache 2.0, và được thiết kế để các tác nhân AI (AI agents) đưa ra các quyết định có cấu trúc mà không cần tạo văn bản. Bài viết Cloudflare cho biết mô hình Clef mới của họ có nghĩa là con người không còn cần tham gia vào quy trình cho các tác nhân AI đã xuất hiện lần đầu trên The Decoder.
AI trong thực tiễn
Cloudflare cho biết mô hình Clef mới của họ đồng nghĩa với việc con người không còn cần tham gia vào quy trình vận hành các tác nhân AI.
Jonathan Kemper
Ngày 2/10/2026
Các điểm chính
Cloudflare đã phát hành Clef và Clef-flash, hai mô hình quyết định dành cho các tác nhân AI, cạnh tranh trực tiếp với Jev của TypeSafe AI.
Thay vì tạo văn bản, các mô hình này gán xác suất cho các tùy chọn trả lời được xác định trước, cho phép các hệ thống hạ nguồn tự động hành động dựa trên kết quả.
Cả hai mô hình đều được xây dựng trên Qwen và hỗ trợ văn bản cùng hình ảnh. Cloudflare báo cáo thời gian phản hồi trung bình là 39 mili giây đối với Clef-flash và 209 mili giây đối với Clef, nhanh hơn các mô hình quyết định cạnh tranh.
Cloudflare đang phát hành Clef và Clef-flash, hai mô hình quyết định dành cho các tác nhân AI. Tốc độ là điểm bán hàng chính của công ty để cạnh tranh với Jev, mô hình dẫn đầu thị trường.
Một mô hình quyết định trả về một phân loại ngắn gọn kèm theo xác suất, thay vì một phản hồi văn bản dài. Khi nhận được một tin nhắn hỗ trợ khách hàng, Clef đánh giá mức độ khẩn cấp và xác định đội ngũ nên xử lý. Mã hạ nguồn có thể sử dụng các kết quả đó để định tuyến một yêu cầu, kích hoạt leo thang hoặc chuyển trường hợp cho con người.
Theo Cloudflare, "con người không nhất thiết phải tham gia vào các quyết định của tác nhân nữa." Các tác nhân có thể "thu thập ngữ cảnh, đưa ra quyết định và thực hiện hành động đối với các tác vụ một cách có lập trình, hoặc chuyển giao cho con người khi cần." Cloudflare lấy tên từ âm nhạc, nơi một khóa nhạc (clef) gán cao độ cho các dòng của khuông nhạc. Tương tự, một mô hình quyết định đặt ra khuôn khổ cho các hành động tiếp theo. Sự tương đồng về ngữ âm với "Jev" có lẽ cũng không phải là ngẫu nhiên.
Một mô hình quyết định trả lời nhiều câu hỏi được xác định trước về một đầu vào cùng lúc, trả về xác suất cho mỗi tùy chọn trả lời. | Hình ảnh: Cloudflare
Các "mô hình quyết định" này lấp đầy một khoảng trống giữa các mô hình ngôn ngữ lớn (LLM) và các bộ phân loại truyền thống. Các mô hình ngôn ngữ có thể suy luận và gọi các công cụ, nhưng đầu ra của chúng đa dạng và chúng có thể chậm. Các bộ phân loại truyền thống nhanh nhưng cần được huấn luyện lại cho mỗi danh mục mới. Cloudflare coi Clef là một câu trả lời trực tiếp cho mô hình Jev của TypeSafe AI và giữ cho API hoàn toàn tương thích để khách hàng có thể dễ dàng chuyển đổi.
Clef-flash trả về quyết định trong 39 mili giây
Trên 43 tiêu chuẩn, Clef và Clef-flash nhỏ hơn nhanh hơn tất cả các mô hình quyết định cạnh tranh có liên quan, theo Cloudflare. Công ty báo cáo độ trễ trung bình khoảng 39 mili giây đối với Clef-flash và khoảng 209 mili giây đối với Clef, so với hơn 524 mili giây đối với Jev. Cả hai mô hình đều chạy trực tiếp trên cơ sở hạ tầng của Cloudflare, điều mà công ty cho biết cũng cho phép chúng hưởng lợi từ sự gần gũi với các trung tâm dữ liệu biên.
Theo số liệu tự báo cáo của Cloudflare, Clef mang lại chất lượng quyết định cao nhất, trong khi Clef-flash gần như đạt được độ chính xác của Jev với độ trễ thấp hơn đáng kể. | Ảnh: Cloudflare
Đội ngũ tình báo mối đe dọa của Cloudflare đã và đang thử nghiệm Clef để phân loại các trang web. Trong một ví dụ, hệ thống này gán cho một tên miền 95% khả năng là trang web thời trang và 85% khả năng là cửa hàng trực tuyến. Khả năng đây là một trang lừa đảo (phishing) là dưới 1%. Việc tìm nạp, hiển thị và phân loại trang web này mất 2,2 giây. Mô hình ngôn ngữ đa năng nhanh nhất của công ty mất 4,7 giây cho cùng quy trình và chỉ trả về hai danh mục.
Theo Cloudflare, Clef cũng có thể xử lý hình ảnh, trong khi Jev hiện chỉ giới hạn ở văn bản. Cửa sổ ngữ cảnh 64.000 token của Clef chứa lượng đầu vào gấp đôi so với Jev. Clef cũng dẫn đầu về Chỉ số Quyết định Jev (Jev Decision Index) trong các thử nghiệm nội bộ của Cloudflare.
**Điểm chuẩn · độ chính xác**
| | Clef | Clef-flash | Jev | DiffusionGemma Jev | Kev 9B | Laya |
| --------- | ----- | ---------- | ----- | ------------------ | ------ | ----- |
| API Bank | 91.93 | 93.11 | 88.19 | 83.66 | 56.30 | 11.41 |
| When2Call | 72.37 | 65.58 | 80.97 | 75.44 | 49.62 | 11.94 |
| PhishNChips | 79.60 | 75.05 | 62.55 | 85.35 | 50.75 | 50.15 |
Cloudflare dựa trên các mô hình Qwen.
Theo Cloudflare, Clef dựa trên Qwen3.8-27B và Clef-flash dựa trên Qwen3.5-9B nhỏ hơn. Cloudflare giữ nguyên các mô hình cơ sở trong quá trình huấn luyện và sử dụng dữ liệu tổng hợp của riêng mình để huấn luyện các thành phần bổ sung. Các thành phần này suy ra các tùy chọn trả lời và xác suất từ các phép tính nội bộ của mô hình.
Cloudflare cũng sử dụng một biến thể riêng của Học tăng cường cho các Quyết định được Hiệu chỉnh (Reinforcement Learning for Calibrated Decisions - RLCD), phương pháp huấn luyện mà TypeSafe đã sử dụng để huấn luyện Jev. RLCD huấn luyện các mô hình trả lời nhiều câu hỏi về một đầu vào trong một lần gọi duy nhất, nhằm mục đích gán các xác suất phù hợp với tần suất các câu trả lời thực sự chính xác. Trước đây, công ty đã thử nghiệm với DiffusionGemma để suy ra các giá trị quyết định cố định từ các phép tính nội bộ của mô hình ngôn ngữ.
Khách hàng sẽ có thể tinh chỉnh Clef cho các tác vụ riêng của họ.
Cùng với việc ra mắt, Cloudflare đang triển khai một dịch vụ học tăng cường cho phép khách hàng điều chỉnh Clef cho các tác vụ riêng của họ. Một nhóm kỹ sư triển khai tại chỗ (forward deployed engineers) ban đầu sẽ xử lý việc tinh chỉnh với khách hàng, với một nền tảng tự phục vụ được lên kế hoạch sau này.
Khách hàng sẽ có thể xây dựng một bộ dữ liệu bằng cách ghi lại các yêu cầu thông qua AI Gateway, sau đó đánh giá các yêu cầu đó trong các vùng chứa đóng vai trò là môi trường thử nghiệm (sandbox) RLCD. Một thành phần huấn luyện viên mới sẽ cho phép họ triển khai mô hình đã tinh chỉnh trên Workers AI. Để chạy các mô hình tùy chỉnh, Cloudflare sử dụng công nghệ từ Replicate, công ty mà họ đã mua lại vào cuối năm 2025.
Nền tảng tự phục vụ theo kế hoạch của Cloudflare sẽ ghi lại dữ liệu sản xuất, tinh chỉnh Clef bằng học tăng cường và triển khai lại mô hình tùy chỉnh trực tiếp. | Ảnh: Cloudflare
Cloudflare cho biết họ có kế hoạch sử dụng Clef nội bộ để xem xét các báo cáo lạm dụng, sắp xếp các yêu cầu hỗ trợ và phân biệt các bot hữu ích với các bot độc hại. Cả hai mô hình đều chạy trên nền tảng Workers AI của Cloudflare và có sẵn trên Hugging Face theo giấy phép Apache-2.0.
Cách tiếp cận này đã được phổ biến bởi TypeSafe AI, công ty khởi nghiệp do cựu nhà nghiên cứu OpenAI Diogo thành lập.



Nguồn tin: The Decoder — Tác giả: Jonathan Kemper. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.