Giới thiệu Needle 2: Mô hình gọi công cụ mã nguồn mở 45 triệu tham số, được phân phối dưới dạng tệp nhị phân 14MB và chạy một phiên làm việc đầy đủ chỉ với 28MB RAM
Cactus Compute đã phát hành Needle 2, một mô hình mã nguồn mở 45 triệu tham số dành cho việc gọi công cụ, sử dụng thiết bị và trích xuất có cấu trúc. Toàn bộ mô hình được đóng gói dưới dạng một tệp nhị phân duy nhất dung lượng 14MB, có thể chạy một phiên làm việc đầy đủ với khoảng 28MB RAM. Các trọng số được huấn luyện và triển khai ở định dạng CQ2-bit bằng cách sử dụng Cactus Quants, và mô hình được niêm phong bên trong công cụ C++ riêng của công ty, do đó không cần cài đặt môi trường chạy (runtime) và không cần tải xuống tại thời điểm suy luận. Thông lượng giải mã được báo cáo là 500 token/giây trên Raspberry Pi 5, 400–1.500 token/giây trên Meta Quest 3S và Apple Vision Pro, cùng với 300–700 token/giây trên các điện thoại có giá dưới 200 USD. Thiết kế này ưu tiên hiệu quả.
Cactus Compute đã phát hành Needle 2, một mô hình mã nguồn mở 45 triệu tham số dành cho việc gọi công cụ, sử dụng thiết bị và trích xuất có cấu trúc. Toàn bộ mô hình được đóng gói dưới dạng một tệp nhị phân duy nhất dung lượng 14MB, có thể chạy một phiên làm việc đầy đủ với khoảng 28MB RAM. Các trọng số được huấn luyện và triển khai ở định dạng CQ2-bit bằng Cactus Quants, và mô hình được niêm phong bên trong công cụ C++ riêng của công ty, do đó không cần cài đặt môi trường chạy (runtime) và không cần tải xuống tại thời điểm suy luận. Tốc độ giải mã được báo cáo là 500 token/giây trên Raspberry Pi 5, 400–1.500 token/giây trên Meta Quest 3S và Apple Vision Pro, và 300–700 token/giây trên các điện thoại có giá dưới 200 USD. Tiền đề thiết kế rất cụ thể và được nhóm phát triển trình bày rõ ràng: việc ánh xạ một câu lộn xộn sang một chữ ký hàm được định kiểu không yêu cầu kiến thức thế giới hay văn xuôi mở. Khung khái niệm này giải thích tại sao 45 triệu tham số là đủ ở đây, và tại sao mô hình nhắm mục tiêu đến các phần cứng không có GPU và không có NPU.
Có thể triển khai được không?
Có, Needle 2 được phát hành dưới dạng các tệp nhị phân được biên dịch sẵn và một thư viện tĩnh cho macOS, Linux (x86-64, ARM64, ARMv7, RISC-V, MIPS32el), Windows, Android, iOS/watchOS/tvOS và WebAssembly. Cactus cho biết Pebble đã chạy Needle cục bộ trong ứng dụng Index 01 cho các tác vụ giọng nói ngoại tuyến.
Các công ty nào có thể sử dụng: Bất kỳ nhóm nào phát triển phần mềm cơ sở (firmware) hoặc ứng dụng trên phần cứng có giới hạn. Các công ty khởi nghiệp thiết bị đeo và IoT giai đoạn hạt giống, các nhà sản xuất thiết bị điện tử tiêu dùng tầm trung, các nhóm robot và các nhà sản xuất thiết bị lớn cần một giải pháp dự phòng ngoại tuyến. Các nhóm SaaS ưu tiên đám mây sẽ ít được hưởng lợi hơn.
Các ngành công nghiệp: nhà thông minh, thiết bị đeo, di động cấp thấp, điều khiển trong cabin ô tô, robot dịch vụ, ki-ốt bán lẻ và POS, bộ định tuyến và camera IP, và các môi trường được quản lý nơi âm thanh không thể rời khỏi thiết bị.
Các ứng dụng: điều khiển bằng giọng nói trên các thiết bị không màn hình, điều khiển thiết bị ngoại tuyến, trích xuất trường từ hóa đơn và biên lai, gắn thẻ liệt kê (enum tagging), và định tuyến cục bộ chỉ chuyển lên đám mây khi độ tin cậy thấp.
Kiến trúc: Mạng lưới chú ý đơn giản (Simple Attention Network)
Needle 2 sử dụng cái mà nhóm Cactus gọi là Mạng lưới chú ý đơn giản. Công thức này thay thế FFN bằng một Hadamard MLP, giữ lại cơ chế chú ý GQA, bổ sung bộ nhớ khóa-giá trị (key-value memory) n-gram từ các bảng n-gram được băm, và sử dụng các siêu kết nối đa làn (multi-lane hyper-connections). Mạng lưới có 27 lớp và độ rộng 512. Nghiên cứu cơ bản được công bố trên arXiv với tiêu đề "A Controlled Study of Attention-Only Transformers".
Quá trình tiền huấn luyện sử dụng một kho ngữ liệu độc quyền 115 tỷ token, với 38 tỷ token được sử dụng cho hậu huấn luyện. Nhóm nghiên cứu lưu ý rằng LFM2.5-230M đã được tiền huấn luyện trên 19 nghìn tỷ token.
Needle 2 tiêu thụ 70 MFLOPs mỗi token, với 35 triệu trong số 45 triệu tham số hoạt động trong phép nhân ma trận (matmul-active). LFM2.5 230M tiêu thụ 460 MFLOPs, FunctionGemma 270M tiêu thụ 540 MFLOPs, và Apple FM nằm gần mức 6.000 MFLOPs.
Công cụ, ngữ pháp, truy xuất và độ tin cậy
Các trọng số không bao giờ được giải nén vào RAM. Các mã 2-bit được mở rộng bên trong các thanh ghi vectơ và hợp nhất thành các tích vô hướng số nguyên, do đó đường dẫn số học vẫn là int8. Một tệp nhị phân sẽ dò tìm CPU khi khởi động và chọn một cấp độ nhân (kernel tier): SDOT, NEON, AVX2, RISC-V vectors, wasm SIMD, hoặc scalar.
Một ngữ pháp cấp byte được biên dịch từ các lược đồ JSON của người dùng sẽ giới hạn mọi token được phát ra. Vì bộ so khớp biết token nào hợp lệ trước khi các logit tồn tại, công cụ bỏ qua tới 98% phép chiếu từ vựng trên các token cấu trúc.
Cơ chế chú ý sử dụng cửa sổ trượt 256 token, và lượt hệ thống cùng với các khai báo công cụ được ghim làm các điểm chìm KV (KV sinks). Bộ nhớ duy trì gần 28MB bất kể độ dài cuộc hội thoại.
Khai báo năm công cụ hoặc ít hơn và chúng sẽ được hiển thị trực tiếp. Trên năm công cụ, một đầu truy xuất tương phản sẽ nhúng mỗi lược đồ một lần, chấm điểm truy vấn mỗi lượt, và chỉ chấp nhận năm công cụ hàng đầu. Các công cụ không được chọn sẽ không thể truy cập được, không chỉ đơn thuần là không có khả năng.
Mỗi phản hồi mang một giá trị độ tin cậy, là giá trị tối thiểu của một đầu hậu xử lý đã được hiệu chỉnh và xác suất giải mã của các token gọi. Các yêu cầu không liên quan sẽ trả về lệnh gọi trống []. Hợp đồng là một ngưỡng: hành động trên ngưỡng, yêu cầu lại hoặc leo thang dưới ngưỡng.
Đánh giá
Nhóm Cactus đánh giá trên năm bộ tiêu chuẩn gọi hàm công khai bằng cách sử dụng phương pháp khớp chính xác nghiêm ngặt có thứ tự, trong đó tên, thứ tự gọi và mọi đối số phải khớp. Needle 2 chạy end-to-end thông qua công cụ đã phát hành ở CQ2-bit với tính năng truy xuất được bật; các đường cơ sở chạy f16 dưới vLLM.
Bộ tiêu chuẩn Needle 2 (CQ2) LFM2.5 230M FunctionGemma 270M Apple FMMobile Actions (961) 63.7 69.1 64.0 57.6 DroidCall (200) 17.0 11.0 17.5 — Seal-Tools in-domain (700) 32.6 26.9 16.3 — Seal-Tools OOD (654) 28.7 17.0 15.6 — BFCL v4 single-turn (3,641), tổng thể 42.6 60.8 46.1 61.7
Needle 2 dẫn đầu cả hai phân đoạn Seal-Tools và đạt độ chính xác tên hàm 98,3% trên Mobile Actions. Nó kém hơn trên BFCL v4, điều mà Cactus cho là do phân phối: tập dữ liệu của nó là các hành động trên thiết bị tiêu dùng, không phải API chung hoặc doanh nghiệp. Tỷ lệ đầu ra được định dạng tốt trên 3.641 hàng BFCL là 93,4%. Nhóm nghiên cứu nêu rõ hai điểm bất đối xứng ngay từ đầu: các đường cơ sở f16 có lợi cho họ, và chuyên môn hóa tác vụ có lợi cho Needle.
Giải mã lệnh gọi
Đặt lại
> giảm độ sáng phòng khách xuống 30
buộc bởi ngữ pháp
giá trị được mô hình chọn
Số hàng từ vựng được chấm điểm · cấu trúc 0%
Số byte cấu trúc bị buộc 0
Trên năm công cụ, chỉ có năm công cụ tiếp cận mô hình
Mỗi lược đồ được nhúng một lần bởi một đầu tương phản tích hợp. Mỗi lượt chấm điểm truy vấn và
chấp nhận năm công cụ hàng đầu; ngữ pháp sau đó được xây dựng lại trên tập con đó. Một công cụ không được chọn sẽ không thể truy cập được.
Chọn một truy vấn
"giảm độ sáng phòng khách"
"nhắn tin cho Ada tôi đến muộn"
"đặt nó thành 21 và phát nhạc jazz"
Danh mục đã khai báo — 12 công cụ
Nguồn tin: MarkTechPost — Tác giả: Michal Sutter. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.