
Nvidia Nemotron 3.5 Lightning mã nguồn mở ưu tiên tốc độ hơn là trí thông minh tối đa.
Mô hình Nemotron 3.5 Lightning của Nvidia là một mô hình mã nguồn mở với chỉ 3,6 tỷ tham số hoạt động. Mô hình này đạt hiệu suất tương đương gpt-oss-120b của OpenAI trên Chỉ số Thông minh, mặc dù có kích thước nhỏ hơn bốn lần. Với tốc độ gần 670 token mỗi giây, đây cũng là mô hình nhanh nhất trong số các mô hình được so sánh, cho thấy Nvidia đang đặt cược vào hiệu quả thay vì kích thước thô. Bài viết Mô hình mã nguồn mở Nemotron 3.5 Lightning của Nvidia ưu tiên tốc độ hơn trí tuệ tối đa xuất hiện lần đầu trên The Decoder.
AI trong thực tiễn
Nemotron 3.5 Lightning mã nguồn mở của Nvidia ưu tiên tốc độ hơn là trí thông minh tối đa.
Matthias Bastian
Ngày 11/8/2026
Nano Banana Pro được gợi ý bởi THE DECODER
Mô hình Nemotron 3.5 Lightning mới của Nvidia là một mô hình mã nguồn mở nhỏ gọn, đạt điểm tương đương với gpt-oss-120b của OpenAI trên các tiêu chuẩn trí tuệ với số lượng tham số chỉ bằng một phần tư, đồng thời mang lại tốc độ suy luận nhanh nhất trong phân khúc.
Nvidia đã phát hành Nemotron 3.5 Lightning, mô hình đầu tiên trong dòng sản phẩm Nemotron 3.5 mới của hãng. Mô hình này kế nhiệm trực tiếp Nemotron 3 Nano 30B A3B và giữ kiến trúc lai Mamba-Transformer, với tổng cộng 31,6 tỷ tham số và chỉ 3,6 tỷ tham số hoạt động tại bất kỳ thời điểm nào.
Theo nền tảng đánh giá độc lập Artificial Analysis, mô hình này đạt 24 điểm trên Chỉ số Trí tuệ (Intelligence Index), tăng 9 điểm so với phiên bản tiền nhiệm (15). Điều này đưa Lightning ngang hàng với gpt-oss-120b (24) của OpenAI và chỉ đứng sau Nemotron 3 Super (26) của chính Nvidia, vốn lớn hơn khoảng bốn lần. Các mô hình nhỏ thông minh nhất trong cùng phân khúc kích thước, như Qwen3.6 35B A3B (32) và Muse Glimmer (35) mới của Meta, vẫn giữ một lợi thế rõ ràng.
Nemotron 3.5 Lightning đạt 24 điểm trên Chỉ số Trí tuệ của Artificial Analysis, ngang bằng với gpt-oss-120b. | Hình ảnh: Artificial Analysis
Nvidia đang nhắm đến một vị trí khác trên ranh giới hiệu quả với Lightning. Trong các thử nghiệm trước khi phát hành sử dụng trọng số NVFP4 cuối cùng, mô hình đạt gần 670 token mỗi giây, là thông lượng cao nhất được đo lường trong số tất cả các mô hình được so sánh và nhanh gần gấp đôi so với Gemini 3.5 Flash-Lite (386 token/s) của Google. Một tác vụ từ Chỉ số Trí tuệ mất khoảng 0,5 phút để hoàn thành, trong khi Qwen3.6 35B A3B cần khoảng 3,5 phút và Gemma 4 31B mất khoảng 5,8 phút.
Với 669 token mỗi giây, Lightning là mô hình nhanh nhất trong so sánh. Mặc dù tạo ra số lượng token tương tự mỗi tác vụ như phiên bản tiền nhiệm Nemotron 3 Nano, nó mang lại kết quả tốt hơn nhiều. | Hình ảnh: Artificial Analysis
Các mô hình độc quyền vẫn chiếm ưu thế trên ranh giới hiệu quả tổng thể. Gemini 3.5 Flash-Lite đạt 37 điểm trên Chỉ số Trí tuệ với thời gian hoàn thành tác vụ tương tự, và GPT-5.6 Luna (max) đạt 52 điểm trong vòng chưa đầy hai phút.
Các tiêu chuẩn đánh giá tác nhân cho thấy những cải tiến lớn nhất
Theo Artificial Analysis, những cải tiến lớn nhất xuất hiện trong các tiêu chuẩn đánh giá tác nhân (agentic benchmarks). Trên GDPval-AA v2, Lightning đạt xếp hạng Elo là 824, tăng 334 điểm so với Nemotron 3 Nano. Con số này vượt qua cả gpt-oss-120b (800) và Nemotron 3 Super (698) lớn hơn. Trên Terminal-Bench v2.1, điểm số tăng từ 7% lên 24,3%, gần bằng gpt-oss-120b ở mức 26,2%.
Trên các tiêu chuẩn đánh giá tác nhân, Lightning vượt qua cả gpt-oss-120b và Nemotron 3 Super lớn hơn với xếp hạng Elo là 824. | Hình ảnh: Artificial Analysis
Nvidia phát hành mô hình theo giấy phép OpenMDW-1.1 có tính chất cho phép, định vị nó là một công cụ hiệu suất cao cho các quy trình dựa trên tác nhân. Artificial Analysis báo cáo rằng Nvidia đã hợp tác với các đối tác như CodeRabbit và Harvey trong quá trình hậu huấn luyện để tăng cường hiệu suất trong các lĩnh vực cụ thể.
Khả dụng
Nvidia cung cấp mô hình với cả trọng số BF16 và NVFP4. Theo Artificial Analysis, biến thể NVFP4 cũng đạt 24 điểm trên Chỉ số Thông minh (Intelligence Index) với tổn thất chất lượng tối thiểu so với phiên bản có độ chính xác cao hơn. Mô hình suy luận này chỉ xử lý văn bản và hỗ trợ cửa sổ ngữ cảnh (context window) một triệu token. Trọng số hiện đã có sẵn, và dịch vụ suy luận phi máy chủ (serverless inference) được cung cấp bởi DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius và Crusoe, cùng nhiều nhà cung cấp khác.
Việc Nvidia thúc đẩy hiệu quả hơn là kích thước không phải là điều mới. Trong một bài báo được thảo luận rộng rãi vào năm ngoái, các nhà nghiên cứu của hãng đã lập luận rằng các mô hình dưới 10 tỷ tham số có thể xử lý hầu hết các tác vụ tác nhân (agent workloads) tốt như các mô hình 70 đến 175 tỷ tham số với chi phí chỉ bằng một phần mười đến một phần ba mươi. Nemotron 3.5 Lightning có 31,6 tỷ tham số nhưng chỉ kích hoạt 3,6 tỷ mỗi bước, xếp nó vào cùng phân khúc nhẹ. Với gần 670 token mỗi giây, nó cũng vượt trội so với gpt-oss-120b và Nemotron 3 Super lớn hơn trên các tiêu chí đánh giá tác nhân (agentic benchmarks), trở thành bằng chứng cấp sản phẩm rõ ràng nhất cho luận điểm đó cho đến nay.



Nguồn tin: The Decoder — Tác giả: Matthias Bastian. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.