NVIDIA Nemotron 3.5 Lightning: Cỗ máy chủ lực cho tác nhân AI
Các tác nhân AI hoạt động lâu dài thường dành phần lớn thời gian cho việc thực thi các tác vụ thường lệ thay vì suy luận phức tạp. Sau khi lập kế hoạch, chúng có thể thực hiện hàng trăm lệnh gọi công cụ, đọc tệp, xác thực, lệnh và các bước định dạng. Do đó, việc sử dụng một mô hình suy luận tiên tiến cho mọi hành động có thể trở nên chậm và tốn kém một cách không cần thiết. Nemotron 3.5 Lightning của NVIDIA áp dụng một […] Bài viết NVIDIA Nemotron 3.5 Lightning: Cỗ máy làm việc của tác nhân AI xuất hiện đầu tiên trên Analytics Vidhya.
Nemotron 3.5 Lightning: Đánh giá mô hình tác nhân AI nhanh của NVIDIA
Hội nghị AI tương lai nhất của Ấn Độ đã trở lại – Lớn hơn, Sắc nét hơn, Táo bạo hơn
d : h : m : s
Xem chi tiết
Các khóa học miễn phí
Các khóa học miễn phí
Lộ trình học tập
Chương trình tăng tốc
Chương trình tăng tốc
Mới
Chương trình GenAI Pinnacle
GenAI Pinnacle Plus
Người tiên phong AI tác nhân
Mới
DeepSeek
Hội nghị thượng đỉnh DataHack 2025
DHS 2026
Các khóa học miễn phí
Đăng nhập
Chuyển chế độ
Đăng xuất
Luyện phỏng vấn
Sự nghiệp
GenAI
Kỹ thuật nhắc lệnh (Prompt Engg)
ChatGPT
LLM
Langchain
RAG
AI Agents
Học máy (Machine Learning)
Học sâu (Deep Learning)
Công cụ GenAI
LLMOps
Python
NLP
SQL
Dự án AIML
Danh sách đọc
Lộ trình học tập phân tích dữ liệu
Cách trở thành nhà phân tích dữ liệu vào năm 2025: Lộ trình hoàn chỉnh
Lộ trình học tập Tableau
Lộ trình học tập Tableau toàn diện vào năm 2025
Lộ trình học tập NLP
Lộ trình học tập NLP toàn diện 2025
Lộ trình học tập nhà khoa học dữ liệu
Lộ trình học tập để trở thành nhà khoa học dữ liệu vào năm 2025
Lộ trình học tập kỹ sư dữ liệu
Lộ trình từng bước để trở thành kỹ sư dữ liệu vào năm 2025
Lộ trình học tập MLOps
Lộ trình học tập MLOps toàn diện: Phiên bản 2025
Lộ trình học tập kỹ sư AI
Lộ trình để trở thành kỹ sư AI vào năm 2025
Lộ trình học tập thị giác máy tính
Lộ trình học tập toàn diện để thành thạo thị giác máy tính vào năm 2025
Lộ trình học tập AI tạo sinh (Generative AI)
Lộ trình tốt nhất để học AI tạo sinh vào năm 2025
Lộ trình AI tạo sinh cho doanh nghiệp
Lộ trình GenAI cho doanh nghiệp
Lộ trình LLM
Các mô hình ngôn ngữ lớn được giải mã: Lộ trình dành cho người mới bắt đầu
Lộ trình kỹ sư nhắc lệnh (Prompt Engineer)
Lộ trình học tập để trở thành chuyên gia kỹ thuật nhắc lệnh
Trang chủ
AI Agents
NVIDIA Nemotron 3.5 Lightning: Công cụ AI Agent chủ lực
NVIDIA Nemotron 3.5 Lightning: Công cụ AI Agent chủ lực
Harsh Mishra
Cập nhật lần cuối: 14/8/2026
8 phút đọc
Các tác nhân AI hoạt động lâu dài thường dành phần lớn thời gian cho việc thực thi thường xuyên hơn là suy luận phức tạp. Sau khi lập kế hoạch, chúng có thể thực hiện hàng trăm lệnh gọi công cụ, đọc tệp, xác thực, lệnh và các bước định dạng. Do đó, việc sử dụng một mô hình suy luận tiên tiến cho mọi hành động có thể trở nên chậm và tốn kém một cách không cần thiết.
NVIDIA Nemotron 3.5 Lightning áp dụng một cách tiếp cận khác: một mô hình nhanh, hiệu quả được thiết kế cho việc thực thi tác nhân khối lượng lớn. Ý tưởng rất đơn giản: sử dụng mô hình đắt tiền để suy nghĩ và mô hình nhanh để làm việc. Trong bài viết này, chúng tôi xem xét liệu kiến trúc đó có thể giảm chi phí mà không làm giảm hiệu suất tác nhân hay không.
Mục lục
NVIDIA Nemotron 3.5 Lightning là gì?
Tại sao NVIDIA xây dựng một mô hình tập trung vào thực thi
Tìm hiểu sâu về kiến trúc
Tại sao Nemotron 3.5 Lightning lại nhanh đến vậy?
Kết quả điểm chuẩn của NVIDIA Nemotron 3.5 Lightning
Giá của Nemotron 3.5 Lightning
Cách truy cập NVIDIA Nemotron 3.5 Lightning
Thực hành: Sử dụng Nemotron 3.5 Lightning thông qua API của NVIDIA
Kết luận
Các câu hỏi thường gặp
Hơn nữa, NVIDIA Nemotron 3.5 Lightning là một mô hình suy luận và hướng dẫn mã nguồn mở được thiết kế chủ yếu cho lớp thực thi của các hệ thống tác nhân.
Các thông số kỹ thuật cốt lõi của mô hình bao gồm:
Thông số kỹ thuậtNemotron 3.5 LightningTổng số tham số30BTham số hoạt động3BKiến trúcHybrid Mamba-2 + MoE + AttentionCửa sổ ngữ cảnhLên đến 1M tokenĐầu vàoVăn bảnĐầu raVăn bảnSuy luậnĐược hỗ trợ và có thể cấu hìnhGọi công cụĐược hỗ trợLượng tử hóaTùy chọn NVFP4, W4A16Điểm kiểm tra độ chính xác đầy đủBF16Giải mã suy đoánMTP, DSpark, DFlashNhiệt độ khuyến nghị1.0Top-p khuyến nghị0.95Giấy phépOpenMDW 1.1Ngày phát hành11/8/2026
Thẻ mô hình NVFP4 chính thức của NVIDIA cũng liệt kê việc triển khai trên một GPU duy nhất (single-GPU deployment) trên DGX Spark GB10 hoặc H100, với sự hỗ trợ trên các phần cứng Blackwell, Hopper và Ampere tùy thuộc vào lượng tử hóa.
Mô hình này chủ yếu được thiết kế cho tiếng Anh và các ngôn ngữ lập trình, trong khi tiếng Tây Ban Nha, tiếng Pháp, tiếng Đức, tiếng Ý và tiếng Nhật cũng được hỗ trợ chính thức.
Điều này quan trọng vì Nemotron 3.5 Lightning không nên được đánh giá đơn thuần là "một mô hình 30B khác".
Tất nhiên, nhiệm vụ dự kiến của nó cụ thể hơn nhiều.
Tại sao NVIDIA xây dựng một mô hình tập trung vào thực thi
Hãy xem xét một tác nhân lập trình (coding agent).
Nó có thể cần hiểu một lỗi và phát triển một kế hoạch trước tiên. Đó là một vấn đề suy luận khó khăn.
Nhưng sau khi kế hoạch tồn tại, tác nhân có thể cần:
Bước đầu tiên có thể cần một mô hình tiên tiến (frontier model).
Còn tất cả các bước khác thì sao?
Có lẽ là không.
NVIDIA lập luận rằng các tác nhân chạy dài (long-running agents) dành một phần đáng kể khối lượng công việc của họ cho chính các hoạt động thực thi khối lượng lớn này, chẳng hạn như gọi công cụ (tool calls), xác thực (validation) và ủy quyền (delegation). Việc sử dụng một mô hình suy luận tiên tiến cho mọi bước thực thi làm tăng cả chi phí và độ trễ.
Tóm lại, Nemotron 3.5 Lightning là câu trả lời của NVIDIA.
Một kiến trúc sản xuất khả thi sẽ trở thành:
Tiếp theo, điều này thay đổi cách chúng ta nên suy nghĩ về việc lựa chọn mô hình.
Thay vì hỏi:
Cuối cùng, mô hình đơn lẻ nào nên cung cấp năng lượng cho tác nhân của tôi?
câu hỏi hữu ích hơn trở thành:
Tương tự, mô hình nào nên xử lý từng loại công việc bên trong tác nhân của tôi?
Đó là ý tưởng kiến trúc đằng sau Lightning.
Tìm hiểu sâu về kiến trúc
Trong khi đó, Nemotron 3.5 Lightning sử dụng một trong những kiến trúc thú vị hơn trong số các mô hình tác nhân nhỏ hơn hiện tại.
NVIDIA mô tả nó là một kiến trúc lai (hybrid):
Mamba-2
+
Mixture-of-Experts (Hỗn hợp chuyên gia)
+
Selective Attention (Chú ý chọn lọc)
+
Multi-Token Prediction (Dự đoán đa token)
Sự kết hợp này quan trọng vì mỗi thành phần giải quyết một vấn đề hiệu quả khác nhau.
1. Mixture-of-Experts: 30B tham số, chỉ 3B hoạt động
Nemotron 3.5 Lightning chứa khoảng 30 tỷ tham số tổng cộng nhưng chỉ kích hoạt khoảng 3 tỷ tham số cho mỗi token.
Trong một mô hình 30B dày đặc (dense 30B model), về cơ bản toàn bộ mạng lưới tham gia.



Nguồn tin: Analytics Vidhya — Tác giả: Harsh Mishra. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.