Bỏ qua tới nội dung chính
Quay lại tin tức

NVIDIA Nemotron 3.5 Lightning: Cỗ máy chủ lực cho tác nhân AI

Analytics Vidhya· Harsh Mishra· 14/8/2026general

Các tác nhân AI hoạt động lâu dài thường dành phần lớn thời gian cho việc thực thi các tác vụ thường lệ thay vì suy luận phức tạp. Sau khi lập kế hoạch, chúng có thể thực hiện hàng trăm lệnh gọi công cụ, đọc tệp, xác thực, lệnh và các bước định dạng. Do đó, việc sử dụng một mô hình suy luận tiên tiến cho mọi hành động có thể trở nên chậm và tốn kém một cách không cần thiết. Nemotron 3.5 Lightning của NVIDIA áp dụng một […] Bài viết NVIDIA Nemotron 3.5 Lightning: Cỗ máy làm việc của tác nhân AI xuất hiện đầu tiên trên Analytics Vidhya.

Nemotron 3.5 Lightning: Đánh giá mô hình tác nhân AI nhanh của NVIDIA Hội nghị AI tương lai nhất của Ấn Độ đã trở lại – Lớn hơn, Sắc nét hơn, Táo bạo hơn d : h : m : s Xem chi tiết Các khóa học miễn phí Các khóa học miễn phí Lộ trình học tập Chương trình tăng tốc Chương trình tăng tốc Mới Chương trình GenAI Pinnacle GenAI Pinnacle Plus Người tiên phong AI tác nhân Mới DeepSeek Hội nghị thượng đỉnh DataHack 2025 DHS 2026 Các khóa học miễn phí Đăng nhập Chuyển chế độ Đăng xuất Luyện phỏng vấn Sự nghiệp GenAI Kỹ thuật nhắc lệnh (Prompt Engg) ChatGPT LLM Langchain RAG AI Agents Học máy (Machine Learning) Học sâu (Deep Learning) Công cụ GenAI LLMOps Python NLP SQL Dự án AIML Danh sách đọc Lộ trình học tập phân tích dữ liệu Cách trở thành nhà phân tích dữ liệu vào năm 2025: Lộ trình hoàn chỉnh Lộ trình học tập Tableau Lộ trình học tập Tableau toàn diện vào năm 2025 Lộ trình học tập NLP Lộ trình học tập NLP toàn diện 2025 Lộ trình học tập nhà khoa học dữ liệu Lộ trình học tập để trở thành nhà khoa học dữ liệu vào năm 2025 Lộ trình học tập kỹ sư dữ liệu Lộ trình từng bước để trở thành kỹ sư dữ liệu vào năm 2025 Lộ trình học tập MLOps Lộ trình học tập MLOps toàn diện: Phiên bản 2025 Lộ trình học tập kỹ sư AI Lộ trình để trở thành kỹ sư AI vào năm 2025 Lộ trình học tập thị giác máy tính Lộ trình học tập toàn diện để thành thạo thị giác máy tính vào năm 2025 Lộ trình học tập AI tạo sinh (Generative AI) Lộ trình tốt nhất để học AI tạo sinh vào năm 2025 Lộ trình AI tạo sinh cho doanh nghiệp Lộ trình GenAI cho doanh nghiệp Lộ trình LLM Các mô hình ngôn ngữ lớn được giải mã: Lộ trình dành cho người mới bắt đầu Lộ trình kỹ sư nhắc lệnh (Prompt Engineer) Lộ trình học tập để trở thành chuyên gia kỹ thuật nhắc lệnh Trang chủ AI Agents NVIDIA Nemotron 3.5 Lightning: Công cụ AI Agent chủ lực NVIDIA Nemotron 3.5 Lightning: Công cụ AI Agent chủ lực Harsh Mishra Cập nhật lần cuối: 14/8/2026 8 phút đọc Các tác nhân AI hoạt động lâu dài thường dành phần lớn thời gian cho việc thực thi thường xuyên hơn là suy luận phức tạp. Sau khi lập kế hoạch, chúng có thể thực hiện hàng trăm lệnh gọi công cụ, đọc tệp, xác thực, lệnh và các bước định dạng. Do đó, việc sử dụng một mô hình suy luận tiên tiến cho mọi hành động có thể trở nên chậm và tốn kém một cách không cần thiết. NVIDIA Nemotron 3.5 Lightning áp dụng một cách tiếp cận khác: một mô hình nhanh, hiệu quả được thiết kế cho việc thực thi tác nhân khối lượng lớn. Ý tưởng rất đơn giản: sử dụng mô hình đắt tiền để suy nghĩ và mô hình nhanh để làm việc. Trong bài viết này, chúng tôi xem xét liệu kiến trúc đó có thể giảm chi phí mà không làm giảm hiệu suất tác nhân hay không. Mục lục NVIDIA Nemotron 3.5 Lightning là gì? Tại sao NVIDIA xây dựng một mô hình tập trung vào thực thi Tìm hiểu sâu về kiến trúc Tại sao Nemotron 3.5 Lightning lại nhanh đến vậy? Kết quả điểm chuẩn của NVIDIA Nemotron 3.5 Lightning Giá của Nemotron 3.5 Lightning Cách truy cập NVIDIA Nemotron 3.5 Lightning Thực hành: Sử dụng Nemotron 3.5 Lightning thông qua API của NVIDIA Kết luận Các câu hỏi thường gặp Hơn nữa, NVIDIA Nemotron 3.5 Lightning là một mô hình suy luận và hướng dẫn mã nguồn mở được thiết kế chủ yếu cho lớp thực thi của các hệ thống tác nhân. Các thông số kỹ thuật cốt lõi của mô hình bao gồm: Thông số kỹ thuậtNemotron 3.5 LightningTổng số tham số30BTham số hoạt động3BKiến trúcHybrid Mamba-2 + MoE + AttentionCửa sổ ngữ cảnhLên đến 1M tokenĐầu vàoVăn bảnĐầu raVăn bảnSuy luậnĐược hỗ trợ và có thể cấu hìnhGọi công cụĐược hỗ trợLượng tử hóaTùy chọn NVFP4, W4A16Điểm kiểm tra độ chính xác đầy đủBF16Giải mã suy đoánMTP, DSpark, DFlashNhiệt độ khuyến nghị1.0Top-p khuyến nghị0.95Giấy phépOpenMDW 1.1Ngày phát hành11/8/2026 Thẻ mô hình NVFP4 chính thức của NVIDIA cũng liệt kê việc triển khai trên một GPU duy nhất (single-GPU deployment) trên DGX Spark GB10 hoặc H100, với sự hỗ trợ trên các phần cứng Blackwell, Hopper và Ampere tùy thuộc vào lượng tử hóa. Mô hình này chủ yếu được thiết kế cho tiếng Anh và các ngôn ngữ lập trình, trong khi tiếng Tây Ban Nha, tiếng Pháp, tiếng Đức, tiếng Ý và tiếng Nhật cũng được hỗ trợ chính thức. Điều này quan trọng vì Nemotron 3.5 Lightning không nên được đánh giá đơn thuần là "một mô hình 30B khác". Tất nhiên, nhiệm vụ dự kiến của nó cụ thể hơn nhiều. Tại sao NVIDIA xây dựng một mô hình tập trung vào thực thi Hãy xem xét một tác nhân lập trình (coding agent). Nó có thể cần hiểu một lỗi và phát triển một kế hoạch trước tiên. Đó là một vấn đề suy luận khó khăn. Nhưng sau khi kế hoạch tồn tại, tác nhân có thể cần: Bước đầu tiên có thể cần một mô hình tiên tiến (frontier model). Còn tất cả các bước khác thì sao? Có lẽ là không. NVIDIA lập luận rằng các tác nhân chạy dài (long-running agents) dành một phần đáng kể khối lượng công việc của họ cho chính các hoạt động thực thi khối lượng lớn này, chẳng hạn như gọi công cụ (tool calls), xác thực (validation) và ủy quyền (delegation). Việc sử dụng một mô hình suy luận tiên tiến cho mọi bước thực thi làm tăng cả chi phí và độ trễ. Tóm lại, Nemotron 3.5 Lightning là câu trả lời của NVIDIA. Một kiến trúc sản xuất khả thi sẽ trở thành: Tiếp theo, điều này thay đổi cách chúng ta nên suy nghĩ về việc lựa chọn mô hình. Thay vì hỏi: Cuối cùng, mô hình đơn lẻ nào nên cung cấp năng lượng cho tác nhân của tôi? câu hỏi hữu ích hơn trở thành: Tương tự, mô hình nào nên xử lý từng loại công việc bên trong tác nhân của tôi? Đó là ý tưởng kiến trúc đằng sau Lightning. Tìm hiểu sâu về kiến trúc Trong khi đó, Nemotron 3.5 Lightning sử dụng một trong những kiến trúc thú vị hơn trong số các mô hình tác nhân nhỏ hơn hiện tại. NVIDIA mô tả nó là một kiến trúc lai (hybrid): Mamba-2 + Mixture-of-Experts (Hỗn hợp chuyên gia) + Selective Attention (Chú ý chọn lọc) + Multi-Token Prediction (Dự đoán đa token) Sự kết hợp này quan trọng vì mỗi thành phần giải quyết một vấn đề hiệu quả khác nhau. 1. Mixture-of-Experts: 30B tham số, chỉ 3B hoạt động Nemotron 3.5 Lightning chứa khoảng 30 tỷ tham số tổng cộng nhưng chỉ kích hoạt khoảng 3 tỷ tham số cho mỗi token. Trong một mô hình 30B dày đặc (dense 30B model), về cơ bản toàn bộ mạng lưới tham gia.

Nguồn tin: Analytics Vidhya — Tác giả: Harsh Mishra. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.