Bỏ qua tới nội dung chính
Quay lại tin tức

NVIDIA Nemotron 3.5 Lightning và NeMo Switchyard mang đến AI tác nhân nhanh hơn, thông minh hơn, hiệu quả hơn.

NVIDIA AI Blog· Kari Briski· 11/8/2026models

Khi AI chuyển đổi từ các chatbot sang các tác nhân tự chủ, các mô hình mở đang đáp ứng nhu cầu thị trường về quyền kiểm soát hoàn toàn đối với nơi AI hoạt động cũng như cách thức triển khai và phát triển. Hôm nay, NVIDIA mở rộng dòng mô hình Nemotron 3 với Nemotron 3.5 Lightning, mô hình hiệu quả cao nhất trong phân khúc dành cho các tác vụ AI tác nhân (agentic AI) chạy dài. Bản phát hành này tiếp nối Nemotron 3 Nano và phản ánh cam kết của NVIDIA trong việc liên tục cải thiện các mô hình mở để đạt độ chính xác và tốc độ cao hơn. Được xây dựng cho các tác vụ chuyên biệt trong các hệ thống đa tác nhân lớn hơn, Nemotron 3.5 Lightning là một mô hình hỗn hợp chuyên gia (mixture-of-experts) với 30 tỷ tham số.

Khi AI chuyển dịch từ chatbot sang các tác nhân tự chủ, các mô hình mở đang đáp ứng nhu cầu thị trường về quyền kiểm soát hoàn toàn đối với nơi AI hoạt động cũng như cách thức triển khai và phát triển của nó. Hôm nay, NVIDIA mở rộng dòng mô hình Nemotron 3 với Nemotron 3.5 Lightning, mô hình có hiệu suất cao nhất trong phân khúc dành cho các tác vụ AI tác nhân chạy dài. Bản phát hành này tiếp nối Nemotron 3 Nano và phản ánh cam kết của NVIDIA trong việc liên tục cải thiện các mô hình mở để đạt độ chính xác và tốc độ cao hơn. Được xây dựng cho các tác vụ chuyên biệt trong các hệ thống đa tác nhân lớn hơn, Nemotron 3.5 Lightning, một mô hình hỗn hợp chuyên gia với 30 tỷ tham số, giúp tạo ra các ứng dụng tác nhân thông minh và hiệu quả hơn. Ngoài ra, NVIDIA cũng phát hành NeMo Switchyard, một thư viện mã nguồn mở để định tuyến thông minh bên trong các công cụ tác nhân phổ biến. Các doanh nghiệp có thể sử dụng nó để xây dựng một bộ định tuyến dựa trên nhu cầu cụ thể của mình. Khi được triển khai, NeMo Switchyard có thể định hướng thông minh từng yêu cầu đến mô hình phù hợp và có năng lực nhất cho công việc mà không yêu cầu các nhà phát triển phải viết lại ứng dụng của họ. Cùng với nhau, Nemotron 3.5 Lightning và NeMo Switchyard mang lại khả năng kiểm soát lớn hơn đối với cách thức triển khai AI, nơi nó hoạt động và hiệu quả vận hành của nó – trên các máy tính cá nhân, máy trạm, trung tâm dữ liệu và đám mây. Nemotron 3.5 Lightning mang đến trí tuệ cấp độ tiên tiến trong một mô hình mở nhỏ gọn, có thể tùy chỉnh, được xây dựng cho các quy trình làm việc tác nhân khối lượng lớn. Các tác nhân luôn hoạt động cần một hệ thống mô hình Các hệ thống tác nhân hiện đại – các tác nhân luôn hoạt động – ngày càng vận hành như các hệ thống mô hình, hoặc các tập hợp mô hình, với các mô hình khác nhau chuyên biệt cho các tác vụ khác nhau. Các mô hình mở NVIDIA Nemotron được thiết kế cho kiến trúc này. Một mô hình suy luận tiên tiến như Nemotron 3 Ultra hoặc GPT-5.6 có thể lập kế hoạch và điều phối quy trình làm việc, trong khi các mô hình chuyên biệt nhỏ hơn như Nemotron 3.5 Lightning có thể thực hiện các tác vụ cụ thể như đánh giá mã, sử dụng công cụ, giám sát cảnh báo bảo mật và trả lời các câu hỏi về thanh toán. Cung cấp năng lượng cho các tác vụ chuyên biệt khối lượng lớn với Nemotron 3.5 Lightning NVIDIA Nemotron 3.5 Lightning là một mô hình mở hoàn toàn có thể tùy chỉnh, được xây dựng cho các tác vụ khối lượng lớn, cung cấp năng lượng cho các tác nhân luôn hoạt động. Nó được phát triển với sự đóng góp từ Liên minh Nemotron (Nemotron Coalition), các thành viên đã cung cấp các phương pháp đánh giá, phần mềm suy luận và bộ dữ liệu để giúp phát triển mô hình. Mô hình này mang lại tốc độ đầu ra nhanh hơn tới 4 lần, dẫn đến hoàn thành tác vụ tác nhân nhanh hơn 30% so với các mô hình khác cùng phân khúc. Và vì nó là mã nguồn mở và có thể tùy chỉnh, Nemotron 3.5 Lightning có thể dễ dàng được huấn luyện thêm với NVIDIA NeMo trên dữ liệu miền, công cụ và quy trình làm việc của riêng một tổ chức để cải thiện độ chính xác cho các tác vụ chuyên biệt. Các điểm chuẩn PinchBench cho thấy Nemotron 3.5 Lightning mang lại khả năng hoàn thành tác vụ tác nhân nhanh hơn với độ chính xác cấp độ tiên tiến so với các mô hình khác cùng phân khúc. Các nhà lãnh đạo AI trong nhiều ngành đang tùy chỉnh Nemotron 3.5 Lightning cho khối lượng công việc của họ, bao gồm CrowdStrike cho an ninh mạng, Harvey với Trajectory cho dịch vụ pháp lý và CodeRabbit với Baseten cho đánh giá mã, giúp cải thiện độ chính xác cho các tác vụ tác nhân chuyên biệt theo miền. Ngoài ra, Lila Sciences đang giúp cải thiện khả năng suy luận cho các tác vụ tác nhân trong khoa học vật lý và đời sống, và Fastino Labs đã tùy chỉnh mô hình và đang đạt được độ chính xác hàng đầu cho các khối lượng công việc phát triển phần mềm, tài chính và chăm sóc sức khỏe. Các doanh nghiệp đã tùy chỉnh Nemotron 3.5 Lightning để đạt được độ chính xác hàng đầu cho các tác vụ chuyên biệt trong quy trình làm việc tác nhân (agentic workflows) của họ. Nemotron 3.5 Lightning cũng cung cấp cho các tổ chức quyền kiểm soát về quyền riêng tư và triển khai. Nó có thể chạy trên các hệ thống AI cục bộ — bao gồm NVIDIA RTX PC, NVIDIA DGX Spark, NVIDIA DGX Station và NVIDIA Jetson — nhằm giúp người dùng tối đa hóa các khoản đầu tư cơ sở hạ tầng hiện có, hoặc mở rộng quy mô trên các thiết bị AI biên (edge AI devices), máy trạm NVIDIA RTX PRO, trung tâm dữ liệu và môi trường đám mây cho các trường hợp sử dụng của doanh nghiệp. Ngoài ra, Nemotron 3.5 Lightning có thể chạy cục bộ hoặc tại chỗ cho các tác vụ chuyên biệt, khối lượng lớn yêu cầu phản hồi nhanh. Cũng như mọi lần ra mắt Nemotron, NVIDIA công bố càng nhiều dữ liệu và kỹ thuật huấn luyện càng tốt trong phạm vi cấp phép cho phép, điều này giúp truy xuất nguồn gốc, kiểm toán và huấn luyện các mô hình khác. Cùng với Lightning, NVIDIA đang phát hành Nemotron-RL-Agentic-Terminal-Pivot, một tập dữ liệu học tăng cường tác nhân (agentic reinforcement learning dataset) được sử dụng để hậu huấn luyện (post-train) cho các khả năng tác nhân mã hóa (coding agent capabilities). **Ứng dụng AI hiệu quả hơn với định tuyến mô hình** Một số mô hình phù hợp hơn cho việc mã hóa, một số cho suy luận, một số cho các tác vụ nhẹ và một số được tối ưu hóa để chạy cục bộ nhằm tăng cường quyền riêng tư và hiệu quả. Nếu khách hàng chỉ dựa vào một mô hình mặc định, họ có thể chi tiêu quá mức hoặc giảm chất lượng; nếu họ quản lý định tuyến thủ công, điều này sẽ trở thành công việc tích hợp có thể làm chậm quá trình triển khai. NVIDIA NeMo Switchyard là một thư viện định tuyến mô hình mã nguồn mở dành cho các tác nhân AI. Công nghệ này tự động định tuyến các lời nhắc (prompts) đến mô hình có khả năng và hiệu quả nhất cho mỗi bước của quy trình làm việc tác nhân, dựa trên các nhu cầu cụ thể. Các nhà phát triển ứng dụng tác nhân có thể tinh chỉnh hoặc sửa đổi bộ định tuyến với các thuật toán định tuyến khác nhau để phù hợp với các ưu tiên của họ, chẳng hạn như yêu cầu về chất lượng, độ trễ và chi phí. Trong một hệ thống các mô hình, các doanh nghiệp có thể tạo ra các tác nhân AI mạnh mẽ với tokenomics được cải thiện. Các thử nghiệm nội bộ cho thấy NeMo Switchyard duy trì độ chính xác ở mức tiên tiến trong khi giảm chi phí hoàn thành tác vụ xuống gần một phần ba so với chỉ riêng Opus 4.8. Các thử nghiệm nội bộ của NVIDIA cho thấy NeMo Switchyard duy trì độ chính xác ở mức tiên tiến trong khi giảm chi phí hoàn thành tác vụ xuống gần một phần ba so với chỉ riêng Opus 4.8. NVIDIA đang hợp tác với các đối tác trong toàn bộ hệ sinh thái AI để đưa tính năng định tuyến mô hình thông minh vào các công cụ và nền tảng mà các nhà phát triển đã sử dụng. **Boomi:** Đã đánh giá Switchyard trên năm khả năng định tuyến, đạt độ chính xác định tuyến miền (domain-routing accuracy) 100%, gửi 59% lưu lượng truy cập đến một mô hình đã được tinh chỉnh nhanh hơn 5 lần và giảm độ trễ lượt sau (later-turn latency) 21%. **Cadence:** Cải thiện hiệu quả 9,9% bằng cách sử dụng ChipStack AI Super Agent cho một trường hợp sử dụng xác minh hình thức (formal verification). **Classmethod:** Đang chạy

Nguồn tin: NVIDIA AI Blog — Tác giả: Kari Briski. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.