GPT-6 Astra Ultrafast, chạy trên các bộ xử lý đồ họa (GPU) NVIDIA Blackwell, hiện đã có mặt trong giao diện lập trình ứng dụng (API) của OpenAI và dành cho người dùng ChatGPT Work cùng Codex đủ điều kiện.
Được tăng tốc nhờ các tối ưu hóa suy luận thông qua các mô hình của OpenAI, khai thác khả năng của kiến trúc NVIDIA Blackwell, Ultrafast mang lại tốc độ tạo mã thông báo (token) nhanh hơn tới 8 lần so với chế độ Astra Standard. Đối với các nhà phát triển, tốc độ tạo mã nhanh hơn có thể rút ngắn chu trình chỉnh sửa-kiểm thử-gỡ lỗi của các tác nhân lập trình, giảm thời gian tạo phản hồi giữa các lệnh gọi công cụ và làm cho các ứng dụng tương tác trở nên nhạy hơn.
Một phản hồi nhanh hơn có ý nghĩa quan trọng nhất khi nó được tạo lại.
GPT-6 Astra Ultrafast, chạy trên các bộ xử lý đồ họa (GPU) NVIDIA Blackwell, hiện đã có mặt trên giao diện lập trình ứng dụng (API) của OpenAI và dành cho người dùng ChatGPT Work cùng Codex đủ điều kiện.
Được tăng tốc nhờ các tối ưu hóa suy luận thông qua các mô hình của OpenAI, tận dụng khả năng của kiến trúc NVIDIA Blackwell, Ultrafast cung cấp tốc độ tạo token nhanh hơn tới 8 lần so với chế độ Astra Standard. Đối với các nhà phát triển, tốc độ tạo nhanh hơn có thể rút ngắn chu kỳ chỉnh sửa-kiểm tra-gỡ lỗi của các tác nhân viết mã, giảm thời gian tạo phản hồi giữa các lệnh gọi công cụ và làm cho các ứng dụng tương tác trở nên nhạy hơn.
Phản hồi nhanh hơn có ý nghĩa quan trọng nhất khi nó được lặp lại trong một quy trình làm việc: một tác nhân viết mã, sử dụng một công cụ, kiểm tra kết quả và quyết định bước tiếp theo. Ultrafast đưa các khả năng của Astra vào các vòng lặp nhạy cảm về thời gian này. Cơ sở hạ tầng AI của NVIDIA giúp OpenAI cung cấp các đầu ra mô hình hữu ích hơn khi các nhà phát triển cần.
Ông Philippe Tillet, Trưởng nhóm suy luận tại OpenAI, cho biết: "Sự đầu tư sâu rộng của NVIDIA vào công cụ và tài liệu đã giúp chúng tôi làm cho các mô hình của mình đặc biệt tốt trong việc lập trình các GPU Blackwell và Rubin. Astra có thể biến kiến thức đó thành các nhân hiệu suất cao, giúp phần cứng NVIDIA trở nên hấp dẫn trên toàn bộ các khía cạnh về độ trễ, thông lượng và chi phí. Với Astra Ultrafast, điều đó có nghĩa là phản hồi mô hình nhanh hơn khi các tác nhân viết mã, sử dụng công cụ và thực hiện các tác vụ phức tạp."
**Liên tục cải thiện hiệu suất**
Hiệu suất không ngừng tăng lên ngay cả khi một mô hình đã được triển khai. OpenAI đang sử dụng các mô hình của riêng mình để giúp tinh chỉnh phần mềm suy luận chạy trên các GPU NVIDIA, tận dụng khả năng lập trình của nền tảng để kiểm tra và triển khai các cải tiến. Công việc liên tục đó có thể làm cho phản hồi mô hình nhanh hơn và cơ sở hạ tầng được triển khai hiệu quả hơn theo thời gian.
Ông Uday Ruddarraju, Giám đốc Công nghệ điện toán tại OpenAI, nhận định: "Sự hợp tác của chúng tôi với NVIDIA đang giúp chúng tôi làm cho AI nhanh hơn và hữu ích hơn. Chúng tôi đã sử dụng các mô hình nội bộ để tối ưu hóa suy luận trên các GPU NVIDIA, và khả năng lập trình của NVIDIA đã giúp chúng tôi mang lại sự tăng tốc đằng sau Astra Ultrafast."
Nền tảng NVIDIA có khả năng lập trình cho phép các nhà phát triển và nhà nghiên cứu tái sử dụng cơ sở hạ tầng trong quá trình đào tạo, suy luận và học tăng cường khi các mô hình phát triển. Sự linh hoạt đó giúp các nhóm tái sử dụng tài nguyên điện toán khi nhu cầu thay đổi, cải thiện việc sử dụng và tránh phân bổ quá mức cho từng khối lượng công việc.
Các nhà phát triển có thể sử dụng GPT-6 Astra Ultrafast thông qua API ngay hôm nay. Vui lòng tham khảo hướng dẫn Ultrafast để biết chi tiết về quyền truy cập, giá cả và triển khai.
Nguồn tin: NVIDIA AI Blog — Tác giả: Dion Harris. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.