Một phần cuộc thảo luận sôi nổi về Megakernels trong buổi học chuyên sâu về Kỹ thuật suy luận (Inference Engineering Masterclass) của chúng tôi ngày hôm qua:
megakernels đã lỗi thời
Tại sao megakernels lại hữu ích? Bạn mất hai tháng để viết một kernel nhằm tiết kiệm thời gian khởi chạy và khắc phục tình trạng chồng chéo kém giữa các kernel.
Bạn đã có PDL nhưng sau đó mọi người nói rằng nó không hoàn hảo, rằng bạn vẫn có thể đạt được một số lợi ích nhỏ do các CTA (Cooperative Thread Array) bị chậm trễ và do đó – xin lỗi, tôi quên mất, Rubin đã khắc phục điều đó (kernel thứ hai cần 10 CTA và kernel thứ nhất đã hoàn thành bảy và ba đang bị chậm trễ, kernel thứ hai khởi chạy bảy CTA của nó).
Với một khoảng thời gian đủ dài, mọi thứ sẽ cân bằng.
Toàn bộ cuộc thảo luận, dành cho những ai quan tâm:
Ali: Một kernel hợp nhất không thể giúp ích gì. Ví dụ, với tính song song của tensor, một nửa ma trận nằm trên một GPU và nửa còn lại nằm trên một GPU khác. Nếu tôi cần toàn bộ ma trận để thực hiện một phép toán phi tuyến tính ở bước tiếp theo, chẳng hạn như khi tôi thực hiện phép chú ý (attention), tôi cần softmax, hoặc tôi cần thực hiện phép lũy thừa, tôi cần có toàn bộ hàng. Vì vậy, tôi cần biết kết quả một phần từ GPU 2 và kết quả một phần từ GPU 1 để có thể thực hiện softmax ở giai đoạn tiếp theo.
Do đó, tôi phải làm cho chúng giao tiếp với nhau, ngay cả khi tôi có một kernel hợp nhất, vì các tính phi tuyến tính bên trong mỗi kernel. Ngoài ra, với các megakernel, thành thật mà nói, tôi rất bi quan. Đó là một hướng nghiên cứu tốt, và có vẻ như về mặt trực giác, lý thuyết, nó rất hay. Bạn có rất nhiều chi phí khởi tạo từ việc khởi chạy – chỉ một kernel – Vâng, cứ tiếp tục hợp nhất và di chuyển dữ liệu. Cứ hợp nhất mọi thứ lại với nhau.
Nhưng độ phức tạp của kernel rất khó để viết một megakernel được tối ưu hóa cao. Rất khó để làm được điều đó. Và không cần nêu tên bất kỳ công ty nào, nhưng ngay cả các công ty đã làm việc hoặc những người mà tôi đã nói chuyện, những người làm việc tại các công ty đó.
do các mega kernel (siêu nhân) hợp nhất, chúng rất thường không được triển khai trong sản xuất vì TensorRT-LLM và các kernel mô-đun được khởi chạy nhanh hơn do có thể tối ưu hóa từng thành phần riêng lẻ và chúng có thể song song hóa với nhau.
Một trong những trưởng nhóm kỹ thuật tại NVIDIA đã đăng một bài viết trên Twitter với nội dung: "Chúng tôi đang vén màn Rubin, và đây là thông số kỹ thuật." Và tweet thứ ba cho thấy, không đi quá sâu vào kỹ thuật, tôi cần đọc kỹ hơn, nhưng GPU được thiết kế theo cách loại bỏ các mega kernel. Vì vậy, có vẻ như toàn bộ lĩnh vực nghiên cứu đó sẽ không được tiếp tục.
Anh ấy đã trích dẫn (người bạn của chương trình!) Kyle Kranen công bố các trình kích hoạt phụ thuộc - một phần của tắc nghẽn đường ống trước đây đã biện minh cho việc hợp nhất kernel:
Như đã nêu trong chương trình, vẫn còn những hạn chế vật lý chưa được giải đáp, nhưng hoàn toàn hợp lý khi Nvidia đang cập nhật thiết kế Rubin để phù hợp hơn với những công việc phức tạp đang được thực hiện trong nhân hệ điều hành.
Một trong những đồng tác giả của megakernel của Ben Spector, Stuart Sul, hiện đang dẫn dắt nhóm đã phát hành Mixture of Kittens (một tham chiếu đến ThunderKittens được đặt tên rất thú vị của Ben, và là một phần của nhóm Dan Fu), megakernel mã nguồn mở của Cursor hôm nay:
Các kết quả nổi bật rất thuyết phục - tăng 41% tổng số token mỗi giây. Ở quy mô lớn, điều này tương đương với việc tiết kiệm hàng tỷ USD.
Tin tức AI ngày 3/8/2026 - 4/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có Discord nào khác. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo trước đây. Xin nhắc lại, AINews hiện là một phần của Latent Space. Bạn có thể chọn nhận/không nhận email thường xuyên!
Tổng hợp Twitter AI
Các bản phát hành mô hình Frontier: Qwen 3.8-Max, Alpamayo 2 Super, Pokee-Isaac, Maple-Preview và Shieldstral
Tốc độ phát hành của Qwen tiếp tục trên nhiều phương thức: @Alibaba_Qwen đã ra mắt Qwen3.8-Max là "tốt hơn và rẻ hơn", và nhanh chóng đưa nó vào các hệ sinh thái tác nhân thông qua Hermes Agent, Nous Research và ClinePass. Về mặt thị giác, @skalskip92 đã nhấn mạnh hành vi phát hiện có điều kiện hộp của Qwen3.8-Max, báo cáo 60% mAP với một hộp và 80% với nhiều hộp cho các khái niệm khó mô tả; ngăn xếp hình ảnh của Qwen cũng được nâng cấp, với @arena và @Alibaba_Qwen lưu ý Qwen-Image-3.0-Pro đã đạt vị trí thứ 5 trong Text-to-Image Arena.
NVIDIA và Mistral đều tập trung vào chuyên môn hóa có thể triển khai: @JensenHuang đã giới thiệu Alpamayo 2 Super cho lý luận AV với bản phát hành mở sử dụng thương mại.
Nguồn tin: Latent Space. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.