Bỏ qua tới nội dung chính
Quay lại tin tức

Trình xác minh cấp hợp đồng cho các nhân GPU do LLM tạo ra

Hacker News LLM· Jimmc414· 14/8/2026general

URL bài viết: https://arxiv.org/abs/2608.12700 URL bình luận: https://news.ycombinator.com/item?id=49301417 Điểm: 21 Bình luận: 0

Khoa học Máy tính > Học máy arXiv:2608.12700 (cs) [Đệ trình ngày 13/8/2026] Tiêu đề: Một trình xác minh cấp hợp đồng cho các nhân GPU do LLM tạo ra, và một thuật toán Blackwell Backward gốc cho họ Gated-Linear-Recurrence Tác giả: Rishi Shah, Rishav Shrestha Xem bản PDF của bài báo có tiêu đề A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family, của Rishi Shah và 1 tác giả khác. Xem PDF HTML (thử nghiệm) Tóm tắt: Các hệ thống tạo nhân GPU (Graphics Processing Unit - Bộ xử lý đồ họa) bằng các mô hình ngôn ngữ lớn (LLM - Large Language Model) báo cáo tỷ lệ chính xác cao. Các tỷ lệ này xuất phát từ một thử nghiệm lỏng lẻo duy nhất: chạy nhân trên một vài đầu vào ngẫu nhiên ở một hình dạng cố định và chấp nhận nếu đầu ra gần với giá trị tham chiếu. Một nhân có thể vượt qua thử nghiệm đó nhưng vẫn sai một cách âm thầm. Nó có thể trả về một số thông thường trong khi câu trả lời đúng là NaN (Not a Number - Không phải số) hoặc vô cùng, khác nhau giữa các lần chạy, bị lỗi khi hình dạng thay đổi, hoặc tích lũy trong fp16 (số dấu phẩy động 16 bit) trong khi tham chiếu giữ tổng fp32 (số dấu phẩy động 32 bit). Chúng tôi xây dựng công cụ kiểm tra tính đúng đắn một cách thích hợp: một trình xác minh cấp hợp đồng gồm mười hai cổng đối nghịch, mỗi cổng là một thuộc tính mà một nhân đúng phải thỏa mãn, một số trong đó không có dung sai, do đó không có lựa chọn ngưỡng nào có thể giải thích cho một lỗi. Hướng ra bên ngoài, trình xác minh kiểm tra 2.638 nhân do máy tạo ra mà hệ thống công khai đã chấp nhận là đúng. Nó phát hiện 39,5% bị lỗi vượt quá mọi lập luận về dung sai và 62,1% có ít nhất một vi phạm. Thử nghiệm tiêu chuẩn của lĩnh vực này chấp nhận 1.487 nhân mà trình xác minh từ chối, trong khi chỉ có 14 trường hợp ngược lại. Chúng tôi bảo vệ phát hiện này bằng bốn cách độc lập: một kiểm soát dương tính 7/7, một lần quét hiệu chuẩn ngưỡng, 98,5% sự đồng thuận với mã kiểm tra tính đúng đắn của điểm chuẩn tham chiếu, và một kiểm toán thủ công phân tầng. Hướng vào bên trong, trình xác minh đánh giá một nhân của riêng chúng tôi: thuật toán Blackwell tcgen05 training backward gốc đầu tiên cho họ gated-linear-recurrence (GDN), bao gồm cả giai đoạn reverse-state mà lĩnh vực này vẫn chạy trên một phương án dự phòng. Chúng tôi thiết lập tính đúng đắn của nó một cách độc lập, dựa trên một oracle độ chính xác kép, và huấn luyện năm thành viên trong họ thông qua nó. Tín hiệu chính xác đằng sau tiến bộ được báo cáo trong việc tạo nhân yếu hơn nhiều so với những con số gợi ý, và một tập hợp các hợp đồng không dung sai sẽ thu hẹp hầu hết khoảng cách này. Bình luận: 17 trang, 3 hình. Cũng được lưu trữ tại doi:https://doi.org/10.5281/zenodo.21563213 Chủ đề: Học máy (cs.LG); Kiến trúc phần cứng (cs.AR); Điện toán phân tán, song song và cụm (cs.DC) Trích dẫn: arXiv:2608.12700 [cs.LG] (hoặc arXiv:2608.12700v1 [cs.LG] cho phiên bản này) https://doi.org/10.48550/arXiv.2608.12700 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) Lịch sử đệ trình Từ: Rishi Shah [xem email] [v1] Thứ Năm, ngày 13/8/2026 01:25:56 UTC (149 KB) Liên kết toàn văn: Truy cập bài báo: Xem bản PDF của bài báo có tiêu đề A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family, của Rishi Shah và 1 tác giả khác. Xem PDF HTML (thử nghiệm) Nguồn TeX xem giấy phép Ngữ cảnh duyệt hiện tại: cs.LG < trước | tiếp > mới | gần đây | 2026-08 Thay đổi để duyệt theo: cs cs.AR cs.DC Tài liệu tham khảo & Trích dẫn NASA ADS Google Scholar Semantic Scholar xuất trích dẫn BibTeX Đang tải... Trích dẫn định dạng BibTeX Dữ liệu được cung cấp bởi: Đánh dấu Công cụ thư mục Công cụ thư mục và trích dẫn Chuyển đổi Trình khám phá thư mục Trình khám phá thư mục (Trình khám phá là gì?) Chuyển đổi Connected Papers Connected Papers (Connected Papers là gì?) Chuyển đổi Litmaps Litmaps (Litmaps là gì?) Chuyển đổi scite.ai Trích dẫn thông minh của scite (Trích dẫn thông minh là gì?) Mã, dữ liệu, phương tiện Mã, dữ liệu và phương tiện liên quan đến bài viết này Chuyển đổi alphaXiv alphaXiv (alphaXiv là gì?) Chuyển đổi Liên kết đến Mã Công cụ tìm mã CatalyzeX cho các bài báo (CatalyzeX là gì?) Chuyển đổi DagsHub DagsHub (DagsHub là gì?) Chuyển đổi GotitPub Gotit.pub (GotitPub là gì?) Chuyển đổi Huggingface Hugging Face (Huggingface là gì?) Chuyển đổi ScienceCast ScienceCast (ScienceCast là gì?) Bản thử nghiệm Bản thử nghiệm Chuyển đổi Replicate Replicate (Replicate là gì?) Chuyển đổi Spaces Hugging Face Spaces (Spaces là gì?) Chuyển đổi Spaces TXYZ.AI (TXYZ.AI là gì?) Các bài báo liên quan Công cụ đề xuất và tìm kiếm Liên kết đến Influence Flower Influence Flower (Influence Flowers là gì?) Chuyển đổi công cụ đề xuất CORE Công cụ đề xuất CORE (CORE là gì?) Chuyển đổi công cụ đề xuất IArxiv Công cụ đề xuất IArxiv (IArxiv là gì?) Tác giả Địa điểm Tổ chức Chủ đề Về arXivLabs arXivLabs: các dự án thử nghiệm với cộng tác viên cộng đồng arXivLabs là một khuôn khổ cho phép các cộng tác viên phát triển và chia sẻ các tính năng arXiv mới trực tiếp trên trang web của chúng tôi. Cả cá nhân và tổ chức làm việc với arXivLabs đều đã chấp nhận và tuân thủ các giá trị của chúng tôi về sự cởi mở, cộng đồng, sự xuất sắc và quyền riêng tư dữ liệu người dùng. arXiv cam kết với những giá trị này và chỉ làm việc với các đối tác tuân thủ chúng. Có ý tưởng cho một dự án sẽ mang lại giá trị cho cộng đồng arXiv? Tìm hiểu thêm về arXivLabs. Những tác giả nào của bài báo này là người xác nhận? | Tắt MathJax (MathJax là gì?)

Nguồn tin: Hacker News LLM — Tác giả: Jimmc414. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.