返回首頁

AI 系統與 GPU

PTXBench 實測 LLM 直接寫 H100/B200 專用 PTX,沒有模型能穩定追上前沿核心庫

PTXBench 同時檢查生成核心是否正確、指定指令是否真的執行,以及相對 cuBLAS、cuDNN 與 FlashInfer 的速度。結果顯示,會寫出新架構指令不代表能把它轉成有效加速,B200 注意力核心尤其困難。

极客湾Geekerwan · CC BY 3.0 · Image source
zh-Hant

8 月 18 日公開的 [PTXBench 論文](https://arxiv.org/abs/2608.17379)把 LLM 核心生成測試下探至架構專用 PTX,而不只判斷 CUDA 程式能否編譯。測試涵蓋 H100 Hopper、B200 Blackwell 的 GEMM 與注意力工作負載;每條軌跡最多呼叫模型八次,正確核心經過暖機後量測 50 次延遲,並與 cuBLAS 13.1、cuDNN 9.20 或 FlashInfer 0.6.14 比較。

這套評測特別防範「看似使用新指令」的假陽性。系統先拆解 cubin、搜尋指定 SASS 指令,再以 Nsight Compute 確認它在實際工作負載中確曾執行,因此把只藏在未啟動 dummy kernel 內的指令排除。即使通過此關,也不代表該指令完成有用運算或帶來加速。

四款受測模型均未能跨工作負載穩定匹敵前沿函式庫。Claude Opus 4.8 在 B200 GEMM 達到 cuBLAS 的 1.012 倍,Gemini 3.1 Pro 為 0.892 倍;但在兩項 Blackwell 注意力反向傳播上,Gemini 產生的 CUDA/PTX 核心僅達基線 0.133 與 0.015 倍,同模型改寫 Triton 則為 0.484 與 0.436 倍。Qwen3.6-27B 只產生一個正確的 B200 GEMM 核心,且沒有執行選定的 Blackwell 指令。

作者另以失敗核心、編譯或執行回饋、教師修復結果建立 Fixit 監督資料,再微調 Qwen3.6-27B;部分任務改善,但泛化高度受資料覆蓋、工作負載平衡及推理教師品質影響。[開源環境](https://github.com/zhang677/PTXBench)包含 MiniPTXAgent、隔離評測映像與可稽核軌跡。工程團隊接下來應關注跨 GPU、更多形狀與 race checking 的重現結果;目前八輪搜尋及有限工作負載仍不足以代表生產核心最佳化。

來源

  1. PTXBench: Benchmark and Adapt LLMs for GPU Kernel Optimization with Architecture-specific PTX
  2. PTXBench open-source environment