推論系統
Fast Gemma 驗證版突破每秒 510 token,單張 A10G 靠滑動注意力與 MTP 疊加提速
VIDRAFT 公開 Fast Gemma Challenge 的最高已驗證配置,讓 Gemma 4 E4B 在單張 NVIDIA A10G 達到 510.58 tokens/s,同時把 perplexity 維持在 2.3930。成果來自多項推論最佳化疊加,但測試是單串流、固定硬體與私有提示集,不能直接等同生產吞吐量。

Fast Gemma Challenge 要求參賽者在固定的單張 NVIDIA A10G 上服務 `google/gemma-4-E4B-it`,不得更換模型或關閉功能,且 perplexity 必須低於約 2.42。VIDRAFT 於 8 月 3 日公開完整配置:私有提示重新執行 128 次全部通過,吞吐量為 510.58 tokens/s、PPL 為 2.3930。雖有自報結果達 535.91 tokens/s,但因品質超標而未獲驗證。
這套配置不是單一核心最佳化。它把注意力視窗縮至 188 token,以降低解碼階段讀取 KV cache 的記憶體頻寬;另以七個推測 token 的多 token prediction drafter 加速每個解碼步驟。推論路徑還加入 INT4 權重、裁剪後的 LM head、CUDA graph、融合式 sparse argmax、split-KV 驗證,以及延後反分詞等調整。測試前送入 64 個單 token 合成提示,預先完成 JIT 與 CUDA graph capture,團隊估計可避免約 15 tokens/s 的計時期損失。
工程上值得注意的是,配置關閉了無法在私有重跑重現的 benchmark precache,並公開 `manifest.json`、服務程式與權重 bucket,讓數字比單純排行榜截圖更可稽核。不過,188-token 滑動視窗可能改變長距依賴行為;PPL 門檻也只代表主辦方指定的品質代理指標。下一步應在不同提示長度、並行度與 GPU 上測量 TTFT、尾延遲、顯存及輸出品質,確認這些技巧是否能從單串流競賽移植到實際服務。