推論系統/自動駕駛
FlashDrive 聯合裁剪 VLA 四段推論,Alpamayo 1.5 單卡延遲降至 151 毫秒
FlashDrive 同時重用影片 KV、平行草擬推理 token,並快取流匹配中變化較小的步驟。論文在 RTX PRO 6000 報告 4.7 倍加速且軌跡誤差近乎不變,但仍只是在模擬與單一模型堆疊上的結果。

自動駕駛 Vision-Language-Action 模型的延遲並非集中在單一核心,而是分散於視覺編碼、語言模型 prefill、推理 token 解碼及流匹配動作生成。[FlashDrive](https://arxiv.org/abs/2608.12932) 因此採用演算法與系統共同設計,針對四段分別移除不同形式的重複計算,而非只替換注意力 kernel。
第一項最佳化利用連續多鏡頭輸入的時間重疊。四幀滑動視窗每次通常有三幀不變,系統只編碼新幀,保存 pre-RoPE key,再於位置移動時套用新的旋轉嵌入;配合自訂遮罩,視覺與 prefill 的有效序列長度約減少 75%。由於舊 KV 在不同上下文中計算,直接重用會造成分布偏移,作者凍結 VLM,只微調對誤差更敏感的 action expert 來恢復軌跡準確度。
推理階段則以區塊擴散模型 DFlash 一次草擬整段低熵、格式固定的駕駛推理 token,再交由原模型驗證。動作端觀察到流匹配速度場呈 U 形變化:首尾步驟變化大,中段餘弦相似度超過 0.99,因此只重新計算端點附近步驟,快取中段速度。最後疊加 W4A8 ParoQuant、CUDA Graph 與 QKV、MLP kernel fusion。
完整論文在 RTX PRO 6000 上把 Alpamayo 1.5-10B 延遲由 717 毫秒降至 151 毫秒,即由 1.4 Hz 提高至 6.6 Hz;[email protected] 只變動 0.08 米。較早的[專案頁](https://z-lab.ai/projects/flashdrive/)則報告 159 毫秒,顯示公開數字仍隨版本或測試設定調整。更重要的限制是程式與權重尚未公開,閉環結果來自模擬環境;6.6 Hz 亦不能單獨證明符合真車控制、安全冗餘或最壞情況延遲要求。工程團隊下一步應關注可重現實作、長序列快取漂移,以及在 Jetson Thor 上的功耗與尾端延遲。