推論系統/實體 AI
FlashDrive 聯合快取、推測解碼與 W4A8,將 10B 自駕 VLA 延遲壓至 151 毫秒
FlashDrive 同時處理視覺編碼、LLM prefill、推理 token 與軌跡去噪四個瓶頸,在 RTX PRO 6000 上把 Alpamayo 1.5‑10B 單窗口延遲由 717 降至 151 毫秒。開源實作接近即時推論,但仍經過專門微調,閉環測試規模亦只有 100 段模擬片段。

FlashDrive 的重點不是再替 VLA 模型削減單一算子,而是把自駕推論拆成四段後分別最佳化。對連續鏡頭畫面,它沿時間軸保存 KV cache,只為最新影格重新執行視覺編碼與 prefill;對低熵、區塊相關性強的駕駛推理文字,則以非自回歸擴散模型一次草擬八個 token,再交由原模型驗證。最後的軌跡產生器採 flow matching,團隊觀察到速度場在首尾變化較劇烈、中段較平坦,因此只在選定去噪步驟重算 action expert。
系統層再疊加 CUDA Graph、QKV 與 MLP projection 融合,以及 ParoQuant W4A8。VLM 主幹以 INT4 權重、INT8 activation 執行,對數值較敏感的 action expert 保留 BF16,記憶體用量降至約 18.3GB。研究者在單張 RTX PRO 6000、100 段 PhysicalAI‑AV 資料上,將 Alpamayo 1.5‑10B 延遲由 717 毫秒降至 151 毫秒,即由約 1.4Hz 提升至 6.6Hz;六軌跡設定在部分 GPU 的加速更高,但不能與單軌跡數字直接比較。
開迴路 `[email protected]` 由 1.705 改善至 1.573 公尺,六樣本 `minADE6` 則由 0.767 增至 0.844 公尺。AlpaSim 閉環測試中碰撞率與越野率下降,但最大軌跡距離及錯誤車道率反而變差,不能據此宣稱整體更安全。工程上還要注意,串流 KV 重用需要約 60 萬筆樣本微調,草稿模型亦需額外訓練;這不是單純替既有權重換 runtime。程式與衍生 checkpoint 已公開,但 Alpamayo 權重沿用非商業授權,實車延遲、感測器抖動及長時間 cache 漂移仍待驗證。