返回首頁

推論系統/實體 AI

FlashDrive 聯合快取、推測解碼與 W4A8,將 10B 自駕 VLA 延遲壓至 151 毫秒

FlashDrive 同時處理視覺編碼、LLM prefill、推理 token 與軌跡去噪四個瓶頸,在 RTX PRO 6000 上把 Alpamayo 1.5‑10B 單窗口延遲由 717 降至 151 毫秒。開源實作接近即時推論,但仍經過專門微調,閉環測試規模亦只有 100 段模擬片段。

Nrbelex · CC BY-SA 3.0 · Image source
zh-Hant

FlashDrive 的重點不是再替 VLA 模型削減單一算子,而是把自駕推論拆成四段後分別最佳化。對連續鏡頭畫面,它沿時間軸保存 KV cache,只為最新影格重新執行視覺編碼與 prefill;對低熵、區塊相關性強的駕駛推理文字,則以非自回歸擴散模型一次草擬八個 token,再交由原模型驗證。最後的軌跡產生器採 flow matching,團隊觀察到速度場在首尾變化較劇烈、中段較平坦,因此只在選定去噪步驟重算 action expert。

系統層再疊加 CUDA Graph、QKV 與 MLP projection 融合,以及 ParoQuant W4A8。VLM 主幹以 INT4 權重、INT8 activation 執行,對數值較敏感的 action expert 保留 BF16,記憶體用量降至約 18.3GB。研究者在單張 RTX PRO 6000、100 段 PhysicalAI‑AV 資料上,將 Alpamayo 1.5‑10B 延遲由 717 毫秒降至 151 毫秒,即由約 1.4Hz 提升至 6.6Hz;六軌跡設定在部分 GPU 的加速更高,但不能與單軌跡數字直接比較。

開迴路 `[email protected]` 由 1.705 改善至 1.573 公尺,六樣本 `minADE6` 則由 0.767 增至 0.844 公尺。AlpaSim 閉環測試中碰撞率與越野率下降,但最大軌跡距離及錯誤車道率反而變差,不能據此宣稱整體更安全。工程上還要注意,串流 KV 重用需要約 60 萬筆樣本微調,草稿模型亦需額外訓練;這不是單純替既有權重換 runtime。程式與衍生 checkpoint 已公開,但 Alpamayo 權重沿用非商業授權,實車延遲、感測器抖動及長時間 cache 漂移仍待驗證。

來源

  1. FlashDrive: Flash Vision-Language-Action Inference for Autonomous Driving
  2. FlashDrive 開源實作與預訓練 checkpoint
  3. NVIDIA Alpamayo 1.5‑10B 模型卡