ホームへ戻る

推論系統/實體 AI

FlashDrive、キャッシュ共有・投機的デコーディング・W4A8により10B自動運転VLAのレイテンシを151ミリ秒に短縮

FlashDriveは、視覚エンコーディング、LLM prefill、推論token、軌跡デノイジングという4つのボトルネックを同時に処理し、RTX PRO 6000上でAlpamayo 1.5-10Bの単一ウィンドウ・レイテンシを717ミリ秒から151ミリ秒に短縮した。オープンソース実装はリアルタイム推論に近づいたが、専用のファインチューニングを経ており、クローズドループ評価も100本のシミュレーションクリップに限られる。

Nrbelex · CC BY-SA 3.0 · Image source
zh-Hant

FlashDriveの要点は、VLAモデルの単一operatorをさらに削減することではなく、自動運転推論を4段階に分解し、それぞれを最適化することにある。連続するカメラ映像では、時間軸に沿ってKV cacheを保持し、最新frameに対してのみ視覚エンコーディングとprefillを再実行する。entropyが低く、ブロック相関の強い運転推論テキストには、非自己回帰型diffusion modelで8個のtokenを一度にドラフト生成し、元のmodelで検証する。最終段の軌跡generatorにはflow matchingを採用。チームはvelocity fieldの変化が序盤と終盤で大きく、中盤では比較的平坦になることを確認し、選択したデノイジングstepでのみaction expertを再計算する。

システム層ではさらに、CUDA Graph、QKVおよびMLP projectionのfusion、ParoQuant W4A8を組み合わせる。VLM backboneはINT4 weightとINT8 activationで実行し、数値精度に敏感なaction expertはBF16のまま維持することで、メモリ使用量を約18.3GBまで削減した。研究チームは単一のRTX PRO 6000とPhysicalAI-AVデータ100本を用い、Alpamayo 1.5-10Bのレイテンシを717ミリ秒から151ミリ秒へ短縮した。処理速度では約1.4Hzから6.6Hzへの向上に相当する。6軌跡設定では一部のGPUでさらに高い高速化率を示したが、単一軌跡の数値とは直接比較できない。

オープンループ評価の`[email protected]`は1.705メートルから1.573メートルへ改善した一方、6サンプルの`minADE6`は0.767メートルから0.844メートルへ悪化した。AlpaSimのクローズドループ評価では衝突率とオフロード率が低下したものの、最大軌跡距離と誤車線率は逆に悪化しており、これだけを根拠に全体的な安全性が向上したとは主張できない。実装面では、streaming KVの再利用に約60万サンプルを使ったファインチューニングが必要で、draft modelにも追加学習が求められる点に注意が必要だ。既存weightのruntimeを単に置き換えるだけではない。コードと派生checkpointは公開済みだが、Alpamayoのweightには引き続き非商用licenseが適用される。実車環境でのレイテンシ、sensor jitter、長時間運用時のcache driftについては、今後の検証が必要だ。

出典

  1. FlashDrive: Flash Vision-Language-Action Inference for Autonomous Driving
  2. FlashDrive 開源實作與預訓練 checkpoint
  3. NVIDIA Alpamayo 1.5‑10B 模型卡