返回首頁

自動駕駛/多模態模型

XCoT-VLA 用 2 至 6 個動作 token 壓縮自駕推理,H100 介面延遲最低 38.6 毫秒

小鵬提出 XCoT-VLA,以有限的語意動作 token 取代數十個自然語言推理 token,再透過 flow matching 生成連續軌跡。開迴路測試顯示橫向誤差下降,但尚無封閉迴路安全評估,延遲數字亦未涵蓋完整車載軟硬體堆疊。

Mintzeqlaz 0519 · CC BY-SA 4.0 · Image source
zh-Hant

小鵬研究團隊公開 XCoT-VLA,試圖解決視覺—語言—動作模型的一個工程矛盾:自然語言推理可表達場景與因果關係,逐 token 解碼卻難以塞進即時規劃週期。新方法把理由壓成 `LEFT_TURN_PREPARE`、`DECELERATE`、`RED_LIGHT_HOLD` 等 2 至 6 個有限詞彙 token,讓它們保留在注意力上下文中,直接條件化固定的軌跡 query。

架構共用多模態 self-attention,但以確定性路由把推理 token 送進 Reason FFN、軌跡 query 送進 Control FFN,避免推理微調破壞控制表徵。控制端不是輸出離散駕駛指令,而是利用 conditional flow matching 預測未來 24 步的縱向加速度與偏航變化,再積分成六秒軌跡。訓練資料共 362 萬筆,包括 310 萬筆自動標記行車紀錄、20 萬筆人工標註及 32 萬筆定向挖掘的變換車道案例。

一般分布測試中,縱向 ADE 由 1.645 公尺降至 1.323 公尺;變換車道消融實驗則把橫向 FDE 從 1.616 降至 1.112 公尺,其中單獨加入 XCoT 已帶來 25.1% 降幅。作者以 H100 測得 3.25 毫秒 inter-token latency;在 2K 至 6K 輸入下,XCoT 推理介面估計需 38.6 至 66.3 毫秒,低於 12 Hz 規劃的 83.3 毫秒預算,而 80-token 文字 CoT 需 279.1 至 306.8 毫秒。

這些數字不能直接解讀成量產車安全或端到端延遲。測試只有開迴路軌跡誤差,延遲排除了感知前處理、軌跡後處理與排程;論文提出的 XCPO 強化學習階段也未量化。模型、資料與程式尚未公開,且長期縱向誤差仍略差於純軌跡基線。下一步應觀察真實車載晶片上的完整延遲,以及碰撞、接管、違規、舒適度和路線完成率等封閉迴路結果。

來源

  1. XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving
  2. 2026 款小鵬 G7:第二代 VLA 與車端算力資料