返回首頁

機器人與推論最佳化

QuantWAMs 讓世界動作模型以 4-bit 為主運行,目標模組記憶體降至 FP16 的 29%

QuantWAMs 針對同時生成未來畫面與機器人動作的模型,將量化校準改成結構、聯合目標與閉環軌跡三層決策。兩款模型的模擬成功率與 FP16 相差 0.2 至 0.7 個百分點,但速度數據只涵蓋特定運算模組,真機比較也只有每項十次試驗。

Eddie Maloney from North Las Vegas, USA · CC BY-SA 2.0 · Image source
zh-Hant

世界動作模型(World Action Model,WAM)把影片生成器與動作策略放進同一個迭代去噪流程,讓機器人在預測未來畫面的同時產生控制指令。這種設計的困難不只是模型大:每個動作都會改變下一輪輸入,早期量化誤差可能沿閉環軌跡累積,因此以單張影像重建誤差或開環輸出校準的傳統 PTQ,不一定能保住實際任務成功率。

QuantWAMs 將量化決策拆成三部分。首先,它只在座標系相容的模組間合併 activation 統計,並以 smoothing、Hadamard rotation 處理離群通道,少量重要通道保留 BF16。其次,系統從影片與動作的聯合梯度計算 empirical-Fisher 顯著度,以整層而非不穩定的細粒度遮罩,決定哪些線性層由 NVFP4 W4A4 升至 FP8 W8A8。最後,它使用 FP16 模型真正抵達的閉環狀態重播固定干預,重新安排哪些去噪步驟需要較高精度,而不增加整體精度預算。

團隊在 Fast-WAM 與 LingBot-VA 上測試,涵蓋 RoboTwin 2.0、LIBERO,以及 AgiBot G2 真機。以 W4A4 為主的設定在模擬平均成功率僅比 FP16 低 0.2 至 0.7 個百分點;目標影片與動作區塊的權重加 activation 峰值記憶體約為 FP16 的 29%,區塊速度提高 1.4 至 1.6 倍。校準、軌跡分析、排程驗證與最終測試使用彼此分離的資料,降低直接對測試集調參的風險。

不過,這些數字不能解讀成整台機器人快 1.6 倍:量測排除了 embedding、投影、VAE 與其餘控制管線。真機三項任務各只有十次測試,QuantWAMs 平均成功率為 56.7%,FP16 為 63.3%,樣本不足以證明兩者等效。現階段結果較像是可行性證據;接下來應觀察程式與核心是否完整公開、能否移植至非 Blackwell GPU,以及針對一組任務校準後是否仍能泛化到未見操作。

來源

  1. QuantWAMs: Calibrating at the Right Granularity for World Action Models
  2. QuantWAMs 專案頁
  3. RoboTwin 2.0 官方程式庫