返回首頁

推論系統

PhyAI 統一機器人模型雲端與邊緣推論,四類 VLA 最快加速 4.65 倍

開源推論引擎 PhyAI 以模型轉接器隔離架構差異,讓同一套執行環境涵蓋雲端 rollout、GPU 服務與機載部署。作者測得相對官方實作 1.40 至 4.65 倍加速,但部分專用 runtime 仍然更快。

Stefan Reitzner Xy01 · CC BY-SA 2.0 de · Image source
zh-Hant

機器人團隊通常為訓練 rollout、離線評測、邊緣 GPU 與機載控制維護不同推論程式,即使它們使用相同權重與動作語意。8 月 4 日提交的 PhyAI 嘗試把這些路徑合併成一個 latency-first runtime:模型專屬的條件輸入、求解器、快取及輸出邏輯留在 adapter,圖執行、kernel、記憶體管理和分散式服務則共用。

目前程式庫支援 π0、π0.5、GR00T N1.7、MiniCPM-Robot 等視覺—語言—動作模型,以及 Cosmos3 系列世界—動作模型;可在 Jetson、單張 GPU 或叢集執行,並提供資料平行、張量平行與 classifier-free guidance 平行。專案使用 FlashInfer、Humming 等 kernel,儲存庫亦列出 W4A8、W8A8 與 W8A16 量化路徑,其中部分仍在審查。

作者報告,PhyAI 對四種 VLA 的速度是官方實作的 1.40 至 4.65 倍;Cosmos3-Nano-Policy-DROID 在八張 H20、CFG=2、TP=4 時,延遲由 2.46 秒降至 1.18 秒。剖析結果也指出不能只以 FLOPs 判斷瓶頸:π0.5 的 action expert 在 Hopper、batch 1 僅占 8.8% FLOPs,卻占 57.2% 延遲;提高至 batch 32 後,其延遲占比才降至 13.5%。

這項工作的重要性不只是單點加速,而是減少模型從研究環境移到機器人硬體時的執行差異。團隊提出 control-time Roofline,區分控制迴圈究竟受模型推論或實體環境限制;其 LIBERO 實驗中的 π0.5 已屬環境受限,Cosmos3 則仍受推論限制。工程師接下來應關注量化合併進度、非 NVIDIA 後端、真實機器人的抖動與尾延遲,以及論文數字能否在官方基線以外獨立重現。

來源

  1. PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud
  2. mingti-org/phyai