具身 AI 與機器人
Show-Harness 以離散語意動作控制不同機器人,十項任務成功率達 89%
Show-Harness 讓通用 VLM 輸出方向、夾取與釋放等符號,再由各機器人的直譯器轉成受限運動。Gemini 零樣本與微調後的 Qwen 2B 在十項實機任務分別達 89% 與 86%,但測試仍集中於桌面取放。

Show Lab 公開 [Show-Harness](https://arxiv.org/abs/2609.10522),把視覺語言模型與機器人之間的介面縮成一組可讀的離散動作,例如 `MV_LEFT`、`MV_UP`、`GRASP`、`RELEASE` 與 `DONE`。模型每一步根據多視角影像、本體狀態與短期動作歷史選擇一個符號;機器人專屬直譯器再把符號確定性地映射為笛卡兒座標位移、旋轉或夾爪命令。更換 Franka、AgileX 或模擬器時,模型看到的詞彙保持不變,實際步幅及安全高度則留在控制層校準。
這種設計位於高階程式代理與端到端 VLA 之間:VLM 仍逐步決定物理動作,但不必直接回歸高維連續控制量。系統同時提供兩條路徑,一是直接呼叫前沿 VLM 做零樣本控制;二是以 GUMI 圖形介面收集鍵盤或代理示範,再用 LoRA 微調小型開放 VLM。論文以 164 個實機 episode、約 7,800 個決策步訓練,Qwen 3.5 2B 僅更新約 3% 參數;另以 230 個模擬 episode 測試 sim-to-real。
在十項實機取放任務中,Gemini 3.1 Pro 零樣本模式成功率為 89%,微調 Qwen 3.5 2B 為 86%,最佳比較基線為 57%;跨 Franka 與 AgileX 的結果則為 93%、87% 與 52%。[專案頁](https://showlab.github.io/Show-Harness/)也報告,移除多視角提示、子任務規劃或本體感知會分別損失 38、36、28 個百分點,說明成績來自完整 harness,而非動作 token 單一技巧。
[公開程式](https://github.com/showlab/Show-Harness)包含實機與模擬設定、LoRA 服務流程及安全下限,但作者明確要求部署者重新量測自身機械臂的軸向、起始姿勢與高度限制。每項任務通常只有十次試驗,範圍主要是五種物件與兩種容器的桌面取放;更長任務、接觸豐富操作、感測失效及跨實驗室重現,仍是下一步真正的可靠度測試。