返回首頁

AI 研究

AgenticGenPlan 生成機器人規劃程式,評測階段免呼叫語言模型

研究在 28 類模擬環境測試可重用的控制程式,有傳統規劃器可比較的子集最高達 95% 平均成功率。結果仍限完整可觀測狀態,重現須核對黑箱權限、評測種子與前期合成成本。

Adiel lo · CC BY-SA 3.0 · Image source
zh-Hant

9 月 24 日公開的 AgenticGenPlan 研究,讓程式代理先探索模擬器,再產生可跨問題實例重用的機器人控制程式。作者測試 Claude Code 搭配 Opus 5,以及 Codex 搭配 GPT-5.6 Sol、GPT-6 Astra,涵蓋 28 類環境、980 份程式與 98,000 次評測。程式完成後即凍結,測試階段不再呼叫大型語言模型。[論文](https://arxiv.org/html/2609.30233v1)

這套方法處理任務與運動規劃(TAMP):例如先移開哪個障礙物,必須同時考慮機械手臂能否抵達、是否碰撞。主實驗只提供任務說明、模擬器介面及 Python、NumPy、SciPy;代理在隔離容器內自行設計測試、修正策略,無法讀取環境原始碼。每次合成設定 20 美元模型用量預算,各方法與環境做五次獨立實驗,每份程式再測 100 個保留實例,單例限時 60 秒。[實驗設定](https://agenticgentamp.github.io/)

同一環境的實例可改變物件數量、配置與幾何形狀,但共享狀態、動作及獎勵定義。因此,這裡的泛化主要指適應同類問題的新配置,不能直接解讀成能操作陌生機器人。[任務定義](https://agenticgentamp.github.io/)

在有傳統規劃器的 16 類環境,GPT-6 Astra、Opus 5、GPT-5.6 Sol 的平均成功率分別為 95%、82%、56%,規劃器為 47%。但 Astra 在全部 28 類環境的平均值為 86%;95% 不能當成整套測試成績。從工程角度看,此方法把探索與推理成本集中在策略生成階段,再重用程式處理新配置;論文的執行時間比較未計入前期合成成本。[結果與計時定義](https://arxiv.org/html/2609.30233v1)

限制同樣明確:研究使用完整可觀測的物件狀態,尚未驗證感知誤差下的表現;部分三維動態任務仍難以解決,模型訓練資料不透明也使基準汙染無法完全排除。這份預印本提供的是模擬環境證據,真實機器人的泛化能力仍待測試。[研究限制](https://arxiv.org/html/2609.30233v1)

公開程式碼讓後續查核有了起點,但直接套用預設值未必重現主實驗。倉庫指出,僅設定 `approach=agentic` 仍會開放原始碼存取,必須另啟用嚴格黑箱選項;原評測種子則須向作者索取。工程團隊接下來應固定工具版本、存取權限與評測種子,並分開計算策略生成費用和執行成本,才能判斷增益是否適用自身工作負載。[重現指南](https://github.com/tomsilver/robocode)

來源

  1. Coding Agents for Generalized Task and Motion Planning Problems
  2. AgenticGenTAMP:實驗設定與結果
  3. tomsilver/robocode:官方實作與重現指南