返回首頁

代理評測

PACE-Bench 讓既有代理設計在物理規則改變後失效,最佳完整設定 Pass@2 僅 35.9%

PACE-Bench 用 144 組可執行物理環境,測試代理能否修正曾經成功、但在摩擦力或材料限制改變後失效的程式設計。實驗顯示反思優於未驗證自我修訂,而長期記憶反會把較強模型綁在早期方案。

Mark Anderson · CC BY-SA 2.0 · Image source
zh-Hant

多數「自我進化代理」評測只問系統能否從經驗改善下一題,執行規則本身通常保持不變。[PACE-Bench 論文](https://arxiv.org/abs/2608.14441)改測更接近部署維護的情境:橋梁、車輛或控制器的目標與 API 不變,但摩擦力、重力、材料強度或力矩限制被修改,令原本通過驗證的 Python 設計必定失敗。代理必須從沙箱回傳的受力、約束差距與失敗時間等診斷訊號找出原因,再重寫機構或控制邏輯。

資料集包含六類物理領域、36 個基礎任務及每題四個逐步加難的目標環境,共形成 144 組 source-to-target 適應案例。每次執行最多可提交 20 個候選方案;參考解答確認目標環境可解,同時驗證來源解答不能直接沿用。評分除了最終通過與否,也保留部分約束完成度,避免只以二元成功掩蓋代理是否接近可行方案。

研究比較 Reflexion、Self-Refine、ACE、ExpeL、Tree of Thoughts、CodeEvolve 及多種測試時訓練方法。完整評測中,Reflexion 搭配 Qwen3-14B 的 Pass@2 最高,但也只有 35.9%;同模型的未增強迴圈為 32.0%。更值得注意的是,ACE、ExpeL 與 ReasoningBank 等記憶方法在較大模型上經常低於基線,軌跡分析顯示先前設計會形成錨點,使代理持續微調錯誤架構。作者即使直接揭露哪些物理參數改變,也沒有突破原有效能上限,暗示瓶頸不是辨識「改了甚麼」,而是重新設計「應該怎麼做」。

[開源倉庫](https://github.com/thunlp/PACE-Bench)提供 Box2D 任務、驗證器、十種方法、OpenAI 相容 API 與本地 vLLM/Transformers 路徑,也加入隔離式 coding-agent 模式,把真實驗證器和憑證留在容器外。不過所有任務仍是作者設計的二維模擬,且主要完整比較使用 Qwen3 4B–14B;GPT-5.5 的 66.7% 結果只涵蓋 24 組 statics 子集,不能與完整榜單直接並列。後續應看其他團隊能否重現結果,以及記憶方法加入淘汰、分支或反事實重建後,能否避免設計固著。

來源

  1. PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments
  2. thunlp/PACE-Bench