返回首頁

AI 代理與開發工具

AutoDesign 讓代理改寫自身設計 harness,七組設定的海報評分平均提高 12.4 點

AutoDesign 以外層代理分析執行軌跡、修改生產系統,再由獨立開發集決定是否接納更新。開源 DesignHarness 在作者的 PosterBench 超越多個商用系統,但自動分數與人類偏好的相關係數只有 0.34。

Designer Mario Kleff · CC BY-SA 4.0 · Image source
zh-Hant

AutoDesign 把「改善單次輸出」提升為「改善反覆產生輸出的整套 harness」。內層 Designer 讀取論文、以 HTML 製作可編輯海報,再依規則檢查器及視覺模型評論局部修正;外層 MetaHarnessOptimizer 則彙整多次 rollout 的軌跡與分數,派程式代理修改 context、工具規格、runtime、orchestration 或評估回饋五類元件。每輪只准更動一類元件,候選版本必須提高訓練集成績、同時不降低未向修改代理公開的開發集成績,才會成為下一版本。

團隊稱七天演化過程動用 224 個子代理、完成至少 123 輪遞迴及接納 54 次更新。在固定十篇論文的受控測試中,DesignHarness 接到七組模型與程式代理後,PosterBench 平均分由 54.99 升至 67.39;完整一百篇主榜上,Claude Code/Claude 4.8 組合取得 78.32,較同模型的 Claude Design 高 7.45 點。一次完整生成可包含 253 次工具呼叫與 11 輪編輯,約四十分鐘完成。

這項工作的工程價值不只在自動製作海報,而是示範如何把代理的錯誤軌跡轉成可版本化、可回滾的系統修改,而不必更新模型權重。[程式庫](https://github.com/Yaxin9Luo/AutoDesign)亦公開 DesignHarness 與評測流程。不過,PosterBench 同時使用規則與 VLM 裁判,與盲測人類偏好的相關係數僅 0.34;海報之外的投影片、網頁及影片也仍只是示範。工程團隊下一步應關注 evaluator reward hacking、跨資料分布的開發集設計,以及長期自我修改是否會累積安全缺陷。

來源

  1. AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
  2. AutoDesign open-source repository