返回首頁

代理框架與自我改進

OEO 讓 GPT‑5.5 自行編排代理改進流程,14 組比較取得 12 勝

Open-Ended Optimization 固定目標、資料邊界、互動權限與評測,但不預先規定代理應如何蒐證及修改技能。GPT‑5.5 擔任優化器時多數設定勝過 SkillOpt 與 GEPA 類流程,但中等與較弱模型無法維持同樣優勢。

Jflabourdette · Public domain · Image source
zh-Hant

自我改進代理通常由框架預先指定流程:執行任務、蒐集失敗軌跡、反思、提出技能或提示修改,再由驗證集決定是否接受。新提出的 Open-Ended Optimization(OEO)保留外部約束,卻把這些步驟的組合方式交給優化器模型即時決定。固定項目包括任務目標、允許的互動、資源預算、資料邊界及最終評測;模型則可自行決定何時分析軌跡、測試假設、改寫持久產物或停止搜尋。

研究將 OEO 與兩種處方式方法比較。SkillOpt 以 rollout、反思、受限的新增/刪除/替換編輯及保留驗證閘門訓練 Markdown 技能;GEPA 則利用自然語言反思、候選變異與 Pareto 選擇演化提示。跨八種基準與目標模型設定的 14 組正面比較中,由 GPT‑5.5 驅動的 OEO 得到 12 勝、1 和與 1 次僅落後 0.21 個百分點,且目標代理互動 token 的中位用量只有 SkillOpt 設定預算的 34.3%。一次性、零互動改寫控制組未能解釋這些增益,顯示效果不只是強模型憑先驗重寫一份較好的技能。

這項結果並不等於可以移除所有代理外殼。OEO 仍依賴不可由模型更改的權限、預算、資料隔離與評分器;開放的是優化策略,而不是安全邊界。實驗也呈現明顯能力門檻:換成中等優化器後,SkillOpt 反而勝出;較弱模型甚至無法透過相同介面完成有效搜尋。換言之,固定流程可能隨模型能力提高而由必要演算法轉為鷹架,但驗證閘門與治理層仍不能交給同一個自我修改迴圈。

工程團隊接下來應關注兩件事:OEO 是否會公開可重跑的實作與完整軌跡,以及優勢能否在不同供應商模型、噪聲評分器和較長期的技能演化中維持。目前證據只有 14 組比較,核心優勢又高度依賴 GPT‑5.5;在沒有公開程式、成本明細與更多重複試驗前,34.3% 的 token 數字應視為特定實驗配置下的相對用量,而非通用服務成本承諾。

來源

  1. Rethinking Self-Evolving Agents: Do We Still Need Prescribed Optimization Pipelines?
  2. SkillOpt:Executive Strategy for Self-Evolving Agent Skills
  3. GEPA Documentation