ホームへ戻る

代理框架與自我改進

OEO、GPT‑5.5にエージェント改善プロセスを自己編成させ、14件の比較で12勝

Open-Ended Optimizationは、目標、データ境界、インタラクション権限、評価を固定する一方、エージェントがどのように証拠を収集し、スキルを修正するかは事前に規定しない。GPT‑5.5をオプティマイザーとして用いた場合、多くの設定でSkillOptやGEPA系のプロセスを上回ったが、中程度およびより弱いモデルでは同様の優位性を維持できなかった。

Jflabourdette · Public domain · Image source
zh-Hant

自己改善型エージェントでは通常、フレームワークがプロセスを事前に規定する。タスクを実行し、失敗トラジェクトリを収集し、リフレクションを行い、スキルまたはプロンプトの修正案を提示したうえで、検証セットによって採用するかを決定する。新たに提案されたOpen-Ended Optimization(OEO)は、外部制約を維持しながら、これらのステップをどう組み合わせるかをオプティマイザーモデルがその場で決定できるようにする。固定される項目には、タスク目標、許可されたインタラクション、リソース予算、データ境界、最終評価が含まれる。一方、モデルはトラジェクトリを分析するタイミング、仮説の検証、永続的アーティファクトの書き換え、探索の終了を自ら判断できる。

研究では、OEOを2つの手続き型手法と比較した。SkillOptは、rollout、リフレクション、制約付きの追加/削除/置換編集、保持用の検証ゲートを用いてMarkdownスキルを訓練する。GEPAは、自然言語によるリフレクション、候補の変異、Pareto選択によってプロンプトを進化させる。8種類のベンチマークとターゲットモデル設定にまたがる14件の直接比較で、GPT‑5.5駆動のOEOは12勝1分けを記録し、残る1件もわずか0.21パーセントポイント差だった。さらに、ターゲットエージェントとのインタラクションに使用したtoken数の中央値は、SkillOptで設定された予算の34.3%にとどまった。単発かつインタラクションなしの書き換えを行う対照群では、これらの改善を説明できなかった。このことは、強力なモデルが事前知識だけでより優れたスキルを書き直した結果ではないことを示している。

この結果は、すべてのエージェント用ラッパーを取り除けることを意味しない。OEOは依然として、モデルが変更できない権限、予算、データ分離、評価器に依存している。開放されているのは最適化戦略であり、安全性の境界ではない。また、実験では明確な能力の閾値も示された。オプティマイザーを中程度のモデルに置き換えると、逆にSkillOptが優位になった。より弱いモデルでは、同じインターフェースを使っても有効な探索を完遂できなかった。言い換えれば、固定されたプロセスは、モデル能力の向上に伴って必須のアルゴリズムから足場へと変わる可能性がある。しかし、検証ゲートとガバナンス層を同じ自己修正ループに委ねることは、依然としてできない。

エンジニアリングチームが次に注目すべき点は2つある。OEOの再実行可能な実装と完全なトラジェクトリが公開されるか、そして異なるベンダーのモデル、ノイズを含む評価器、より長期的なスキル進化においても優位性を維持できるかだ。現時点の証拠は14件の比較に限られ、中核的な優位性もGPT‑5.5に大きく依存している。コード、詳細なコスト内訳、追加の反復実験が公開されるまでは、34.3%というtoken数を一般的なサービスコストの保証ではなく、特定の実験構成における相対使用量として捉えるべきだ。

出典

  1. Rethinking Self-Evolving Agents: Do We Still Need Prescribed Optimization Pipelines?
  2. SkillOpt:Executive Strategy for Self-Evolving Agent Skills
  3. GEPA Documentation