ホームへ戻る

AI 研究

エージェントの自己修正研究に外部検証を導入、ルール更新に伴うリグレッションのリスクが明らかに

一部の修正ルールが、当初の失敗を改善する一方で、すでに成功していたケースを損なうことが確認された。公開実装は再検証の手段を提供するが、役割分担は論文の記述と異なり、効果とコストはバージョンごとに照合する必要がある。

Copyleft · CC0 · Image source
zh-Hant

9月21日にarXivへ投稿されたエージェントの自己修正に関する研究は、「新しいルールを保持するかどうか」の判断を、エージェント外部の実行環境に委ねた。著者らはAppWorld、Terminal-Bench、τ²-Benchでのテストで、再実行による検証で却下された383件の提案のうち、211件が修正のきっかけとなった失敗を改善する一方、もともと成功していたケースを損なったことを確認した。約55%という割合は、却下された提案だけを分母としており、自己修正全体の失敗率とは解釈できない。[論文](https://arxiv.org/abs/2609.24130)

論文の手法ではモデルの重みを変更せず、新しいルールをまず暫定的に有効化し、失敗ケースと保護対象のケースを使って、長期的に保持するかどうかを決める。16組のペア比較テストでは、すべてで完了スコアが上昇したが、信頼区間がゼロを含まなかったのは2組だけだった。また、同期的な監督により、実行時間は約1.7〜7倍に増加した。「同じルールをそのまま保持する」対照群の実験は完了していないため、検証ゲート単独の効果はまだ定量化できない。さらに、この研究はエージェントが評価器を改ざんできないことを前提としており、敵対的な回避は検証していない。[手法と限界](https://arxiv.org/html/2609.24130v1)

再現にあたっては、実装のバージョンも明確にする必要がある。著者らの所属チームが公開したPandaProbe Harnessでは、現在、独立した修復エージェントが候補ルールを提案する。タスクを実行するエージェントに与えられるのは、読み取り、検索、一覧表示、状態照会という4種類の読み取り専用ツールだけで、ルールを追加したり廃止したりする権限はない。ルールの内容もプロンプトへ自動的に挿入されず、タスクエージェントが自ら取得する必要がある。これは、元のエージェントが修正を記述するという論文の役割分担とは異なるため、現在のメインブランチをそのまま論文の実験構成と見なすことはできない。[プロジェクトの説明](https://github.com/chirpz-ai/pandaprobe-harness/blob/main/README.md)

公開されている実行ガイドでは、インストールするパッケージのバージョンを0.9.0に固定し、各実験のマニフェストにパッケージのバージョンと実効設定を記録する。また、ルールはデータセット全体の実行を通じて蓄積され続け、訓練段階とテスト段階は別途設けていないと説明している。タスクの順序はデータセットと乱数シードによって決まるため、実行順序そのものが再現条件となる。[評価ガイド](https://github.com/chirpz-ai/pandaprobe-harness/blob/main/benchmarks/RUNNING.md)

長期記憶やスキルの自動更新を導入しているチームにとって、この研究は具体的なテストの方向性を示している。修正前に成功していたタスク事例を保存し、新しいルールに回帰テストを実施するというものだ。今後は、論文で使用したパッケージと実験マニフェストを照合したうえで、より多くのタスク順序や保護対象のケースを試す必要がある。完了率に加え、ルールが読み取られたか、検証が完了したか、追加の遅延が実際の業務要件に収まるかも、それぞれ記録する必要がある。

出典

  1. Self-Healing Harness for Runtime Oversight of Agent Self-Modification
  2. 論文全文:方法、實驗與限制
  3. PandaProbe Harness:角色分工與規則驗證
  4. Running PandaBench:套件版本與評測執行指南