AI 研究
RRSI、エージェントの自己書き換えに探索制約を導入、複数のベンチマークで性能向上
変更の規模を制限し、評価結果のばらつきと推論コストに基づいてエージェントフレームワークの変更を選別する研究。公開実装により追試が可能だが、トークン削減幅は比較対象によって異なる。

Google Cloud AI Researchなどのチームは9月21日、RRSIを発表した。エージェントがプロンプト、ツール、制御フローを継続的に書き換えながら、固定されたテスト問題への過学習を抑える方法を研究したものだ。基盤モデルの重みは凍結したまま、変更の生成と選別のプロセスに制約を設け、研究用コードも公開している。[論文](https://arxiv.org/abs/2609.24972)
まず、1回の提案にまとめて含められる変更の数を制限し、進化が進むにつれて変更範囲を狭めることで、改善の要因を特定しやすくする。提案側は過去の仮説と結果を読み取り、進展が停滞すると未探索のコンポーネントへと対象を移す。選別側は、問題名や解答などに依存するベンチマーク固有のロジックをまず排除し、評価結果のばらつきとトークンコストに基づいて候補を絞り込む。同時に、効果を失ったコンポーネントを削除対象としてマークする。[手法の説明](https://regularized-rsi.com/)
公開実装では、候補となる各フレームワークを独立したGit worktreeに配置し、変更差分、スコア、コスト、採否を記録する。ターミナルでのプログラム開発、文書作業、工学設計には、それぞれ接続用モジュールと初期フレームワークが用意されている。これにより、外部のチームも特定のツールやメモリ設計が残された理由を追跡でき、自分たちのタスクで選別プロセスを再実行できる。[リポジトリ](https://github.com/google-research/rrsi)
主要な実験ではClaude Opus 4.8を使用した。コーディングエージェントは、進化に使用したTerminal-Bench 2.1でスコアが74.2から80.2に上昇した。同じフレームワークを、選別に使用していないSWE-bench Verifiedへそのまま適用すると、82.0から83.8に上昇した。この改善幅の差は、進化に使ったテストセットでの向上を、そのまま汎化性能の向上幅と見なせないことを示している。[公開結果](https://github.com/google-research/rrsi)
コストも比較対象によって見方が変わる。業務タスクのアブレーション実験では、RRSIが1回の試行で使用した方策モデルのトークン数は約242万で、制約なしの進化の380万を下回ったが、初期フレームワークの156万は上回った。表2の数値から計算すると、制約なしの進化に比べて約36%の削減となる。要旨では約30%と記されているが、本記事では表の数値を採用し、これを研究開発プロセス全体のコスト削減率には外挿しない。[アブレーション実験の表](https://arxiv.org/html/2609.24972v1)
工学的な意義は、自動変更を監査可能な実験プロセスに組み込み、選別用データ、ホールドアウトテスト、推論コストを分けて観察する点にある。現時点の結果は著者らの評価に基づいており、一部の業務タスクではモデルによる採点にも依存している。固定されたタスク群、探索予算、しきい値の設定も結果を左右する。今後は、異なるツール環境での再現性を検証し、提案、レビュー、繰り返し評価にかかるコストも含めて算出する必要がある。