代理框架與評測
Recuris、エージェントの重みを凍結したままスキル記憶を再帰的に書き換え、35組の長期タスク評価で性能向上
Recurisは、作業状態、スキル選択、失敗の証拠を局所的に更新可能な記憶コンポーネントに分割し、変更のたびにホールドアウトデータで検証する。著者らは、評価が完了した37組のモデル–ベンチマークのペアのうち35組で向上を記録したが、一部の改善は統計的有意性に達しておらず、テストはLLMによるユーザーとジャッジのシミュレーションにも依存している。

Recurisは、エージェントの「自己改善」を、モデルの重みや単一の巨大なプロンプトの外側で実現しようとする試みだ。凍結された下流エージェントに経験記憶(Experience Memory)と作業記憶(Working Memory)を組み合わせる。後者は検証済みのタスク状態を保持し、現在の不足に応じてスキルを選択する。各ステップでは、状態、取得した経験、アクション、観察結果を記録することで、失敗を最終スコアだけで捉えるのではなく、特定の記憶コンポーネントに帰属できるようにする。
改善ループでは、固定されたMeta-Agentが失敗の軌跡を読み取り、関連するスキルカードまたはルーティングコンポーネントだけを変更する。変更候補は、ペアになったホールドアウト証拠に対する決定論的な検証ゲートを通過した場合にのみSkill Memoryへ書き戻される。下流モデル自体はファインチューニングされず、自身による変更の成否をモデル投票で判断することもない。この設計のエンジニアリング上の価値は、記憶パッケージをバージョン管理し、ロールバックし、モデル間で再利用できる点にある。同時に、増え続ける完全なチャット履歴を無差別に検索することも避けられる。
著者らは、τ²-Bench、SkillFlow、Terminal-Bench 2.1を含む4つの設定と10モデルを対象に、各問題を4回試行した`avg@4`を用いて、元のエージェントとRecurisを追加したエージェントを比較した。評価が完了した37組のペアのうち35組で性能が向上した。τ²-Retailでは、GPT-5.6 Solが17.8パーセントポイント、Claude Opus 5が15.6ポイント向上して87.9%に達した。SkillFlowでは、Qwen3.6-27Bと35Bがそれぞれ16.6ポイント、13.5ポイント向上し、最長インタラクション区間では差が最大32.2ポイントに達した。
ただし、これらの数値を、エージェントが無制限に自己改善を続けられるようになった証拠と解釈することはできない。表に示された小幅な改善の一部では信頼区間がゼロを含み、SkillFlowにおけるGraniteは逆に0.3ポイント低下した。Terminal-Benchでは、動的記憶が固定記憶を上回った幅は2.3ポイントにとどまり、著者らも、このサンプルサイズでは統計的に有意ではないと認めている。また、τ²の評価は固定されたLLMユーザーシミュレーターとassertion judgeに依存している。さらに、報告結果の一部を再現するには、サンプル内データを用いて選択したモデルファミリー向けのルーティングオーバーライドを適用する必要がある。今後は、組織をまたぐワークロード、記憶汚染、長期的に累積するコストに加え、検証ゲートが複数ラウンドの進化を経た後も、誤ったスキルの拡散を防げるかを検証する必要がある。