代理評測與可靠性
TRACE、成功・失敗の軌跡からエージェントのSkillsを書き換え、隠しテストでの一貫成功率を70%に向上
小米(Xiaomi)のチームが提案したTRACEは、成功/失敗軌跡の対比結果を用いて検索可能なSkill Bankを反復的に改善し、基盤モデルの重みは変更しない。CAR-benchの隠しテストセットでは3回すべて成功する割合を高めた一方、平均token数、コスト、レイテンシーも増加した。

8月24日に公開されたTRACE(Trajectory-Contrastive Evolution)は、エージェントの信頼性という課題を「モデルの再学習」から「行動知識の反復的な改善」へと転換する。まずエージェントにCAR-benchのマルチターンタスクを実行させ、実際に呼び出されたSkillごとに軌跡をグループ化する。次に成功例と失敗例を比較し、各ツールのルール、明確化戦略、能力の境界を書き換えることで、検索可能なSkill Bankを構築する。デプロイ時には、Actorが各ターンの対話と環境状態に応じてSkillを選び直す。開始時にルール一式をまとめてコンテキストへ投入する方式ではない。
CAR-benchは車載アシスタントをシミュレートするベンチマークで、相互に関連する58種類のツールと19件のドメインポリシーを含む。特に、必要なツールが存在しない場合に成功したと捏造しないか、曖昧な要求に対して先に確認や明確化を行うかを検証する。評価には、3回のうち少なくとも1回成功すればよいPass@3に加え、同じ問題に3回すべて合格することを求めるPass^3も使用する。後者は、本番システムで求められる安定性により近い指標だ。
著者らがトレーニングセットと公開テストセットを統合して行った実験では、GPT-5.5のPass^3が59.9%から94.5%へ、GLM-5.2では62.8%から84.8%へ向上した。Skill BankはGPT-5.5の軌跡のみを用いて進化させたものだが、GLM-5.2へ適用した場合にも改善が見られた。これは、テキスト化された行動ルールがモデル間で転移できる可能性を示している。最も大きく改善したのは曖昧性解消タスクで、両モデルはそれぞれ55.3ポイント、35.7ポイント向上した。
より参考になるのは、30問を各3回実行する公式の隠しテストセットの結果だ。同じGPT-5.6-Solバックボーンを使用した場合、TRACEによってPass^3は50%から70%へ向上した。一方、1試行当たりの平均token数は82,179から141,684へ、推定コストは0.17米ドルから0.27米ドルへ増加し、レイテンシーの中央値も22%増えた。また、公開データセットはSkillの進化と評価の両方に使用されているため、94.5%という結果を純粋な未知データへの汎化性能と見なすべきではない。隠しテストセットのサンプル数も少ない。今後は、より多くのツールドメインで転移能力を検証するとともに、Skill進化用プログラムと完全な軌跡を公開し、性能向上がCAR-benchのルールに対する人手または自動処理による過剰適合ではないことを確認する必要がある。