AI 研究與代理訓練
TRACE、隠れた介入から検証可能な報酬を合成し、35Bエージェントにデータ異常の追跡を学習させる
TRACEは既知の障害をシミュレーターに注入し、エージェントにPythonとSQLを使わせて、ノイズや交絡因子を含む観測データから根本原因を逆推定させる。SFTと強化学習を施したQwen3.5-35B-A3Bは、ホールドアウトテストセットにおいて、論文で評価されたプロンプトベースのフロンティアモデルを上回った。ただし、成果は依然として単一の合成広告環境に限られる。

数学やコードは、答えを計算機やテストスイートで低コストに判定できるため、検証可能な報酬による強化学習(RLVR)に適している。一方、運用上の異常診断には通常、即時かつ曖昧さのない正解ラベルが存在しない。TRACEはデータ生成プロセスを逆転させる。まず隠れた介入をサンプリングして制御されたシミュレーターに注入し、その後、エージェントが観測できるデータを生成する。介入自体が根本原因のラベルとなるため、客観的な報酬を与えられる。それでもエージェントは、ノイズや交絡因子、複数のテーブルに分散した証拠に対処しなければならない。
研究チームはこの手法を、12種類の根本原因を扱うデジタル広告診断環境として実装した。エージェントはPythonとSQLを呼び出すことができ、障害の種類を特定するだけでなく、該当する場合には影響を受けたオーディエンスセグメントも突き止める必要がある。235件のホールドアウト事例をFullAttr@1で評価したところ、プロンプトベースのClaude Opus 5は0.686を記録した。Qwen3.5-35B-A3Bのベースモデルはわずか0.159だったが、教師ありファインチューニング(SFT)後には0.637へ向上し、さらに合成報酬を用いた強化学習を施すと0.757に達した。論文によれば、学習後のモデルは、同じ35Bベースモデルをプロンプトのみで使用した場合と比べ、ツール呼び出し回数も大幅に少なかった。
技術的な要点は、特定の広告タスクそのものではなく、事後検証が難しい診断問題を「まず原因を作り、その後で原因を隠す」学習環境へ変換した点にある。この手法は、データパイプライン障害、クラウド運用、セキュリティインシデントにも拡張できる可能性がある。ただし、その前提として、シミュレーターが現実世界の因果構造を十分にカバーしていなければならない。現時点の結果は、根本原因が12種類しかない単一の合成環境から得られたものだ。また、未知の障害、シミュレーターでモデル化されていない相互作用、実際の企業データにおける分布シフトにモデルが対応できることも、まだ実証されていない。今後エンジニアリングチームが注目すべき点は、環境ジェネレーターがオープンソース化されるか、報酬がハッキングされ得るか、そして異なるシステムへ移行した際に性能がどの程度低下するかである。