代理訓練與醫療 AI
BaT、エージェントの失敗段階に応じて強化学習を編成、9B方策のAutoMedBench-Liteスコアが19.9から53.4に向上
Benchmark-as-Teacherは、評価における段階別スコアを次の学習ラウンドのカリキュラムへ直接変換し、隔離された合成データによってテストの正解が更新に混入するのを防ぐ。論文では9B方策が標準的なGRPOを大幅に上回ったと報告しているが、完全な学習データはまだ公開されておらず、システム横断のランキングには異なる実行フレームワークが混在している。

医療研究エージェントは通常、計画、ツール設定、データ検証、推論の実行、成果物の提出を順番に行う必要がある。軌跡全体に対して最終報酬が1つしか与えられない場合、モデルはどの段階を強化すべきか判断しにくい。Benchmark-as-Teacher(BaT)は、この種の構造化評価を学習コントローラーへと変換する。固定されたホールドアウトテストでまず各段階の弱点を測定し、外側のBiCuRLカリキュラムが次のラウンドの目標を選択する。内側ではGRPOによって方策を更新し、候補checkpointは再評価に合格した場合にのみ保持される。
学習データは非同期のStage Bankから供給される。チームはrubricに基づいて採点可能な候補状態を20,299件作成し、弱点を対象とするS-target、その他の段階を扱うS-mix、完全なワークフローを実行するエージェント向けのE2Eに分類した。タスクID、正解、パス、レポート、元の軌跡が評価境界を越えることは禁止されている。各ラウンドではデータ混合、報酬バージョン、checkpointも記録され、性能が低下した場合にロールバックできる。これは単にrolloutを増やすよりも、ソフトウェアワークフローの欠陥に合わせてカリキュラムを編成する手法に近い。
7種類のAutoMedBench-Liteタスクをそれぞれ10回再実行する設定では、Qwen3.5-4BのOverallスコアが6.1から22.9へ、9Bは19.9から53.4へ向上した。同じ9Bモデルに最終報酬のみを用いたGRPOのスコアは31.9だった。完全版のBaT-9B Agentは、固定されたOpenHands環境と組み合わせることで79.6を記録した。ただし、この数値はシステムレベルの比較であり、エージェント基盤を伴わない方策単体のスコアと直接置き換えて比較することはできない。
現在、エンジニアはMIT Licenseのコード、VeRL/Slimeによる学習、vLLM/SGLangの推論インターフェースを確認できる。ただし、リポジトリは作成されたばかりで、完全な学習データ、合成プロンプト、leakage checkerは依然として今後公開予定とされている。また、論文で比較されたモデルは異なるエージェントラッパーを使用している。次に注目すべき点は、データを完全に再構築できるか、同一の計算予算に固定したablationでも改善幅が維持されるか、そして評価で判明した弱点を対象に反復学習することで、徐々にscorerへ過剰適合しないかである。