ホームへ戻る

醫療 AI 與代理訓練

ResidencyRL、最長60ターンの模擬問診で臨床エージェントを訓練――敵対的ケースの診断率が88%に向上

Googleのチームは、模擬患者、文書作成ツール、多次元の臨床報酬を組み合わせ、Gemini 3.5 Flashにマルチターン強化学習を実施した。モデルは敵対的な問診で危険な兆候の見落としを減らしたが、訓練システムはオープンソース化されておらず、実患者を対象とする前向き検証も完了していない。

Leonora (Ellie) Enking from East Preston, United Kingdom · CC BY-SA 2.0 · Image source
zh-Hant

静的な医学QAが主に知識を測るのに対し、モデルがいつ追加質問を続け、検査を手配し、鑑別診断を変更し、問診を終了すべきかを理解しているかまでは検証できない。ResidencyRLは、臨床推論を長期系列の意思決定問題として再構成する。Gemini 3.5 Flashを方策モデルとし、各訓練軌跡には最大60ターンの対話と8回の構造化されたツール操作が含まれる。エージェントは模擬患者と会話しながら、診断、管理計画、診療記録を提出しなければならない。

訓練環境では、まず生成器が5種類の臨床領域、81種類の主訴、さまざまな複雑度を網羅するケースを作成する。さらに、情報を隠す、助言に抵抗する、不適切な治療を要求して圧力をかけるといった敵対的行動が加えられる。Gemini 3.1 Proはケース生成と自動評価に使用された。報酬は診断、管理、問診の網羅性、コミュニケーション、文書品質、スタイルを同時に評価し、病歴の捏造、禁忌となる治療、緊急度の過小評価、レッドフラッグ症状の見落としには追加のペナルティを科す。最終的に、方策はGRPOを用い、同一シナリオから生成された複数のrollout間で相対報酬を比較して訓練される。

保留されていた200件の敵対的シナリオでは、論文によると診断精度がベースモデルの81%から88%に向上し、レッドフラッグ症状の見落とし率は31%低下した。この能力は、AMIE Mxの3回受診形式の120ケース、腫瘍専門ケース、さらにAgentClinicやCRAFT-MDなどの外部環境にも転移した。外部ベンチマークでは、おおむね一貫して改善が見られたものの、すべての指標について統計的有意性が示されたわけではない。AMIE telehealth harnessを使用した別の有効ケース97件では、盲検評価を行った臨床医による比較の87.6%で、ResidencyRLによる訓練後のバージョンが選好された。

この研究の重要性は、医療モデルの最適化単位を「単一の回答」から問診プロセス全体へと進めた点にある。ただし、エビデンスは依然としてシミュレーション環境に限られている。患者と評価器はいずれもLLMで駆動されており、共通の盲点を持つ可能性がある。一部の評価では、同一ファミリーのモデルが判定役も務めている。Googleによると、特定の実装は社内インフラに依存しており、医療安全上の理由からコードは公開されない。このため、現時点では訓練を独立して再現できない。エンジニアリングおよび研究チームが次に注目すべき課題は、実際のワークフローにおける前向き試験、モデル間の評価キャリブレーション、そしてシミュレーション報酬が新たな臨床的specification gamingを誘発しないかどうかである。

出典

  1. ResidencyRL: Reinforcement Learning in Simulated Clinical Environments
  2. Gemini 3.5 Flash model documentation
  3. AgentClinic: Agent benchmark for medical diagnosis