醫療 AI 與代理訓練
ResidencyRL 以最長 60 輪模擬問診訓練臨床代理,對抗案例診斷率升至 88%
Google 團隊讓 Gemini 3.5 Flash 在模擬患者、文件工具與多維臨床獎勵中接受多輪強化學習。模型在對抗問診中減少漏看危險徵兆,但訓練系統未開源,也尚未完成真實患者的前瞻驗證。

靜態醫學問答主要測量知識,卻無法驗證模型是否知道何時繼續追問、安排檢查、改變鑑別診斷或結束問診。ResidencyRL 將臨床推理改寫成長序列決策問題:以 Gemini 3.5 Flash 為政策模型,每條訓練軌跡最多包含 60 輪對話及 8 次結構化工具操作,代理須在與模擬患者交談的同時提交診斷、處置計畫與病歷文件。
訓練環境先由生成器建立涵蓋五類臨床領域、81 種主訴及不同複雜度的案例,再加入會隱瞞資訊、抗拒建議或施壓要求不當治療的對抗行為。Gemini 3.1 Pro 被用於案例生成與自動評分;獎勵同時衡量診斷、處置、問診完整度、溝通、文件品質與風格,並對捏造病史、禁忌治療、低估急迫程度及漏掉紅旗症狀施加額外懲罰。政策最後以 GRPO 從同一情境的多條 rollout 比較相對獎勵。
在 200 個保留的對抗情境中,論文報告診斷準確率由基礎模型的 81% 提高至 88%,漏掉紅旗症狀的比例降低 31%。能力亦被帶到 AMIE Mx 的 120 個三次就診案例、腫瘤專科案例,以及 AgentClinic、CRAFT-MD 等外部環境;外部基準多為一致方向的改善,而非所有指標都附帶顯著性結論。在另一組使用 AMIE telehealth harness 的 97 個有效案例中,盲測臨床醫師有 87.6% 的比較偏好經 ResidencyRL 訓練的版本。
這項工作的重要性在於把醫療模型最佳化單位由「單一答案」推進至完整問診流程,但證據仍停留在模擬環境。患者與評分器同樣由 LLM 驅動,可能共享盲點;部分評測也使用同一家族模型擔任裁判。Google 表示特定實作依賴內部基礎設施,基於醫療安全考量不公開程式,因此目前無法獨立重現訓練。工程與研究團隊下一步應關注真實工作流程的前瞻測試、跨模型評分校準,以及模擬獎勵是否會誘發新的臨床規格鑽漏洞。