AI 評測/醫療代理
PatientAgentBench 以 1,200 場工具對話測試醫療代理,最強模型分流通過率仍僅 88%
Amazon Science 公開 PatientAgentBench,讓醫療代理在合成病歷與具狀態工具中完成多輪基層照護任務。十款模型的最大落差出現在分流判斷,顯示答對醫學題目並不足以證明代理能安全執行工作流。

Amazon Science 研究團隊於 7 月 28 日發布 PatientAgentBench,試圖補上醫療模型評測從靜態問答走向代理工作流後的缺口。框架不是要求模型回答單一醫學題,而是把基礎模型包裝成 LangGraph ReAct 代理,讓它讀取合成病歷,與模擬患者進行多輪對話,並操作預約、處方、遠距診療及個人資料等 15 項具狀態工具。
每段軌跡由多個模型組成的 LLM jury,依臨床安全、工作流正確性、分流品質、臨床助益、任務完成度及對話品質六個面向評分。團隊以執業臨床人員覆核共同樣本,報告 jury 與專家有 79% 至 93% 的相鄰等級一致率;不過這只表示評分大致接近,不能消除自動裁判偏誤。
十款受測模型在 1,200 個情境上的差距主要來自分流。最弱模型的分流通過率為 32%,最強配置也只有 88%;常見錯誤包括尚未完成臨床篩查便執行行政要求、相信未驗證的工具輸出,以及緊急情境漏掉危機資源。論文報告前沿模型在臨床安全與工作流正確性上仍有約 1% 至 3% 的失敗案例,最高總分為 4.25/5。
程式庫已公開,能從可設定的 seed distribution 即時生成合成情境,降低固定答案遭記憶的風險,並支援 Bedrock、OpenAI 相容與 Anthropic 相容端點。工程團隊應關注評分模型是否與受測模型同源、合成患者能否涵蓋真實族群與語言差異,以及工具沙箱與實際醫療系統的權限、延遲和失敗語義差距。作者也明確表示,這是研究基準,不是臨床認證或部署許可。