醫療 AI/安全評測
醫療 LLM 在病人答覆前先給自理建議,短指令把出現率由 9/12 降至 0/12
新研究把評測前移至病人尚未清楚描述問題的首次接觸階段。加入「先釐清、後建議」的系統指令改善回應順序與交接摘要,卻仍未可靠問出決定性病史。

一項 8 月 18 日公開的研究指出,醫療 LLM 常在題目已整理成明確臨床問題後才接受測試,因而漏掉真實諮詢的前段難題:病人可能淡化症狀、採用錯誤前提,或根本不知道哪些資料重要。研究者將此稱為「preformulation gap」,並用四個由醫師撰寫的多輪案例,測試模型能否先把模糊陳述整理成可安全處理的問題。
固定腳本實驗涵蓋 OpenAI `chat-latest`、Google `gemini-3.5-flash` 與 Anthropic `claude-sonnet-4-6`,每款模型分別接受基線提示與一段 entry-to-care 系統指令,共產生 24 份逐輪紀錄;其中兩案另以模型扮演標準化病人,產生 12 份適應式對話。新指令要求模型先釐清關切、修正不安全前提、判斷就醫路徑,最後整理可向臨床人員轉述的摘要,但沒有提供個案專屬醫療知識。
結果顯示,基線條件的 12 個「案例—模型」組合中,有 9 個在病人尚未回答任何問題前便給出自我照護或居家處理建議;加入指令後降為零。結構化交接摘要則由 0/12 增至 10/12。這表示提示可以明顯改變資訊蒐集、建議與文件化的次序,而最終診斷正確率無法揭露這類互動差異。
但改善流程不等於解決安全問題。在適應式嘔吐案例中,指令仍未可靠問出糖尿病等決定性資訊;部分回覆還出現過度絕對或警報式措辭。作者亦明確限制結論:四個案例與三款 API 模型只能展示提示敏感的互動標記,不能估計疾病盛行率、比較模型整體安全性或證明臨床效益。工程團隊應把首次回覆次序、關鍵資訊 elicitation、轉介理由及交接品質納入逐輪測試,而非只評最後答案。