AI 安全與評測
DFOT 量化 LLM 對衍生感測值的過度信任,跨模態蒸餾讓修正率提高最多 6.69 點
新框架把「模型誤信衍生數值」拆成衝突接受、情境誤導、錯誤修復與效用損害等指標。以 PPG 心律判讀為案例,訓練時借用 ECG、部署時只需 PPG 的可靠度模型改善四項端點,但資料與權重未隨程式碼公開。

研究團隊提出 derived-feature over-trust(DFOT),處理一個常被 RAG 與代理管線忽略的問題:上游模型算出的心率、風險分數或分類標籤,進入 LLM 提示後往往看起來與直接觀測事實相同,模型因而不會考慮其適用範圍與個別案例可靠度。
實驗以同步 PPG 與 Lead-II ECG 為例。D1 刻意讓 PPG 衍生的「規則心律」與離線 ECG 衝突,觀察 LLM 是否未經查核便採信;D2 則讓兩種訊號都支持規則心律,但加入嚴重心房顫動病史,測試模型會否被背景資訊帶偏。框架分別以 COTR、CIR、CRR、ESRM 與 UHR 衡量過度信任、情境錯誤、修正效果、個案證據的特異性,以及不必要查核造成的損害。
團隊從 MIMIC-III 配對波形建立五萬筆四分鐘紀錄,涵蓋 1,275 名病患,訓練、驗證與 187 人鎖定測試集互不重疊。K2 模型訓練時把 ECG 教師的心律 logits 蒸餾進 PPG 可靠度模型,但部署時 ECG 與教師輸出都不會交給 LLM。相較只用可靠度標籤訓練的 B2,K2 在鎖定測試的 AUROC 增加 0.025;D1、D2 的修正率與證據特異性提高 1.82 至 6.69 個百分點,四項信賴區間均未跨零。
這項工作的價值不只在醫療案例,而是提供一套可套用至 OCR 信心、感測器融合及模型生成特徵的介面評測法。不過 UHR 仍增加 0.67 點,且所謂兩個百分點工程界線並非臨床驗證標準。公開倉庫只有程式、提示與統計流程,缺少病患資料、權重、歷史輸出及部分原始提示;工程團隊應先重現資料治理與校準流程,再考慮把可靠度文字直接加入高風險決策。