合成資料與醫療 AI 評測
合成臨床資料通過效用門檻仍可有 79.44% 缺失,兩項修訂卻拉大來源分布差距
Oracle Health 團隊發現,Synthea 衍生的照護缺口基準即使通過既有代理評分,仍可能高度稀疏且模板化。確定性修訂改善可操作資料比例,但與營運參考族群的平均差距由 9.70 擴至 30.69,顯示內部真實感與來源擬真不能合併成單一指標。

醫療 AI 團隊常以合成病歷避開隱私與治理障礙,但「下游代理仍能完成任務」不代表測試資料接近真實臨床環境。Oracle Health and Life Sciences 團隊在 8 月 6 日公開一套效用約束的資料修訂方法,分析由 Synthea 病患、示範電子病歷操作及正式下游管線形成的照護缺口基準。原始資料的病患—措施配對缺失率達 79.44%,只有 12.75% 列具備可供推理的結構化結果,38.94% 病患完全沒有可操作措施;描述文字前三個起始 token 的集中度更達 100%,反映強烈模板化。
研究者沒有另訓練生成模型,而以固定雜湊與規則執行可重播轉換:按措施原有稀疏程度,把部分 `MISSING_DATA` 轉成結構化結果,補回時間、到期日與支持事實,再改寫描述。Refinement-A 把缺失率降至 72.19%、可操作列提高至 20.10%,零可操作病患降至 3.11%;Refinement-B 保留這些數字,並把可產生建議的案例由 45/80 拉回 52/80。相較之下,單純加密資料的對照組雖把缺失率降至 59.40%,文字集中度仍是 100%,說明「資料更多」沒有消除模板偏差。
問題在於改善並非單向。兩項修訂的內部結構更完整,卻使相對營運參考族群的平均絕對差距由 9.70 增至 30.69;Refinement-B 的另一組差距情境測試失敗率也由基線 26.09% 升至 45.45%。因此,工程團隊應把缺失結構、文字多樣性、時序一致性、人口分布、來源擬真與任務效用分開監測。這項研究仍只涵蓋單一照護缺口管線,且下游品質主要由評估器而非人工金標判定,尚不足以證明修訂資料可代表真實病歷。