合成資料與醫療 AI 評測
合成臨床データは有用性の基準を満たしても79.44%が欠損し得る一方、2つの修正でソース分布との差は拡大
Oracle Healthチームは、Synthea由来のケアギャップ・ベンチマークが既存の代理スコアを通過しても、極めて疎でテンプレート化されている可能性があることを明らかにした。決定論的な修正によって実用可能なデータの割合は改善したが、運用参照集団との平均差は9.70から30.69へ拡大し、内部的なリアリズムとソースへの忠実度を単一指標に統合できないことが示された。

医療AIチームは、プライバシーやガバナンス上の障壁を回避するために合成医療記録を利用することが多い。しかし、「下流の代理モデルが依然としてタスクを完遂できる」ことは、テストデータが実際の臨床環境に近いことを意味しない。Oracle Health and Life Sciencesチームは8月6日、有用性制約付きのデータ修正手法を公開し、Syntheaの患者、デモ用電子医療記録の操作、および本番の下流パイプラインから構成されたケアギャップ・ベンチマークを分析した。元データでは患者—指標ペアの欠損率が79.44%に達し、推論に利用できる構造化結果を備えた行はわずか12.75%だった。さらに、患者の38.94%には実用可能な指標がまったくなく、説明文の冒頭3 tokenの集中度は100%に達しており、強いテンプレート化が示された。
研究者らは生成モデルを新たに訓練せず、固定ハッシュとルールによる再現可能な変換を実行した。各指標の元の疎性に応じて、一部の`MISSING_DATA`を構造化結果へ変換し、時刻、期限日、根拠となる事実を補完したうえで、説明文を書き換えた。Refinement-Aでは欠損率が72.19%に低下し、実用可能な行は20.10%へ増加、実用可能な指標がゼロの患者は3.11%へ減少した。Refinement-Bではこれらの数値を維持しつつ、推奨を生成できるケースを45/80から52/80へ回復させた。これに対し、単にデータを高密度化した対照群では欠損率が59.40%まで低下したものの、テキストの集中度は依然として100%だった。この結果は、「データを増やす」だけではテンプレートバイアスを解消できないことを示している。
問題は、改善が一方向ではない点にある。2つの修正によって内部構造はより完全になった一方、運用参照集団に対する平均絶対差は9.70から30.69へ拡大した。また、Refinement-Bでは別の分布差シナリオテストにおける失敗率も、ベースラインの26.09%から45.45%へ上昇した。したがって、エンジニアリングチームは、欠損構造、テキストの多様性、時系列の整合性、人口統計分布、ソースへの忠実度、タスク有用性を個別に監視すべきである。この研究が対象としたのは単一のケアギャップ・パイプラインに限られ、下流の品質も主に人手によるゴールドスタンダードではなく評価器によって判定されている。そのため、修正後のデータが実際の医療記録を代表し得ると証明するには、まだ不十分である。