評測與可重現性
ERA 回溯疫情預測的 11% 優勢遭重估,資料修訂洩漏可解釋幾乎全部增益
新分析發現,Google ERA 使用季後整併資料回測,實際取得了 CDC 模型預測當時尚不可見的修訂資訊。資料幾乎未修訂時兩者 WIS 相若,顯示 AI 預測基準必須保存每個時間點可用的資料版本。

Johannes Bracher 與 Sebastian Funk 重新分析 Google ERA 在《Nature》發表的 COVID-19 住院預測案例,指出其相對 CDC Forecast Hub 集成模型的 11% Weighted Interval Score(WIS)改善,幾乎可由回溯資料洩漏解釋。問題不在測試標籤直接混入訓練集,而在「資料版本」:CDC 模型於 2024/25 年每週即時提交預測,只能看到當時仍不完整、之後可能大幅修訂的住院數;ERA 的回測則讀取季後整併資料,相當於獲得未來才會出現的訊息。
原研究在美國 52 個州與地區、零至三週預測期上,報告平均 WIS 由 CDC 集成的 29.1 降至 25.9。重分析把 1,430 個州—週組合依最後一個觀測值的修訂幅度分箱:相對修訂不超過 1% 時,ERA 與 CDC 的相對 WIS 為 1.00;絕對修訂不超過 1 時則為 1.01,均沒有實質優勢。相反,修訂超過 25% 的組別相對 WIS 降至 0.69。僅九個修訂最劇烈的案例便貢獻總 WIS 差距的 20%,其中 ERA 與 CDC 的平均 WIS 分別為 88 與 189。
這項結果沒有證明 ERA 的 LLM 加樹搜尋方法無效。作者特別指出,改版後的 Google SAI Ensemble 已在 2025/26 年以真正即時提交方式,於三種疾病的排行榜取得領先;兩項實驗的模型選擇與集成策略也不同。被推翻的是「原回溯結果證明優於同期 CDC 集成」這項歸因。
影響不限於疫情。需求、金融及總體經濟資料同樣會補報、重分類與修訂。建立 AI 預測或自動資料科學基準時,工程師應保存帶時間戳的資料快照、特徵與外部 API 回應,限制模型只能讀取預測截止時間前的版本,並優先採用前瞻式盲測。單純以今日資料重跑過去時間點,可能得到可重現卻不公平的排行榜。