ホームへ戻る

AI 研究

MITのη-learningは極端事例なしで100年に一度の事象を生成するが、災害発生時期の予測器ではない

η-learningは、極値統計による制約を生成モデルに組み込み、希少事象が不足するペアデータから高解像度の極端シナリオを合成する。インフラのストレステストに活用できる一方、災害がいつ発生するかは予測できず、信頼できる外部統計にも依存する。

Adam Cuerden · Public domain · Image source
zh-Hant

MITの研究チームは、生成モデルが最も学習しにくい分布の裾、すなわち希少事象はサンプル数が少ないうえ、取得やシミュレーションにも高いコストがかかるという問題に取り組むExtreme Event Aware(η-)Learningを提案した。この手法では、ペアになった訓練データセットに極端事例が含まれていることを必要としない。代わりに、訓練時に「極端度」を表す観測可能量の分布を加える。これらの統計は、ラベルなしデータやドメイン知識から取得できるため、モデルは通常のサンプルに適合するだけでなく、未観測領域でも指定された裾確率を満たす必要がある。論文では最適輸送を用いてその性質を解析し、合成システムと降雨ダウンスケーリングの実験で検証している。

米国の降雨事例は、特にこの手法と一般的な外挿との違いを示している。研究者らはまず、25年分の時間降雨マップから日最大降雨量の点統計を算出した。一方、空間マッピングの訓練には、極端事象をほとんど含まない最初の6カ月分の低解像度・高解像度ペア画像しか使用しなかった。その後、モデルは生成結果を極値統計で制約し、指定された再現期間において生じ得る降雨の位置、被覆範囲、強度を合成した。防潮堤、電力網、治水容量を検証する必要があるエンジニアリングチームにとって、これは単一のピーク値だけを出力するより有用である。シミュレーターに入力できる完全な空間シナリオを提供するためだ。

ただし、「極端データが不要」ということは、裾に関する情報が一切不要という意味ではない。この実証でも、最大値分布の推定には、より長期間の記録が使用されている。その統計が気候ドリフト、測定バイアス、または誤ったドメイン上の仮定の影響を受ければ、生成されるシナリオにも偏りが生じる。η-learningが生成するのは、指定された頻度と統計的制約を満たす可能性のあるサンプルであり、100年に一度の豪雨がいつ、どこで発生するかを予測するものではない。今後は、地域横断的な検証と非定常気候下での検証、分布の裾におけるキャリブレーション誤差、さらにコードとデータパイプラインによって第三者が完全に再現できるかどうかを注視すべきである。

出典

  1. Generating scenarios for extreme events, without extreme data
  2. Extreme Event Aware (η-) Learning