生成模型/推論
UGC、データ依存関係に基づいてマスク拡散のステップ数を配分し、理論上は oracle に近い KL 保証を実現
新たな研究は「unmasking growth complexity」を用いて、離散拡散における情報の難しさが開示段階ごとにどう変化するかを記述し、計算を曲率の高い区間に集中させる。スケジュールはサンプルから推定でき、高確率の KL 証明書も提供するが、大規模な言語モデルや画像モデルではまだ検証されていない。

マスク拡散モデルは、すべてがマスクされた系列から出発し、離散的な位置を繰り返し予測して開示する。実務では通常、uniform、linear、cosine 系などのスケジュールをあらかじめ選択する。しかし、データ分布ごとに依存構造が異なるため、その構造が開示の初期、中盤、あるいは終盤で突如として顕在化する可能性がある。その結果、固定スケジュールでは難易度の異なる領域に同じ計算量を費やしてしまう。MIT の新たな研究は unmasking growth complexity(UGC)を提案し、開示経路上の重み付き情報曲率を用いて、各区間が生じさせる KL 離散化誤差を直接評価する。
著者らは時間を log-reveal-odds、すなわち `log(t/(1-t))` に変換する。この座標系では、UGC 密度が高い領域でステップ幅を小さくし、密度が低い領域は素早く通過する。局所的な UGC は、結合された開示軌跡間の KL 増分から推定できるため、スケジュールの構築に真のデータ分布を事前に知る必要はない。論文ではこれに基づき、単一ブロックおよび複数ブロックの手続きを構築している。仮定が成立する場合、サンプラーは指定された KL 誤差を高確率で達成でき、その反復計算量は UGC の完全な経路を知る oracle の定数倍以内に収まる。細分化の極限では、`∫sqrt(q(λ))dλ` の二乗が最適な Euler 誤差を決定する。構成例では、少数の適応型ブロックにより、粗いスケジュールと比べて次元とともに増大し、漸近的に最大 `Ω̃(√d)` に達する改善が得られることが示されている。
これは「noise schedule のチューニング」をデータ駆動型のリソース配分へと転換する理論的な道筋を示すものであり、適用範囲はテキストに限らず、離散画像、動画、タンパク質生成にも及ぶ。ただし、現時点の成果は主に定理と合成分布の例であり、大規模な MDLM における品質、レイテンシ、推定コストは検証されていない。最も強い証明書では、Bayes denoiser を利用できること、および KL 増分のモーメント制御が可能であることも仮定している。学習ベースの denoiser に置き換えると近似誤差が追加され、最適性も frozen-posterior Euler 系の手続きに限定される。今後は、UGC の推定オーバーヘッドが削減できる denoising pass のコストを下回るか、また MDLM などの公開実装において既存の confidence スケジュールや cosine スケジュールを上回るかを検証する必要がある。