世界模型與電腦視覺
World LabsのAtlas、共有空間コンテキストで動画生成と3D再構築を統合
Atlasは、テキスト、画像、カメラ姿勢、深度データを単一の自己回帰型拡散アーキテクチャに統合し、制御されたカメラワークを生成するとともに、点群や3D Gaussian splatを出力できる。ベンダーによる評価では、疎視点再構築で専用モデルを上回ったが、論文や重み、物理シミュレーションの検証はまだ公開されておらず、現時点では早期アクセスに限定されている。

World Labsは、ゼロから事前学習したマルチモーダル自己回帰型拡散Transformer「Atlas」を発表した。Atlasは、テキスト、画像、カメラ姿勢、3D深度マップを共有の「空間コンテキスト」として構成し、動画を画像シーケンスとして扱う。モデルは次の要素を順次生成するため、テキストプロンプトだけからカメラの動きを推測する方式とは異なる。これにより、カメラの位置と向きがネイティブな条件となり、制御可能な動画生成とシーン再構築が単一のアーキテクチャに統合される。
Atlasは、2種類の推論技術も取り入れている。自己回帰部分ではKV cache、キャッシュを考慮したルーティング、分離型サービングを利用できる可能性があり、潜在拡散部分では蒸留、classifier-free guidance、ノイズスケジュール、VAEの改良を適用できる。出力は2D映像だけではない。モデルはフレームごとの深度を推定して点群を生成し、未観測領域を補完したうえで、デバイス上でレンダリング可能な3D Gaussian splatに変換できる。入力画像が少ないほど、結果には生成的な推測が多く含まれる。観測視点を増やせば、実データによってジオメトリを段階的に制約できる。
World Labsによると、Atlasは2、3枚の画像から実用的な再構築を行えるほか、100枚を超える画像も入力できる。同社が独自に再実行した7種類の疎視点再構築ベンチマークでは、平均AbsRel誤差が25.3×10⁻³となり、Pi3Xの28.7×10⁻³やその他の公開ベースラインを下回った。カメラ制御付き生成の比較でも、第三者評価者の多くがAtlasを選好した。ただし、テスト条件は完全に対称ではない。Atlasにはネイティブなカメラ軌道が与えられた一方、他の動画モデルにはカメラワークを記述したテキストプロンプトしか与えられていない。このため、結果が示しているのはインターフェースとモデルの組み合わせによる制御面での優位性であり、総合的な画質ランキングと直接見なすことはできない。
このアーキテクチャは、VFX、ゲームアセット、デジタルツイン、ロボティクスのreal-to-simワークフローに応用できる可能性がある。同じ空間状態を、生成と明示的なジオメトリ出力の両方に利用できるためだ。しかし、今回の発表には技術論文、学習データ、パラメータ数、レイテンシ、価格、再現可能なコードが含まれていない。また、「シミュレーション」についても、物体の永続性、衝突、因果関係、長時間にわたる物理的一貫性のベンチマークではまだ実証されていない。Atlasは現在、一部のパートナーのみに提供されている。次に注目すべき重要な指標は、独立した再構築評価、動的シーンでの失敗率、そしてロボットポリシーの学習を実際に改善できるかどうかだ。