生成式視覺與 4D 重建
4DAnyoneがモデルと推論コードを公開、単眼人物動画を最大48の再構成視点へ拡張
固定長の参照コンテキストと、拡散プロセス中の視点再編成により、多視点動画を分割生成する際の構造的ドリフトを抑える。重みと推論パイプラインは公開されたが、4D Gaussian Splattingによる再構成の完全なオープンソース化と低メモリモードはまだ実現していない。

浙江大学、Robbyant、Ant Groupなどの研究チームは、4DAnyoneのApache 2.0ライセンスの推論コードとHugging Face上のモデル資産を公開した。これにより開発者は、キャリブレーションされていない単眼の人物動画から複数の固定視点動画を生成し、それを4D Gaussian Splatting(4DGS)に渡して、自由視点で閲覧可能な動的人物を再構成できる。コードは、6視点のクイックテスト、24視点による全周カバー、さらに3段階の仰俯角を用いた計48視点の構成に対応する。
中心的な課題は、動画拡散Transformerが、再構成に必要な数十の視点を1回のforward passに収められないことだ。視点をグループに分けて個別にdenoisingすると、グループ間で情報を交換できず、人物のプロポーション、衣服、オクルージョン関係にドリフトが生じる。一方、過去に生成したすべての結果を参照として使うと、コンテキストは視点数に応じてO(N)で増加する。4DAnyoneのReference Context Packingは、異なる解像度の参照視点を固定長のコンテキストに圧縮し、この部分の複雑度をO(1)に抑える。Target Context Routingは、高ノイズ段階で各グループの視点をローテーションさせ、グローバルな構造をグループ間に伝播させる。その後、低ノイズ段階では隣接する視点グループを固定し、細部の安定化に集中する。
幾何条件には、単眼推定の誤差に影響されやすいdense depthを使用していない。システムはまずGVHMRで人体の動きを復元し、簡略化した40個の3D骨格キーポイントをz-bufferでターゲット視点にレンダリングすることで、手足の前後関係とオクルージョンを保持する。顔や指の細部は、入力動画と生成モデルによって補完される。学習データには、独自構築したMVGameHuman、ライトフィールドスタジオ、in-the-wild動画を組み合わせている。論文では、DNA-RenderingとDyMVHumansにおいて、既存の新規視点動画生成手法および下流の4DGS手法を上回る結果を報告しているが、現時点では主に著者による評価に基づく。
現状では再現のハードルも低くない。入力には少なくとも720p、121フレーム、縦長画面の単一人物動画で、カメラの動きがわずかなものが推奨されている。32GB未満のメモリでの推論、TensorRT/sparse attentionによる高速化、4DGS再構成の完全なオープンソース化は、いずれもToDoリストに残っている。今回のリリースは、現段階では「多視点観測の生成」部分を評価する用途に最も適しており、任意のスマートフォン動画から完全な4Dアセットを生成するワンクリックの本番パイプラインとはまだ見なせない。