生成式視覺與 4D 重建
4DAnyone 開放模型與推論程式碼,將單鏡頭人物影片擴成最多 48 個重建視角
系統以固定長度參考上下文及擴散期間的視角重組,減少分批生成多視角影片時的結構漂移。權重與推論流程已公開,但完整開源 4D Gaussian Splatting 重建和低記憶體模式仍未完成。

浙江大學、Robbyant、螞蟻集團等團隊公開 4DAnyone 的 Apache 2.0 推論程式碼與 Hugging Face 模型資產,讓開發者可由一段未校準的單鏡頭人物影片生成多個固定視角影片,再交給 4D Gaussian Splatting(4DGS)重建可自由觀看的動態人物。程式支援 6 視角快速測試、24 視角全周覆蓋,以及三層俯仰角、共 48 視角的配置。
核心問題是視訊擴散 Transformer 無法在單次前向傳播中容納重建所需的數十個視角。若把視角分組獨立去噪,各組不能交換資訊,人物比例、服裝及遮擋關係便會漂移;若把所有先前生成結果都當參考,上下文又會隨視角數以 O(N) 增長。4DAnyone 的 Reference Context Packing 將不同解析度的參考視角壓進固定長度上下文,把這部分複雜度降至 O(1)。Target Context Routing 則在高雜訊階段輪換每組視角,使全域結構跨組傳播;低雜訊階段再固定相鄰視角組,集中穩定細節。
幾何條件沒有使用容易受單鏡頭誤差影響的稠密深度。系統先以 GVHMR 恢復人體運動,再把精簡的 40 個三維骨架關鍵點以 z-buffer 渲染到目標視角,保留肢體前後遮擋;臉部與手指細節則交由來源影片及生成模型補足。訓練資料結合自建 MVGameHuman、光場攝影棚與野外影片,論文在 DNA-Rendering、DyMVHumans 上報告優於既有新視角影片與下游 4DGS 方法,但結果仍主要來自作者評測。
目前重現門檻不低:輸入建議至少 720p、121 幀、直幅單人且只有輕微鏡頭運動;低於 32GB 記憶體的推論、TensorRT/稀疏注意力加速,以及完整開源的 4DGS 重建仍列在待辦清單。現階段釋出最適合評估「生成多視角觀測」這一段,尚不能視為從任意手機影片到完整 4D 資產的一鍵式生產管線。