返回首頁

電腦視覺

Scal3R 以多參考位姿查詢修補長影片 3D 重建漂移,僅訓練約 1% 額外參數

Scal3R 保留 CUT3R 或 STream3R 的凍結主幹,改由輕量查詢 token 對多個歷史關鍵幀估計相對位姿,再交給線上位姿圖最佳化。作者在 KITTI 報告平均 ATE 較最強線上對手低逾 60%,但成績經 Sim(3) 對齊,不能直接解讀為保留真實尺度。

T Gordon Cheng · CC BY-SA 4.0 · Image source
zh-Hant

長影片的前饋式 3D 重建常把第一幀當成固定座標錨點,再讓後續影格回歸全域相機位姿;路徑愈長,模型就愈需要在訓練分布之外外推,微小誤差最後可能使軌跡與點雲一起崩潰。陽明交大與 NVIDIA 研究者提出的 Scal3R 先分析失敗位置:即使全域位姿持續漂移,逐幀深度通常仍保持穩定,表示不必重新訓練整個幾何主幹。

Scal3R 因此凍結 CUT3R 或 STream3R,只加入約占整體 1% 參數的投影層、位姿查詢 token 與相對位姿頭。其非對稱注意力讓查詢 token 讀取影像特徵,但影像 token 不反向注意這些新增 token,避免破壞原有點雲表徵。每個新影格會同時相對多個歷史關鍵幀估計轉換,再由增量式位姿圖最佳化與閉環偵測整合為全域軌跡;實作使用 GTSAM iSAM2、DINOv2-SALAD 與 FAISS。[論文](https://arxiv.org/abs/2609.04201)報告在單張 GPU 約八小時收斂,CUT3R 版本於 KITTI 的平均 ATE 為 69.7,對照 TTT3R 的 182.2;在 vKITTI,參考幀由 4 增至 12 時,ATE 由 15.75 降至 5.63。完整管線在 CUT3R 上為 14.4 FPS,原始主幹則為 15.9 FPS。

這些結果顯示,把長距離全域回歸改寫成多個短距離約束,可能比擴大模型更有效;對機器人、車載視覺與長時間 AR 掃描尤其實用。不過,[專案頁](https://linjohnss.github.io/scal3r/)展示的數字仍是作者評測。KITTI ATE 先以 Sim(3) 對齊真值,會消除全域尺度誤差;附錄中有相機校正的 ORB-SLAM2 平均 ATE 也低於 Scal3R。接下來應觀察程式與權重能否完整重現、無尺度對齊結果,以及在動態物體、低紋理與無閉環路徑上的長時間穩定性。

來源

  1. Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction
  2. Scal3R project page
  3. Scal3R paper discussion page