3D 生成與具身 AI
iARCS 讓 LLM 生成 3D 場景獎勵程式,物件碰撞率由 52.67% 降至 40.45%
iARCS 先修正室內場景生成器的碰撞與可行走性,再把自然語言需求編譯成可執行獎勵函式進行第二階段強化學習。它在 3D-FRONT 實驗優於 MiDiffusion 的幾何指標,但每項新需求都要另訓練 LoRA,且作者尚未發布實作。

3D 場景生成常以 FID 等分布指標衡量視覺相似度,但對機器人訓練或空間設計而言,家具互撞、物件越界及通道不可達會讓看似合理的資料失去用途。[iARCS](https://arxiv.org/abs/2608.06161)把這類非可微分條件改寫成 diffusion reinforcement learning:第一階段以通用幾何獎勵修正基礎 MiDiffusion,第二階段再由 Gemini 將使用者描述拆成可測量條件及 Python 獎勵程式。
訓練時,系統將 diffusion 去噪步驟視為 MDP,透過 DDPO 更新模型;每十個 epoch 讀取獎勵統計,再讓 LLM 修改函式或權重。這不是一個直接接受任意文字、零樣本產生所有場景的單一模型:論文會針對每種任務條件訓練獨立 LoRA policy。兩階段設計的目的,是先建立碰撞、邊界與可行走性的共同底線,避免特定任務獎勵犧牲基本物理品質。
在 3D-FRONT 室內資料上,iARCS 的物件碰撞率為 40.45%,低於 MiDiffusion 的 52.67%;場景含碰撞比例由 81.67% 降至 64.63%,越界率由 5.89% 降至 3.04%,可達率由 85.7% 升至 87.82%。它另生成 4,000 個場景重新微調 MiDiffusion,顯示合成資料可改善基礎生成器。[MIT-SPARK 的 3D-FRONT 工具](https://github.com/MIT-SPARK/ThreedFront)提供相同資料格式與評估腳本,可作為外部重現起點。
但 FID 從 MiDiffusion 的 1.34惡化至 1.60,顯示幾何可用性與資料分布相似度仍有取捨。更重要的是,LLM 產生的程式可能漏解模糊需求,反覆 RL 也增加每項條件的訓練成本;目前未見官方程式、權重或跨資料集驗證。後續應檢查生成獎勵是否會被模型鑽漏洞,以及同一 adapter 能否泛化至未見過的約束組合。