返回首頁

具身 AI/安全訓練

SafeBranch 在相同狀態配對安全分岔,IS-Bench 安全成功率由 0.031 升至 0.281

SafeBranch 將代理的危險軌跡回滾至關鍵決策點,只比較同一上下文中的安全與不安全動作。訓練後部署毋須外掛 critic,但成果目前限於模擬家居環境,且資料建構仍依賴 GPT-4o 判斷。

Naval History & Heritage Command from Washington, DC, USA · CC BY 2.0 · Image source
zh-Hant

具身代理即使完成任務,也可能在過程中留下爐火、污染食物或以濕手觸碰插座。SafeBranch 的核心觀察是:安全通常不是整條軌跡的平均屬性,而是由少數「安全關鍵步驟」決定。傳統 SFT 只展示安全軌跡,沒有指出同一狀態下應避免哪個動作;整段軌跡 DPO 又會把安全訊號與路徑長度、任務進度等差異混在一起。

新方法先讓基礎 VLM 代理自行執行任務。發生違規後,GPT-4o critic 以事前或事後方式找出造成危險的決策點,環境再回滾至該狀態,由原代理在簡短修正提示下產生安全替代動作。系統隨後移除提示,把安全與不安全輸出重新掛回完全相同的上下文,形成 branch pair;經判斷器過濾不可執行、依賴額外資訊或無法維持任務進度的樣本後,再以 BranchPO 拉高安全分支相對於危險分支的機率。

以 Qwen3-VL-8B 為 actor 的實驗顯示,IS-Bench 原始環境的安全成功率由 0.031 升至 0.281,而一般任務成功率由 0.656 降至 0.594;這表示安全增益很大,但並非完全沒有任務效用代價。在兩個分布外變體中,BranchPO 的安全成功率分別達 0.355 與 0.469。跨模擬器移至 SafetyALFRED 後,五類危害的整體準確率由 0.274 提高至 0.438,且部署時不再需要 critic、逐步自我驗證或前瞻搜尋。

這項工作的工程價值在於把昂貴的安全判斷移到資料建構期,並將稀疏的因果決策點直接轉成偏好樣本。不過 SafeBranch 本身尚未釋出獨立程式庫,結果均來自模擬環境;IS-Bench 雖公開 161 個情境與 388 種風險,仍不能涵蓋真實機器人的感測誤差、控制延遲與物理損害。下一步應觀察 branch pair 能否由較小或形式化 critic 建立,以及在真機 VLA 控制器上是否仍能維持安全與完成率。

來源

  1. SafeBranch: Branch-Pair Safety Alignment for Embodied Agents
  2. IS-Bench code and dataset
  3. SafetyALFRED code and dataset