多模態代理與評測
RuleMaze 將視覺規劃拆成工具呼叫,3B 模型未見規則成功率由 56.3% 升至 88.0%
RuleMaze 用可執行驗證器檢查多模態模型能否看懂迷宮、遵守自然語言規則並完成路徑規劃。DMP 將感知、移動及規則驗證拆開後明顯勝過一般微調,但測試仍限於合成網格,且驗證器曾經人工校正。

北京大學等團隊發布 RuleMaze,試圖把多模態模型的「守規則」能力由文字回答移到可執行的空間行動。每題提供迷宮圖片、目標與自然語言限制,例如進入橙色區域後下一步必須向上;模型輸出的上下左右動作既要抵達終點,也不能在途中違規。資料分為 RegularMaze 與包含鑰匙、生命值及動態目標的 QuestMaze,每個環境各有 3,600 個訓練樣本和 400 個測試樣本,其中 300 題使用訓練時未見的規則。
資料生成採 Language–Logic–Function 流程:先由 LLM 構思規則,再轉成邏輯式,最後產生接收完整軌跡的 Python 驗證函式。程式會枚舉迷宮路徑,只保留至少存在一條合規路徑、同時也有違規干擾路徑的組合。自動生成的驗證器在人工檢查前正確率為 93.3%,作者其後逐一審核,因此最終資料並非完全自動建立。
團隊另以 Qwen2.5-VL-3B 訓練 Disentangled Multimodal Planning(DMP)控制器。模型不必在單次文字輸出中完成所有推理,而是交替呼叫 LocateStart、InspectGrid、ExecuteMove、VerifyRule 與 VerifyEndpoint;感知和狀態轉移由工具提供,控制器主要學習何時觀察、移動及驗證。一般 SFT 在 RegularMaze 未見規則的完整路徑精確匹配率為 70.3%,DMP 達 90.0%;QuestMaze 則由 56.3% 提高至 88.0%。在 QuestMaze 困難規則上,差距更由 40.0% 拉到 84.0%。公開專案包含資料生成、LoRA 訓練與逐 checkpoint 評估流程,參考配置約需四張 RTX 4090 訓練十二小時。
這些結果較能證明「外部狀態機加可執行檢查」勝過把約束全塞進模型,而不是證明 3B 模型已學會一般化的現實規則。未見規則在測試時仍配有專用驗證器;迷宮又是離散、完全可觀測且可枚舉的環境,與道路或機器人場景的感測誤差相距甚遠。下一步應觀察未經人工修訂的驗證器能否維持可靠度,以及方法在連續控制、衝突規則和不完整觀測下是否仍有優勢。