AI 代理與符號規劃
PDDLCoder 讓代理反覆修正 PDDL,106 項未見規劃題的可執行成功率達 89.6%
PDDLCoder 不要求語言模型直接產生長期行動序列,而是先建立可由符號規劃器驗證的 PDDL 世界模型。DeepSeek V4 Flash 在四個保留領域解出 95/106 題,但不同基礎模型的結果由 89.6% 跌至零,顯示框架成效高度依賴模型遵守格式及利用工具回饋的能力。

大型語言模型做長期規劃時,常會產生違反前置條件、漏掉必要步驟或無法到達目標的行動序列。PDDLCoder 改把模型定位為「形式化代理」:它根據自然語言描述建立 PDDL domain 與 problem 檔,再交由 Fast Downward 尋找計畫。代理最多執行 50 輪,可自行選擇檔案編輯、VAL 語法檢查、規劃器轉譯、計畫生成及語義回饋等八種工具;不同於固定修復流水線,它會分別處理語法錯誤、無解模型與語義上不可執行的計畫。
研究同時發布 NL-pddlgym,共有 23 個領域、711 項問題。測試集完整保留 Elevator、Hanoi、Ring and Peg、Satellite 四個領域,共 106 題;最長計畫達 557 步。評分不是比較生成文字或 PDDL 與參考答案的相似度,而是把計畫逐步送入 pddlgym 環境,只有每個動作均可執行且終態符合目標才算成功。使用 DeepSeek V4 Flash 時,PDDLCoder 解出 95 題,即 89.6%;同一測試上的直接 chain-of-thought 規劃為 74.5%,改寫後的既有形式化方法最高為 45.3%。
提升並非免費:成功設定平均使用約 17.3 萬個輸入 token,主要來自反覆送回完整 PDDL、計畫及工具輸出。模型差異也非常大;Gemma 4 31B 成功率為 61.3%,gpt-oss-120B 為 52.8%,Qwen3.6-35B-A3B 僅 10.4%,另兩款受測模型為零。這表示符號規劃器只能保證計畫符合「模型所寫的世界」,不能保證該世界忠實反映自然語言。
工程上值得關注的是這種可執行中介表示能否延伸至有機率、部分可觀測或持續狀態的環境。現有結果每個模型、問題及設定只跑一次,未估算抽樣變異;測試亦只有四個保留領域。好消息是作者已公開程式、Docker 設定、提示、逐題結果與 MIT 授權,外部團隊可直接重跑並檢查高 token 成本是否換來穩定收益。