代理與強化學習
SPADE 讓同一 LLM 編寫可執行訓練環境,30B 模型跨八項評測平均提高 5.3 點
SPADE 以提示前後的回報差訓練環境設計者,讓課程隨代理能力自動變難。Qwen3-30B-A3B 在工具使用評測最多增加 13.9 點,但環境驗證器仍可能接受規格不完整或無解的任務。

固定題庫式強化學習會在模型掌握既有任務後失去訓練訊號;[SPADE](https://arxiv.org/abs/2608.19197) 改由同一語言模型輪流扮演「環境設計者」與「推理代理」。設計者從預訓練語料片段及歷史環境記憶取材,生成包含狀態轉移、獎勵函數、驗證邏輯,以及 `reset()`、`step()` 介面的完整 Python 程式;程式通過結構及執行檢查後,才加入代理的訓練池。
關鍵訊號是 hint-based regret:代理分別在有、沒有特權提示時執行環境,兩者回報差距用來更新設計者。差距太小通常代表題目過易,兩者都失敗則可能代表不可解,因此目標是把新環境推向代理能力邊界。代理本身則由任務回報更新,兩個角色在同一策略內分別正規化 advantage。公開紀錄包含 4,976 個合成遊戲;工具使用版本另生成 4,023 個模擬後端與多步工作流程。
在 Qwen3-30B-A3B-Instruct 上,SPADE 相對最強固定環境基線,在八項保留的數學、科學、程式及程序推理評測平均增加 5.3 點;BFCL-v4 multi-turn 與 ACEBench-Agent 分別增加 5.7、13.9 點。作者亦釋出 4B、8B、30B-A3B checkpoint、環境資料及 [MIT 授權訓練程式](https://github.com/spade-rl/spade),後端整合 SGLang、Megatron-LM、Ray 與 Tinker。
限制在於論文仍標示為 work in progress,主要結果只覆蓋 Qwen3 系列。專案頁也承認部分程式有狀態錯誤,隨機生成的 Sokoban 棋盤多數無法在步數限制內解出;工具驗證器有時只檢查主要狀態變化,未覆蓋指令全部限定條件。下一步應量測錯誤或無解環境的比例、跨模型重現性,以及自適應課程的額外生成與雙重 rollout 成本。