代理訓練
SMRC-SD 先核對代理狀態再蒸餾成功軌跡,Qwen3-1.7B 任務成功率提高約 12 個百分點
成功示範不一定適用於代理繞路後抵達的狀態,無條件提供完整軌跡甚至可能壓低正確動作機率。SMRC-SD 只在狀態與示範步驟相容時加入自我蒸餾訊號,在 ALFWorld 與 WebShop 均優於完整路徑基線。

多回合代理的每個動作都會改變後續環境;學生若以不同順序完成子目標,成功示範中的「下一步」便可能無法在目前狀態執行。SMRC-SD 把這項問題稱為狀態—參考不匹配,並在 privileged on-policy distillation 前加入確定性的狀態路由器。
系統先從示範軌跡的動作前綴重建狀態簽章,再比對學生目前的位置、物品欄、物件屬性或購物頁面進度,並確認候選動作仍存在於可執行動作集合。若找到相容位置,教師會取得完整路徑、目前狀態摘要與已落地的候選下一步;找不到時,該回合仍接受 GRPO 終局獎勵,但不加入路徑條件式蒸餾損失。這些額外資訊只在訓練時使用,部署後模型不需要狀態路由器。
以 Qwen3-1.7B 測試時,ALFWorld Average@4 從無條件 FullPath-SD 的 0.746 升至 0.865,WebShop 二元成功率由 0.574 升至 0.693;Qwen2.5-3B 亦有改善,但 WebShop 成功率只由 0.734 微升至 0.736。評估涵蓋每個環境固定的 128 項任務、每題四次 rollout,程式庫則公開訓練腳本、參考路徑及固定錨點探針。
工程上的限制是狀態簽章與相容規則仍由人工為各環境撰寫,並非可直接遷移到任意瀏覽器或企業代理的通用狀態估計器。WebShop 實驗也使用僅一千項商品的文字子集;下一步應觀察語意模糊、部分可觀測及真實網站狀態能否維持可靠匹配,以及路由錯誤是否會把本來有效的監督一併濾除。