返回首頁

代理訓練研究

DRACO 用動態評分規準分配代理每一步的強化學習信用,訓練不讀取任務答案

IBM Research 與卡內基美隆團隊讓評審模型依每組軌跡生成規準,再把整體獎勵重新分配至相關步驟。方法在 AppWorld 提升 15.9 個百分點,但正確性仍取決於未經人工驗證的模型評審。

Charles J. Sharp · CC BY-SA 4.0 · Image source
zh-Hant

長週期代理的強化學習通常需要可程式化驗證器,例如單元測試或環境最終狀態;客服、研究與跨工具工作卻很難取得這種答案。IBM Research 與卡內基美隆大學提出 DRACO,把訓練設為「結果盲」:訓練期間不讀取任務成功訊號或標準答案,而由凍結的評審模型根據任務指令及每條 rollout 動態產生評分規準。

每組軌跡的規準會先合併、去重,再刪除所有軌跡都通過、已失去區辨力的項目。評審對每項規準輸出通過、失敗或不適用,並標記負責的代理步驟。DRACO 先用通過與失敗比例算出軌跡獎勵,經 GRPO 正規化後,再依步驟品質重新分配 advantage:較好的步驟承接成功軌跡的正向更新,較差的步驟承接失敗軌跡的負向更新。公式保持整條軌跡的總更新量和正負號,也以步驟 token 數正規化,避免冗長輸出天然取得較大梯度。它不需要另訓練信用分配模型,也不必為每個位置各呼叫一次評審。

研究以 Qwen3.6-27B 與 Qwen2.5-32B-Instruct 的 LoRA 進行 GRPO 訓練;主要實驗只使用 90 個 AppWorld 任務、每次在八張 H100 上運行,規準生成與評分多由 GPT-5.4 完成。DRACO 在 AppWorld test-normal 達到 85.3 的 Task Goal Completion,較未訓練模型增加 15.9 點,也比使用稀疏真實獎勵的 GRPO 高 5.3 點。零樣本轉移到 τ-bench Banking 時,亦較基礎模型增加 5.3 點。程式碼、提示、超參數與評測流程已以 Apache-2.0 授權公開。

核心風險是「一致地判錯」:動態規準本身沒有獨立答案可驗證,論文也未報告評審與人工標註者的校正一致性;最終任務進步亦不能證明信用確實落在正確步驟。後續重點應是跨評審模型與人工評分的穩健性、訓練重跑方差,以及評審呼叫成本能否在更大任務集合維持。

來源

  1. DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training
  2. IBM/draco