代理訓練
TurnSight 用工具執行結果回看每一回合,Qwen3-8B 三項評測平均升至 42.02
TurnSight 不再把最終成敗平均分配給整條工具軌跡,而是利用後續工具回傳重新評估各回合的決策。作者已公開 4B、8B 檢查點、資料與訓練程式,但額外教師分支會提高訓練成本。

工具代理的強化學習常只在任務結束後取得一個獎勵,再把相近的 advantage 指派給整條軌跡。這會掩蓋關鍵差異:代理可能選對第一個工具,卻在下一回合傳錯參數;最終失敗並不表示每一步都同樣錯。TurnSight 將 credit assignment 的單位改成完整互動回合,包括推理文字、工具選擇與 JSON 參數。
訓練時,學生模型先照常產生軌跡。凍結的參考模型再取得學生實際遇到的工具回傳,分別以前看一、二、三個回合的「事後視角」重新計算既有 token 的機率。系統將 token 差值聚合成回合分數,先以三個視角的方向多數決排除互相衝突的訊號,再挑選同方向中最強的證據。該分數會在同一提示的多條 rollout 間正規化,經有界 tanh 權重調整 GRPO advantage 的幅度,但不反轉原本的更新方向。
作者以約 2,000 個 FTRL 可驗證工具題訓練 Qwen3-4B 與 8B,並在 FTRL、BFCL、ToolHop 評測。8B 版本的跨表平均由未訓練基線 31.60、GRPO 的 30.93,升至 42.02;4B 版本則達 37.51,高於 MatchTIR 的 34.76。程式庫已提供 VeRL 擴充、Parquet 資料、評測腳本與兩種模型檢查點。
限制是所有數字仍由作者單一實驗管線產生,三套評測的子指標尺度也不完全相同,跨表平均只能視為摘要。多個前看教師還會增加訓練時計算量。後續值得驗證的是:在含網路延遲、非決定性 API 與不可重播工具的生產代理中,執行結果能否穩定充當事後教師,以及改善是否延伸至更長、更開放的任務。