返回首頁

模型訓練/程式代理

T1 回放 MoE 路由穩定長序列強化學習,Terminal-Bench 2.1 解題率升至 64%

T1 在每個 token 記錄並重播 MoE 專家選擇,避免 rollout 與訓練端因數值差異走向不同子網路。公開權重可自行部署,但基準與競品比較仍主要來自團隊自評。

Bruce Liu · CC BY-SA 3.0 · Image source
zh-Hant

騰訊混元團隊與多所大學研究者公開 T1,一個由 Qwen3.5-122B-A10B 後訓練而來的終端代理模型;總參數約 122B、每個 token 啟用約 10B,能在雲端沙箱中連續執行超過 300 次工具呼叫。團隊同時釋出模型權重、技術報告及訓練資料項目,讓外部研究者可以檢查這套長序列代理強化學習方法,而不只看到 API 成績。

核心問題是 MoE 的訓練—推論不一致。代理執行任務時,對話框架會反覆把歷史文字重新分詞;微小的數值差異也可能改變路由器的 top-k 專家選擇,使 PPO 更新的其實不是產生該軌跡的策略。T1 的 TITO 機制直接保存採樣時的 token ID 與 log probability,並在回合邊界修補重新分詞造成的偏移。R³ 則記錄每層、每個 token 實際選中的專家,訓練前向傳播時重播同一組選擇,同時仍以目前參數計算 gate 分數,保留路由器可訓練性。兩者把團隊量測的平均 log-probability 差距由 0.021 降至 0.013。

獎勵設計也從整項任務通過或失敗,改為計算驗證器中通過的斷言數量。研究者先暖啟動完整尺寸的 critic,再以 PPO 訓練經稽核的 T1-15k 任務集。Terminal-Bench 2.1 的 89 項留出任務中,底模、SFT 與 T1 的解題率分別為 43.8%、49.4% 與 64.0%;Long-Horizon Terminal Bench 則得到 27.9。

這些數字仍不應視為通用代理排名。比較結果由作者在統一 harness 中執行,長程基準上 Claude Sonnet 4.6 仍達 37.3,顯示短一些的 Terminal-Bench 排名不能外推。公開 checkpoint 亦約有 125B 參數,沒有託管推論供應商,實際重現需要大量顯存、沙箱容量及安全隔離。下一步值得觀察的是第三方能否重現 PPO 增益,以及 TITO、R³ 能否移植到其他 MoE 模型與代理框架。

來源

  1. T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks
  2. T1 project page
  3. T1-122B-A10B model card