AI 代理/訓練資料
CalibForge 以求解器分歧校準終端任務,跨基準最高提升 30.04 個百分點
CalibForge 不再把「可執行」視為合格訓練題的充分條件,而是要求候選任務落在指定模型能力的可學習區間。團隊公開 5,431 項任務、兩款模型與評測配方,但部分跨基準結果仍只有單次測量。

終端代理的合成資料常先由模型出題,再用測試程式確認任務可執行;問題是,驗證通過不代表題目具有訓練價值——所有模型都能完成的題目太簡單,全部失敗的題目則可能不可解或超出當前能力。8 月 6 日提交的 CalibForge 將任務生成改成帶有求解器回饋的對抗式迴圈:代理實際操作候選環境,系統根據完整軌跡修改指令、檔案、容器與驗證器,直到難度落入目標區間。
系統提供兩種校準方式。多求解器模式保留「至少一個成功、至少一個失敗」的任務;對比模式則要求指定強模型通過、弱模型失敗。公開資料包含 1,263 項多求解器任務與 4,168 項對比任務,橫跨 16 個領域,每項皆以 Harbor 格式封裝 Docker 環境、自然語言指令及可執行測試。這比僅用單一模型批改題目,多了一個可觀察的能力邊界。
作者以成功軌跡訓練兩款 MoE 模型。Qwen3-30B-A3B 基線在 Terminal-Bench 2.0 由 7.87% 升至 32.58%,SWE-bench Pro 由 3.26% 升至 30.94%,Doc2Repo 由 5.94% 升至 35.98%;較強的 Qwen3.5-35B-A3B 增幅則明顯縮小,顯示資料的有效區間會隨模型改變。工程團隊應關注校準所用求解器是否造成選擇偏差,以及題目經反覆修改後會否學到驗證器捷徑。Terminal-Bench 與 Doc2Repo 報告三次執行,但 SWE-bench Pro 只測一次;目前成績也主要來自作者公開管線,仍待外部重現。