返回首頁

代理訓練與評測

FACET 先建立可執行環境再生成終端任務,9B 代理得分提高 8.24 點

FACET 把指令、容器、參考解法及驗證器綁定至同一執行狀態,從逾 7.1 萬項代理技能合成 6,078 項驗證任務。僅以 1,200 條成功軌跡微調,Qwen3.5-9B 在 Terminal-Bench 2.1 的得分由 27.34 升至 35.58。

Dicklyon · CC BY-SA 4.0 · Image source
zh-Hant

終端代理的合成資料通常包含四個彼此依賴的部分:使用者指令、預先配置的環境、參考解法及可執行驗證器。若它們由不同生成階段各自推測檔案、依賴或資料格式,任務即使文字合理,也可能無法完成或被錯誤評分。8 月 19 日公開的 FACET 改為先從相關 Agent Skills 重建目標、工具限制、中間狀態及輸入輸出契約,再建立和修復 Docker 環境;後續元件都讀取同一個已實現狀態,失敗時只重生成有問題的部分。

研究從 71,341 項有效技能建立 7,852 組場景種子,最終取得 6,078 項執行驗證任務;每題平均有 22.77 個測試,比研究列出的其他終端資料集更密集。作者用 DeepSeek-V4-Pro 產生約 6,000 題的執行軌跡,篩出 1,200 條完整成功軌跡,對 Qwen3.5 4B、9B及27B進行三輪全參數監督微調。三者在相同 Terminus-2 框架及三次嘗試設定下,Terminal-Bench 2.1 分別增加 7.12、8.24及6.75點;27B版本達47.57,距同設定的397B模型49.06僅1.49點。

消融實驗亦顯示,依序建立環境、指令、解法及解法感知驗證器的最終產出率為83%,高於共同生成的65%及反向生成的63%。不過這並非純粹的單變量比較,各流程同時改變資訊流、驗證及修復策略;排行榜參考模型也未全部在完全相同框架下重跑。程式、6,020項公開任務及三個checkpoint已上線,但論文使用的全部軌跡與生成成本仍需進一步核對。

來源

  1. FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
  2. FACET-Terminal repository
  3. FACET-Terminal models and dataset