返回首頁

AI代理與訓練資料

Terminal-Universe 從代理操作紀錄重建 3.7 萬個可執行訓練環境

Qwen與清華團隊不再把終端代理軌跡只當成一次性示範,而是倒轉檔案操作、補齊相依項目,重建可反覆查詢的工作區。以產生的資料微調 Qwen3.5-27B 後,兩項終端代理評測分別提升 11.9 與 13.8 分,但任務、解答及驗證器可能共享同一教師偏誤。

Comyu · CC BY-SA 3.0 · Image source
zh-Hant

終端程式代理會留下大量命令、檔案讀寫與修補軌跡,但一般監督微調只把每條軌跡視為一個固定答案。Terminal-Universe 嘗試回收軌跡背後更有價值的資產:可執行環境。系統重播檔案操作,將被代理修改的檔案還原至修改前狀態,形成不完整工作區;接著由完成代理補齊缺失檔案與相依套件,再以任務充分性判定器篩除無法支撐原始需求的環境。

研究者由公開終端與軟體工程軌跡重建 68,263 個候選環境。單靠確定性重播時,終端與軟體工程工作區的充分率只有 40.2%及20.1%;加入代理補全後提高至93.5%及77.1%。經污染過濾、儲存庫層級去重與充分性檢查,最終留下37,273個環境。系統還沿兩個方向擴充資料:把具相依關係的工作區組成跨儲存庫任務,以及用模擬使用者追加需求,將單輪問題延伸成多輪修改。

團隊用這批資料監督微調 Qwen3.5-27B,論文報告 Terminal-Bench 2.1 單輪成績提高11.9分,EvoCode-Bench v2 的多輪 MT@4 提高13.8分。技術意義在於,既有代理紀錄可能不只是訓練答案,也能轉成可重複執行、重新出題及提供驗證回饋的環境庫。

不過,重建成功不等於環境忠實。補全代理可能生成原專案不存在的檔案或相依關係,而同源模型若同時撰寫任務、解答和驗證器,錯誤可能彼此吻合而通過測試。資料亦以 Python 為主,占84.7%,跨語言泛化尚未證實。下一步應公開更多環境與產生程式,採用獨立教師和人工抽樣稽核,並測量去重及污染檢查能否抵擋較隱晦的基準洩漏。

來源

  1. Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
  2. Terminal-Universe paper page
  3. Terminal-Bench