返回首頁

代理訓練與評測

Prime Intellect 統一 36.5 萬項代理任務,讓評測與強化學習共用執行介面

Prime Intellect 將軟體工程、終端操作與網路搜尋資料集整合為 23 個 taskset,透過統一 API 接入代理評測及強化學習。平台也延後注入測試與評分材料以降低 reward hacking,但評分仍與代理共用沙箱,隔離尚未徹底。

sankarshan · CC BY-SA 2.0 · Image source
zh-Hant

Prime Intellect 公開一批可直接用於代理評測與強化學習的環境整合,涵蓋約 19.8 萬項軟體工程、2.86 萬項終端操作,以及 13.76 萬項搜尋任務,合計超過 36.5 萬項。重點不是再造資料集,而是把 23 套原本各自採用映像檔、測試流程、記錄格式及評分器的基準,收斂到同一個 taskset 介面。

底層 `verifiers v1` 將環境拆成三層:taskset 定義資料、工具與評分;harness 決定代理如何執行,例如 Codex 或其他 ReAct、CLI 代理;runtime 則管理本機程序、Docker 或遠端沙箱。這項解耦讓研究者可替換模型與代理框架,而不必重寫任務生命週期,產生的 trace 也能直接交給 `prime-rl` 訓練。官方示例使用 6 個 H200 節點,在兩天內以 ScaleSWE 訓練 GLM-4.5-Air。

整合也處理代理式 RL 常見的獎勵破解問題。代理與評分程式若位於同一容器,策略可能讀取預期答案、修改測試或破壞評分狀態。新版因此把測試修補、預期輸出及評分腳本延後至評分階段才注入,並重新驗證部分上游資料。不過官方承認這只是緩解措施,真正的結構性修正仍是把執行與評分放入不同沙箱。

工程團隊還應注意資料品質的另一面:由已合併 PR 產生的測試,可能只接受原作者的實作細節,使功能正確但寫法不同的代理得到錯誤負分。36.5 萬筆規模降低了接線成本,卻沒有自動解決測試偏誤、授權差異或基準污染;接下來值得觀察隔離式評分及 agentic judging 能否把這些噪音從訓練訊號中移除。

來源

  1. Scaling Agentic RL: 365,000+ Environments for SWE, Terminal, and Search
  2. PrimeIntellect-ai/research-environments