返回首頁

代理訓練與檢索

CIPO 以遮蔽檢索證據分配步驟獎勵,Qwen2.5-7B 七項問答平均 F1 升至 0.504

CIPO 比較代理在看得到與看不到最新檢索結果時的動作機率,直接獎勵受外部證據影響的下一步。作者實驗較最強基線提高 4.7 個 F1 點,但額外評分會增加訓練成本,且目前只驗證兩款 Qwen2.5 模型。

Secom Bahia (Manu Dias) · CC BY 2.0 · Image source
zh-Hant

搜尋代理即使呼叫檢索工具,也可能先靠模型記憶猜出答案,再把搜尋結果當成確認材料;只按最終答案或推理進度給獎勵,無法區分這類「先有結論」軌跡。8 月 6 日提交的 CIPO(Contextual Information Policy Optimization)改以 Evidence-Access Log-Likelihood Ratio 分配逐回合獎勵:對每次檢索後的下一個推理或搜尋動作,分別計算證據可見與被遮蔽時的生成機率,兩者對數似然差越大,代表該動作越依賴新證據。

這個訊號不需要人工過程標註或另一個獎勵模型,但訓練時仍須增加一次遮蔽證據的評分。團隊以 verl、八張 A100 80GB 訓練 Qwen2.5-3B-Instruct 與 7B-Instruct;每批 32 個問題、每題 16 條軌跡,最多互動五回合。七項問答基準中,7B 版本的宏平均 F1 為 0.504,高於 IGPO 的 0.457;3B 版本亦由最強對手的 0.409 升至 0.456。作者的診斷顯示,7B 模型採用支持答案之證據的比例由只用終局獎勵時的 21.9% 升至 60.7%,使用無關證據的比例則由 11.3% 降至 9.1%。

消融實驗也揭露限制:只獎勵「對證據敏感」會把無關證據使用率推至 28.9%,必須與答案正確性共同最佳化。額外評分令 7B 每步訓練時間由 417.2 秒增至 436.5 秒,但推論端沒有新增成本。工程上仍應關注跨模型、真實網路搜尋、超過五回合及多工具任務能否重現;論文目前也未連結 CIPO 專用程式庫。

來源

  1. Contextual Information Policy Optimization for Search Agents
  2. verl:LLM 強化學習訓練框架
  3. Qwen2.5-7B-Instruct 模型卡