返回首頁

代理訓練與深度搜尋

ABSeeker 從正確答案反推搜尋線索,4B 模型 BrowseComp 成績升至 55.3%

ABSeeker 將搜尋代理的最終成敗拆成逐步獎勵,保留失敗軌跡中的有效查詢並壓低成功軌跡中的錯誤步驟。團隊已公開 4B 權重、推論及訓練管線,但最佳成績仍倚賴額外的上下文管理與 LLM 裁判。

Oceanflynn · CC BY-SA 4.0 · Image source
zh-Hant

長時間搜尋代理通常只在最後拿到「答案正確或錯誤」的二元獎勵,因此一次錯答會抹掉中途找到的有效證據,一次答對也可能把冗餘查詢與錯誤推論一併強化。ABSeeker 提出的 Answer-Backtracked Credit Assignment(ABC)先利用已知正確答案反向搜尋,重建應被發現的實體、事實與關係;接著由 Clue-Anchored Step Scoring 檢查每一回合是否找到或驗證線索、排除錯誤候選,或引入了錯誤。

這些分數同時進入兩段訓練:ABC-SFT 依回合分數重加權監督損失,ABC-GRPO 則把逐步分數轉為強化學習獎勵。團隊以 Qwen3.5-4B 為底座,SFT 使用 OpenSeeker 的 8,500 條軌跡,其中包含 3,000 條失敗紀錄;RL 再用 1,000 題、每題八次 rollout,單次最多允許 200 個搜尋回合。公開程式包含 ReAct 推論、線索回復、逐步評分、Slime SFT 與 veRL GRPO 管線,搜尋及網頁讀取則分別依賴 Serper、Jina 和額外摘要模型。

未加上下文管理時,ABSeeker 在 BrowseComp、BrowseComp-ZH、xbench-2505、xbench-2510 與 GAIA-text 分別取得 37.3%、39.1%、77.0%、46.0% 和 81.6%;BrowseComp 與中文版套用上下文管理後升至 55.3% 和 52.9%。消融實驗中,ABC-GRPO 在五項測試均高於同資料的標準 GRPO。不過線索與步驟分數本身仍由 LLM 產生,可能把答案洩漏、裁判偏差或單一路徑假設寫入獎勵;驗證集亦有抽樣,最終答案由 DeepSeek-V4-Flash 裁決。後續值得觀察跨搜尋引擎重現、實際 API 成本,以及沒有唯一可回溯答案的研究任務是否仍能受益。

來源

  1. ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
  2. PolarSeeker/ABSeeker
  3. ABSeeker-4B-RL model card