返回首頁

代理記憶與搜尋

ReTree 在證據衝突時回滾搜尋樹,Qwen3‑8B 整體答案準確率由 30.1%升至 44.0%

ReTree 把搜尋代理的摘要、證據來源與修訂歷史存成依賴樹;新資料推翻舊前提時,系統會回到引入錯誤的節點並刪除受影響分支。四項搜尋基準顯示它同時縮短每步上下文並改善答案,但硬式剪枝可能丟失其實不受衝突影響的資料。

Filo gèn' · CC BY-SA 4.0 · Image source
zh-Hant

上海交通大學團隊於 8 月 11 日提出 [ReTree](https://arxiv.org/abs/2608.10676),處理長時間搜尋代理的兩個相連問題:完整保留 ReAct 軌跡會令上下文持續增長;反覆摘要雖節省 token,卻可能只留下結論而遺失它來自哪段資料。一旦後續搜尋推翻早期事實,代理通常只改掉該事實,建立在舊前提上的查詢與結論仍留在記憶內。

ReTree 將每次狀態更新保存為樹節點,節點包含最多 140 字的任務摘要、帶穩定識別碼與 URL 的原子證據,以及修訂紀錄。模型每一步只看到目前摘要和詞彙相關度最高的五項證據。新資料若與既有證據在相同實體、屬性、範圍及時間上衝突,第二個判定步驟會檢查來源和修訂歷史;確認後,系統回到最初引入錯誤的節點,更換證據、重建摘要、刪除所有後代,再從修正後狀態重新搜尋。

團隊以 Qwen3‑8B、最多八次 Google 搜尋及相同問題順序,測試 Bamboogle、2WikiMultiHopQA、[HotpotQA](https://hotpotqa.github.io/) 和 FRAMES 共 2,149 題。ReTree 的 GPT‑5 judge 準確率整體為 44.0%,高於完整軌跡 ReAct 的 30.1%;精確比對為 28.0%對 20.6%。每題最大策略記憶上下文平均為 1,190 字元,基線則為 1,677。HotpotQA 本身要求跨多份文件尋找答案與支持事實,因而適合檢查來源鏈是否在多跳推理中保存。

這種設計把代理記憶由可變文字塊提升為可回滾的依賴狀態,適合需要處理更新資料、互相矛盾來源或可稽核引用的研究代理。不過目前依賴 LLM 判斷衝突及 GPT‑5 評分,且所有主要執行只用一個模型與單一 seed。ReTree 也把節點祖先關係當成語意依賴:剪掉整個子樹較安全,卻可能重做無關搜尋。真正部署前仍需加入細粒度依賴追蹤、衝突判定測試,以及對 API 成本和延遲的完整報告。

來源

  1. Self-Correcting Long-Horizon Search Agents via Tree-Structured Memory
  2. HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering