研究代理/開放模型
AREX 讓研究代理反覆驗證未解條件,4B 模型以壓縮狀態維持長程搜尋
BAAI 將深度研究改寫成「搜尋—逐條驗證—定向補查」的遞迴迴圈,並訓練模型自行壓縮已確認證據與未解限制。4B密集模型與122B-A10B MoE權重已公開,但其優勢主要來自可自動驗證的合成任務,尚不能直接外推至開放式科學研究。

北京智源人工智慧研究院等團隊公開AREX,試圖解決深度研究代理在長時間搜尋後容易遺失限制條件、重複工作或過早提交答案的問題。系統不只延長單一代理軌跡,而是交替執行兩層迴圈:內層蒐集證據並產生暫定答案;外層逐條稽核題目限制,標記尚未證實或彼此矛盾的主張,再啟動針對性搜尋。
長流程最大的工程障礙是上下文會持續膨脹。AREX因此學習一個context-update工具,把歷史互動改寫成精簡的「改進狀態」,保留已驗證證據、來源關係及未解條件,而非反覆把完整瀏覽紀錄塞回提示。這個壓縮器由代理本身學得,不需在每輪另呼叫更大型外部模型,理論上可降低token成本並避免不同模型之間的狀態轉譯誤差。
訓練流程先使用可程式化驗證的合成研究題,再進行代理式中期訓練與長程強化學習。針對最終答案獎勵過度稀疏的問題,作者提高「取得決定性證據」及「修正錯誤搜尋方向」等關鍵步驟的學習權重。團隊發布約4B參數的密集版本,以及總參數約122B、每個token啟用約10B的MoE版本,並在BrowseComp、WideSearch、DeepSearchQA、HLE等搜尋、推理與工具使用測試中與同規模模型比較。
技術意義在於把研究代理的記憶管理與驗證策略一起納入模型訓練,而不只是以更長context或更多平行代理堆算力。不過論文所稱「遞迴自我改進」是同一任務內的答案迭代,不代表模型能自行修改權重或無限提升能力。評測又偏重答案可被明確驗證的問題;來源品質判斷、相互矛盾文獻、付費資料庫與真正的新假說仍是未覆蓋區域。後續應觀察壓縮狀態是否會悄悄刪除反證,以及結果能否在固定搜尋預算下被外部團隊重現。