返回首頁

AI 代理與開放模型

AREX 以雙迴圈驗證驅動深度研究,開放 4B 與 122B-A10B 代理模型

北京智源發布 AREX,讓研究代理逐項驗證暫定答案,再以尚未滿足的限制啟動下一輪搜尋。團隊同步釋出 Apache 2.0 權重與執行程式,但基準成績仍主要來自作者自評。

Subway06 · CC BY 3.0 · Image source
zh-Hant

北京智源人工智慧研究院公開 AREX 深度研究代理家族,重點不是單純增加搜尋次數或上下文長度,而是把研究拆成相互交替的內外兩層迴圈。內層代理使用 `search`、`visit` 等工具蒐集資料、整合證據並產生暫定答案;外層則逐項檢查原始問題的限制,依信心與缺漏決定接受答案、針對特定主張繼續查證,或捨棄資訊不足的軌跡重新開始。

為避免長流程把上下文塞滿,模型還會自行呼叫 `update_context`,將已驗證發現、來源識別碼、被排除的候選答案、未解限制與後續計畫壓縮成新的工作狀態。這和固定長度摘要不同:哪些內容應保留也是代理學習的動作。訓練流程結合代理式中期訓練與長時程強化學習,並提高取得關鍵證據、修正錯誤研究方向等步驟的獎勵權重,以緩解只在最終答案給分造成的稀疏回饋。

AREX-Turbo 是以 Qwen3.5-4B 為基礎的稠密模型;AREX-Base 則採 Qwen3.5-122B-A10B MoE,每個 token 約啟用 10B 參數,兩者均標示 256K 上下文。作者在 BrowseComp、GAIA、DeepSearchQA、WideSearch、HLE 等六類測試報告優於多個相近規模基線,並已公開 BF16 權重、提示與快速啟動程式。工程團隊仍應保守解讀「遞迴自我改進」:這裡改善的是單次研究軌跡與壓縮狀態,不是模型在部署後修改自身權重。公開倉庫目前歷史很短,搜尋後端、工具可靠性、推論成本以及基準是否使用相同預算,也都需要獨立重現。

來源

  1. AREX: Towards a Recursively Self-Improving Agent for Deep Research
  2. BAAI/AREX-Base model card
  3. VectorSpaceLab/arex-model