返回首頁

AI 代理與開源工具

Prime Agent 開源持久化 RLM harness,把代理記憶、子代理與執行環境留在對話之外

Prime Agent 以常駐 IPython、daemon 工作階段及可版本化的 Continual Harness 支援長時間程式代理。作者報告 ARC-AGI-3 RHAE Best@1 從 30% 升至 95.5%,但成績反映整套模型與 harness,不能當作底層模型能力的單獨比較。

U.S. Navy photo by Lt. j.g. Andrew Leatherwood · Public domain · Image source
zh-Hant

Prime Intellect 研究團隊公開 Prime Agent,試圖解決長程代理常見的兩個斷點:模型的有效上下文有限,而終端、子代理與任務狀態又會在工作階段中斷後消失。其核心不是再加一層自然語言規劃,而是提供常駐 IPython REPL;提示、檔案內容及工具結果可作為變數處理,模型也能以程式呼叫 `rlm(...)` 建立遞迴子代理,將大量上下文處理和測試時計算移出主對話。

另一個 Continual Harness 會保存歷史、記憶、技能描述、補充提示及子代理規格。`/refine` 可根據本次軌跡提出小幅、可回滾的更新,但不改寫不可變的基礎 system prompt。daemon 則保留 Python 狀態、排程、心跳與執行中的代理,終端斷線後仍可重新連接;自主模式另設回合、token、時間及品質門檻,避免把「達到資源上限」誤判成完成任務。

論文稱,在 ARC-AGI-3 的 RHAE 設定中,Prime Agent 將 Best@1 由 30% 提高至 95.5%,並在長上下文編程、GPU kernel 生成、模擬器建構、nanoGPT 加速及 Factorio 任務與其他 harness 比較。這些結果的重要訊息是代理框架本身可造成巨大差異,但目前主要仍是作者評測,跨模型、成本及重試預算不宜忽略。

程式以 MIT 授權公開,支援 macOS 與 Linux。部署者尤其要注意:模型產生的 Python、shell 指令及技能會以使用者權限執行;worker 與 kernel 的生命週期隔離不是安全沙盒。下一步應觀察獨立重現、每次成功的 token/運算成本,以及持久記憶經多次自我修訂後是否出現污染或能力退化。

來源

  1. Prime Agent: A Self-Improving RLM Harness
  2. Prime Agent source repository