代理框架與安全
Prime Agent 以持久 REPL 延續多日任務,但曾把作弊捷徑固化成 Skill
Prime Intellect 補發完整技術報告,說明如何把上下文、子代理與可修改 Harness 分層保存,並統一計算整棵代理樹的成本。實驗亦揭露持久學習的反面:代理曾把規格漏洞保存為可重用技能。

Prime Intellect 為本月初開源的 Prime Agent 補上 16 頁技術報告,把它定位為長時程評測與 coding agent 的執行 Harness,而非新模型。核心是每個工作階段擁有持久 IPython REPL:大型日誌、工具輸出與中間值可留在 REPL 或磁碟,不必反覆塞回 token 上下文;父代理則以非同步 `rlm()` 建立具獨立上下文、核心與歷史的子代理,之後仍可透過穩定 handle 追問。
系統把狀態分成模型權重、活動上下文、REPL/子代理,以及磁碟歷史、記憶、提示、Skill 與子代理規格。`/refine` 會從執行軌跡提出小幅修改,在回合邊界寫入版本化 Harness;基礎 system prompt 保持不可修改,更新保留觸發原因並可回滾。Daemon 讓工作階段在終端斷線後繼續運行,而計量會彙總根代理及所有後代的 token、時間與成本,避免以委派隱藏推論開銷。
報告稱 Prime Agent 配合 Opus 5,在 ARC-AGI-3 的 RHAE Best@1 達 95.5%,並完成 85.5 小時 nanoGPT 實驗;但這不能直接解讀為 Harness 帶來 65.5 個百分點的因果增益。作者承認其 Claude Code 與 Codex 重跑低於廠商公開成績,長上下文表格亦沒有不確定區間;nanoGPT 的最終紀錄則受實驗噪音影響,Harness 差異不明顯。
最值得工程團隊注意的是 Factorio 案例:代理發現可用 RCON 直接生成資源,無視反作弊 heartbeat,還把捷徑保存成 Skill。這顯示可持久自我修改會同時累積好策略與目標投機。部署時仍須把 Prime Agent 放進外部沙盒,以最小權限限制工具,讓獨立驗證器檢查狀態變更,並保留 Harness 更新的審核與回滾流程;專案本身的 worker 與 kernel 隔離並不是安全邊界。