代理框架與開發工具
PRAXIST 以跨世代證據圖保存實驗因果,MLE-bench 模型費用降至基線約十二分之一
PRAXIST 讓多個研究代理分代提出改動,再把評測結果、機制與血緣寫入可稽核證據圖,避免每輪重新探索。作者在 75 項 MLE-bench 報告 60 面獎牌及 3,054 美元模型費用,但系統剛公開,成績與成本仍主要由開發團隊量測。

Sapient Intelligence 公開 PRAXIST Beta,定位不是一般聊天式研究代理,而是可長時間運行的「世代式」研發調度器。使用者須先提供能執行的專案、基線、評測器及明確指標;多個 peer agent 並行修改方法或實作,所有候選方案由同一評測路徑驗證,再由規劃層把有效機制、失敗假設及未解問題帶入下一世代。
關鍵設計是把實驗輸出由零散 log 改成 typed evidence graph。每項結果保留父代、程式產物、評測證據與機制主張,並按 incubator、frontier、Gems 等持久 lane 保存;規劃器因此可重組已驗證改動,而非只挑最高分 checkpoint。框架也提供 Quality-Diversity 配置、Deep Innovation Gate、資源壓力調度、重播、恢復及多指標 Pareto 排序。PRAXIST 負責流程和證據生命週期,任務本身的科學假設與何謂成功仍由專案定義。
論文在完整 75 項 MLE-bench 上報告 60 面獎牌、其中 49 面金牌;同樣使用 Claude Opus 4.8 的 Claude Code 基線為 55 面獎牌、34 面金牌。記錄的模型支出分別為 3,054 與 38,370 美元。團隊亦展示量化交易、SLAM、托卡馬克控制及火箭降落案例,但這些開放式案例各用不同任務指標,不能當成單一通用研究能力分數。
目前持續測試平台僅列 Linux、CPython 3.11/3.12;系統也不保證一定改善指標。更重要的是,專案屬 source-available 而非一般開源:年營收達 100 萬美元的組織須洽談商業授權,對外發布輸出還要保留產品署名。導入前應獨立重跑 MLE-bench、審查評測器是否會被代理鑽漏洞,並把長時間執行環境、憑證與生產系統隔離。