ホームへ戻る

代理框架與開發工具

PRAXIST、世代横断のエビデンスグラフで実験の因果関係を保存、MLE-benchのモデル費用をベースラインの約12分の1に削減

PRAXISTでは、複数の研究エージェントが世代を重ねながら変更案を提示し、評価結果、メカニズム、系譜を監査可能なエビデンスグラフに記録することで、各ラウンドでの再探索を回避する。著者らは75タスクのMLE-benchでメダル60個、モデル費用3,054ドルと報告しているが、システムは公開されたばかりであり、成績とコストはいずれも主に開発チームによる測定値だ。

Karmakolle · CC0 · Image source
zh-Hant

Sapient IntelligenceはPRAXIST Betaを公開した。一般的なチャット型研究エージェントではなく、長時間稼働できる「世代型」の研究開発オーケストレーターと位置付けている。ユーザーはまず、実行可能なプロジェクト、ベースライン、評価器、明確な指標を用意する必要がある。複数のpeer agentが手法や実装を並行して変更し、すべての候補案を同一の評価パイプラインで検証する。その後、計画レイヤーが有効なメカニズム、失敗した仮説、未解決の問題を次世代へ引き継ぐ。

中核となる設計は、実験出力を断片的なlogではなく、typed evidence graphとして管理する点にある。各結果には親世代、コード成果物、評価エビデンス、メカニズムに関する主張が保持され、incubator、frontier、Gemsなどの永続的なlaneに分けて保存される。これによりプランナーは、最高スコアのcheckpointを選ぶだけでなく、検証済みの変更を再構成できる。フレームワークはこのほか、Quality-Diversity設定、Deep Innovation Gate、リソース負荷に応じたスケジューリング、replay、recovery、複数指標によるParetoランキングも提供する。PRAXISTが担うのはワークフローとエビデンスのライフサイクルであり、タスク固有の科学的仮説や成功の定義は、引き続き各プロジェクト側で定める。

論文では、全75タスクのMLE-benchでメダル60個、そのうち金メダル49個を獲得したと報告している。同じClaude Opus 4.8を使用したClaude Codeベースラインは、メダル55個、うち金メダル34個だった。記録されたモデル費用は、それぞれ3,054ドルと38,370ドル。チームは定量取引、SLAM、トカマク制御、ロケット着陸の事例も示しているが、これらのオープンエンドな事例ではタスクごとに異なる指標が使われているため、単一の汎用研究能力スコアとして扱うことはできない。

現時点で継続的にテストされているプラットフォームとして挙げられているのは、LinuxとCPython 3.11/3.12のみである。また、システムは指標が必ず改善することを保証していない。さらに重要なのは、このプロジェクトが一般的なオープンソースではなく、source-availableである点だ。年間売上高が100万ドル以上の組織は商用ライセンスについて協議する必要があり、出力を外部公開する際には製品の帰属表示も残さなければならない。導入前にはMLE-benchを独立して再実行し、エージェントが評価器の抜け穴を突けないかを精査するとともに、長時間稼働させる実行環境、認証情報、本番システムを相互に隔離すべきである。

出典

  1. Praxist: From Experimental Artifacts to Solution Lineages
  2. sapientinc/PRAXIST
  3. Meet PRAXIST