ホームへ戻る

AI for Science/代理基礎設施

Brain Researcher、脳画像エージェントの初手ツール選択率を23.3%から93.6%へ向上

Brain Researcherは、知識グラフ、型付きワークフロー、レビュー規則によって神経画像解析エージェントを制約し、仮説、証拠、実行の来歴を保存する。ツールルーティングは大幅に改善したものの、検証可能な証拠の実装率は依然として22.0%にとどまり、自動レビューでも方向性に関する統計的誤りを見逃したことがある。

Moshe Abeles · CC BY-SA 3.0 · Image source
zh-Hant

Brain Researcherは、科学エージェントの作業単位を単発の回答から「ガバナンス下に置かれた研究トレース」へと転換した。MITライセンスのv0.3.0には、Python CLI、エージェント実行環境、FastAPIオーケストレーター、Web UI、Neo4j知識グラフインターフェース、バージョン管理された10個のMCPツール契約が含まれる。研究者は、許可する解析手法、必須チェック、主張の範囲を事前に制限でき、システムは質問、ツール選択、実行ログ、証拠、レビュー結果を結び付けて、追跡可能な記録を作成する。

7種類のモデルと60件のタスクを対象としたテストでは、完全なharnessを導入した後、最初のアクションで正しい解析経路とツールを選択した割合が23.3%から93.6%に上昇した。能力カバレッジは49.8%から94.5%へ、下流の実行系に引き渡せる割合は47.4%から76.1%へ向上した。一方、50問からなる別の証拠テストでは、それほど良好な結果は得られなかった。引用箇所を特定でき、かつ実際に主張を裏付けていた割合は4.6%から22.0%への上昇にとどまり、信頼できるルーティングが、信頼できる科学的結論を意味するわけではないことが示された。

プラットフォームはmultiverse analysisも展開し、妥当と考えられる複数の解析仕様を同時に実行することで、推定量、交絡変数、特徴量処理に対する結論の感度を明らかにする。例えば、ある統合失調症のコネクトーム研究では480種類の仕様が実行され、当初は広く成立するように見えた方向性のある結果が、修正後にはPearson推定量とSpearman推定量でのみ成立した。注目すべきは、この誤りが人手による確認で発見された点だ。フォールバックエージェントが効果の正負の符号を無視し、自動レビュー層もそれを検出できなかった。

エンジニアリングチームは、公開版の境界に注意する必要がある。リポジトリには、ローカル環境向けのDocker Compose、契約、リプレイデータ、一部の生成プログラムが含まれるが、完全な知識グラフ、規制対象データ、非公開のbenchmark corpus、元の音声、一部の実行バインディングは公開されていない。Kubernetes/Helmアセットも、明確に実験的と位置付けられている。このシステムは、自律的に新たな科学的発見を生み出せることが実証済みの完成品というより、監査可能な研究オーケストレーションのテンプレートとして捉えるのが適切だ。

出典

  1. Bringing analytic rigor to agentic AI for science: The Brain Researcher platform for neuroimaging data analysis
  2. Brain Researcher v0.3.0 release
  3. Brain Researcher v0.3.0 software archive