AI for Science/代理基礎設施
Brain Researcher 將腦影像代理首步工具選擇率由 23.3% 提高至 93.6%
Brain Researcher 以知識圖譜、型別化流程與審查規則約束神經影像分析代理,並保存假設、證據及執行來源。工具路由大幅改善,但可驗證證據落地率仍只有 22.0%,自動審查亦曾漏掉方向性統計錯誤。

Brain Researcher 把科學代理的工作單位由單次回答改成「受治理的研究軌跡」。MIT 授權的 v0.3.0 包含 Python CLI、代理執行環境、FastAPI 編排器、Web UI、Neo4j 知識圖譜介面及 10 個版本化 MCP 工具契約;研究者可預先限定容許的分析方法、必要檢查及主張範圍,系統再把問題、工具選擇、執行紀錄、證據與審查結論串成可追溯紀錄。
在涵蓋七款模型、60 個任務的測試中,加入完整 harness 後,首個動作選中正確分析路徑與工具的比例由 23.3% 升至 93.6%;能力覆蓋率由 49.8% 升至 94.5%,足以交接給下游執行器的比例則由 47.4% 升至 76.1%。另一組 50 題證據測試較不樂觀:引用內容可定位且真正支持主張的比例只由 4.6% 提高至 22.0%,說明可靠路由不等於可靠科學結論。
平台也會展開 multiverse analysis,同時執行多種合理分析規格,暴露結論對估計器、混雜變數及特徵處理的敏感度。例如一項精神分裂症連結體研究執行了 480 種規格,原本看似普遍成立的方向性結果,修正後只在 Pearson 與 Spearman 估計器成立。值得注意的是,錯誤正是由人工檢查發現:一次後備代理忽略效應正負號,自動審查層未能攔截。
工程團隊應留意公開版的邊界。倉庫提供本地 Docker Compose、契約、重播資料與部分產生程式,但完整知識圖譜、受管制資料、私有 benchmark corpus、原始音訊與部分執行綁定並未公開;Kubernetes/Helm 資產也明確標為實驗性。這套系統較適合作為可稽核研究編排範本,而不是已證明能自主產生新科學發現的成品。