科學 AI 與代理工具
Paper2Agent 將論文程式編譯成經測試的 MCP 工具,百篇生醫研究有 74 篇成功
刊於 Nature 的 Paper2Agent 會解析論文、程式與教學,自動建立包含工具、資源及工作流程提示的 MCP 伺服器,再以可執行測試淘汰失敗函式。它讓研究方法比單純交付 PDF 或原始碼更容易被代理重用,但成功率仍受缺漏資料、相依環境及原始教學品質限制。

Paper2Agent 把科學論文視為可編譯的代理介面,而不只是供模型檢索的文字。中央編排代理先尋找論文對應的程式庫與資料,建立執行環境,再由專用子代理抽取可泛化函式,產生 MCP 工具、靜態資源與工作流程提示。測試代理會依原始教學建立數值、檔案及圖像驗證,反覆執行、診斷和修補;每個函式最多嘗試六輪,仍失敗便移除 MCP 裝飾器,不對外暴露。這使下游代理呼叫的是具有型別介面及測試紀錄的研究方法,而非臨時閱讀 README 後即席撰寫程式。
團隊對 100 篇未依文件品質篩選的計算生物學論文做端到端測試,74 篇成功轉換,產生的 599 個候選工具中有 593 個通過自動驗證。以這些論文衍生的 300 道教學題評測時,Sonnet 4 搭配 Paper2Agent 的準確率為 91.2%,高於相同模型直接取得論文與程式庫的 80.3%,也高於較新 Sonnet 4.6 直接操作程式庫的 86.3%。在十篇非生物領域論文的 42 項執行任務上,五次獨立執行的平均準確率為 98.1%,顯示模式並非完全侷限於單細胞或基因體工具。
真正的技術轉變是把出版品附帶的程式碼轉成可發現、可遠端部署且能由其他代理組合的標準介面;研究團隊也公開程式與 AlphaGenome、Scanpy、TISSUE 範例伺服器。不過 26% 論文仍因缺少可執行程式、資料、模型檔或相依環境而失敗;通過教學衍生測試也只證明重現既定輸出,不等於方法正確或適用於新資料。主要流程使用 Claude Code 與特定 Sonnet 版本,跨模型、惡意程式庫隔離、憑證管理及長期環境維護,仍是實際採用前必須補上的工程邊界。