返回首頁

AI 代理/科學研究

OmniScientist 直接讀取原始科學資料,36 組跨領域任務皆產出可追溯論文

OmniScientist 讓感知能力貫穿假設、實驗與寫作,而非先把影像、波形或軌跡壓成文字摘要。完整系統在與僅接收預算特徵的版本盲測時取得 85% 勝率,但評分仍主要來自模型裁判。

ZKang123 · CC BY-SA 4.0 · Image source
zh-Hant

新公開的 [OmniScientist](https://arxiv.org/abs/2608.13558) 嘗試修補自動化科研代理的一個介面缺口:現有系統雖能搜尋文獻、寫程式及產生論文,通常只能看到人類預先整理的文字、標籤或統計特徵,影像的局部形態、訊號的時間順序及多通道關係可能在研究開始前便已消失。

系統把證據分為感知、符號、量化統計及程序動態四類,由感知層向構想、實驗與寫作三個代理提供影像、音訊、影片、波形、3D 結構、軌跡、表格、公式及知識圖等原始資料。各階段內部仍使用 ReAct 式工具迴圈,但流程轉移由確定性程式控制:構想須通過新穎性及可證偽性檢查;實驗須保留程式、設定、標準輸出與圖表;寫作只能引用執行紀錄中可追溯的數字。若結果為空或實驗失敗,流程返回構想階段,而非直接包裝成發現。

作者在五類學科的 36 組真實資料案例執行完整流程,涵蓋地震、病理、天文、農業及工程等領域;所有案例均產生可編譯論文。參考推理模型的平均論文分數為 6.3,直接感知版本在七項指標均勝過只接收預算純量特徵的盲化版本,配對評審勝率為 85%。[MIT 授權程式庫](https://github.com/Omni-Scientist/OmniScientist)亦提供 CLI、桌面工作台、技能封裝及五篇範例論文。

工程上值得留意的不是又一條多代理管線,而是將執行來源、統計限制及 claim-to-evidence 對應做成程式閘門。不過,36 組案例是展示套件而非預註冊競賽;論文品質主要由兩個跨領域模型裁判評估,也沒有證明產出的新發現能經獨立研究團隊重現。下一步應看人工專家盲審、跨實驗室重跑,以及代理能否在原始資料含污染或錯誤中繼資料時維持約束。

來源

  1. OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
  2. Omni-Scientist/OmniScientist