評測/科學代理
EarthVerse 測試 405 項災害調查:代理平均答對逾八成,近完整任務仍只達 34.81%
EarthVerse 要求代理從異質檔案選證據、執行計算並保留來源,而非回答預先整理好的科學問題。最佳系統的答案單元準確率達 84.65%,但至少完成 95% 必要單元的最高比例只有 34.81%。

EarthVerse 把科學代理評測從單題問答推進到可重播的調查流程。基準包含 405 項任務,源自 199 宗已記錄事件和 19 類自然災害;每個事件包可包含報告、時間序列、遙感產品及衍生資料。代理必須自行找出相容證據、選擇工具、處理單位與時間窗、比較衝突來源,並在答案中保存計算和來源關係。資料包合計有 6,709 個檔案及 6,397 筆來源紀錄。
評分不要求代理複製唯一工具順序,而是把答案拆成細粒度單元,另行檢查證據選擇、計算、來源調和和物理解釋。25 套受測系統中,Claude Fable 5 搭配 Claude Code 的答案單元準確率最高,為 84.65%;GPT-5.6 Sol 搭配 Codex 的 Strict@95 最高,亦只有 34.81%。這個落差表示代理常能完成多數局部步驟,卻會漏掉時間窗、單位轉換、替代機制或出處,使整條結論鏈失效。更多回合也不保證較好:論文中的 OpenResearcher 每題平均使用約 53.9 萬 token,仍可能把過時數值保留至最終答案。
數字不能當成裸模型排行榜。部分模型使用共用 EarthVerse 控制器,Codex、Claude Code 和研究框架則保留自己的執行迴圈,成績實際比較的是模型與 harness 的組合;原始影像亦只在少量題目中直接使用。評分還依賴固定的 GPT-4.1 judge,而離線事件包雖提高可重現性,也犧牲即時網路探索。對科學代理開發者而言,較直接的工程啟示是維護「主張—證據」圖,讓每個數值攜帶來源、單位、時間窗與轉換記錄,並把最終審查做成逐項覆蓋檢查,而非只潤飾報告文字。