AI 評測與科研代理
TruthInsightBench 隱藏論文結論測試科研代理,四套系統皆停在約 60 分
新基準只提供研究目標與凍結資料,不向代理透露原論文結論或預定分析路徑。四套程式代理雖能執行分析,卻普遍缺少對照實驗、穩健性檢查、可證偽條件與跨資料集驗證。

TruthInsightBench 試圖把「重現已知結果」與「從資料形成可信發現」分開。研究者從十個科學領域各自挑選同儕審查研究,建立共 40 個盲測任務;代理只取得中性的研究目標、凍結資料與可執行環境,看不到來源論文的結論、期望數值及分析程序。代理必須自行決定該檢查哪些現象、提出哪些主張,並交付程式、分析產物與報告。
評分器不直接比對一個標準答案,而是逐項檢查代理自己提出的發現。六個面向包括證據可稽核性、穩健性、對照測試、跨資料集泛化、新穎性及可證偽性,再拆成 29 個可由執行產物支持的項目;只寫在報告中、沒有真正執行的測試不計分。評審模型固定為關閉思考模式的量化模型,項目先判為 0、0.5 或 1,再以確定性規則彙總,目的在降低每次評測的成本與變異。
在共用同一個凍結基礎模型的條件下,Claude Code、OpenScience、Codex CLI 與 DeepSeek Harness 平均只得 58.40 至 60.27 分。40 項任務的成對檢定沒有找出顯著領先者;它們的證據可稽核率接近八成,卻很少執行替代方法、擾動、負對照或外部資料驗證。這表示目前代理較擅長把分析跑完並寫成報告,還不擅長判斷一個表面訊號究竟是新現象、數值假象或資料偏差。
工程上可把這套基準用作科研代理的回歸測試,但不能把 60 分解讀為通用科研能力。實驗只有單次執行及一個共用基礎模型;代理提示、解碼參數、工具限制與原始執行軌跡亦未隨公開套件完整釋出。下一步應觀察多種模型、多個隨機種子,以及固定評審模型本身的一致性稽核。