返回首頁

科學代理與評測

Reconstruction 隱藏論文只給舊參考文獻,多模型評審把研究構想匹配率由 14.6% 升至 35.6%

新評測要求模型僅憑論文發表前已存在的參考文獻,反推出被隱藏論文的核心研究構想。四模型交叉評審與瑞士制選拔提高匹配率,但候選數、裁判群與計算量均未與單模型條件對齊。

Marc-Lautenbacher · CC BY-SA 4.0 · Image source
zh-Hant

Reconstruction 試圖把「模型能否提出研究構想」改成較可核對的盲測:系統隱藏種子論文的標題與摘要,只提供其發表日期以前的參考文獻,要求模型產生五個假說,再由沒有參與生成的語言模型裁判判斷是否匹配真實構想。資料涵蓋 ICML 2026 oral 論文及五個 Nature 系列領域;經日期解析、參考文獻去重與完整性篩選後,最終多代理比較保留 643 篇。

防洩漏流程包括嚴格時間截點、匿名 reference ID、凍結每篇論文的 bibliography,以及禁止生成階段搜尋網路。七款單模型的匹配率大致只有 3% 至 15%,顯示即使相關文獻已在上下文,從研究脈絡恢復具體問題與貢獻仍不容易。

多代理版本先讓四個表現最佳的模型各產生五個候選,再按位置形成五組。其他模型依相同匿名文獻交叉評論,候選經三輪瑞士制配對;提案模型須迴避裁判工作,同一配對亦交換呈現次序,以降低自評及位置偏差。五個勝出假說最後才交給獨立 Match 裁判。整體匹配率為 35.6%,相對對齊裁判後的最佳單模型 14.6% 約高 2.4 倍;不同領域的多代理結果介乎 22.9% 至 41.6%。

這不等於多代理協作本身帶來全部升幅。單模型保留五個候選,多代理卻從二十個候選中選五個,而且使用更多 token;兩邊裁判群亦未完全相同。模型可能在預訓練時看過種子論文,時間截點只能阻止提示洩漏,不能排除參數記憶。作者也尚未提供人類裁判一致度、等計算量 best-of-20 對照或公開實作。研究代理開發者應把它視為有用的評測設計草案,而非自動科學發現已獲驗證的證據。

來源

  1. Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies
  2. ICML 2026 Papers