返回首頁

AI 研究

ExplorationBench 以反常規則沙箱,拆解代理探索與知識應用能力

研究讓十套 AI 系統自行探測陌生規則,再停用工具測試知識應用,發現多輪探索仍可能退步。測試題尚未公開,專案頁與論文的部分分數也有差異。

Luis Ezcurdia · CC BY-SA 3.0 · Image source
zh-Hant

復旦大學、騰訊混元與清華大學團隊於 9 月 24 日提交 ExplorationBench,將代理評測推進到「自行蒐集證據,再應用新規則」。研究以兩個可執行沙箱測試十套 AI 系統,觀察模型能否修正既有認知,以及所得知識能否支援未見過的任務。[論文](https://arxiv.org/abs/2609.30199)

兩個環境刻意讓熟悉的操作失效。AlienCode 設有 31 個發現目標,例如整數常值先與 27 做 XOR,使 `EMIT(100)` 輸出 127;AlienLogic 則修改 24 條推理規則。兩者各有 70 道保留測試題,答案交由直譯器或證明檢查器驗證;指定不可證的命題,須正確拒絕證明才得分。這讓評分可直接查驗,降低語言模型裁判帶來的判斷變異。[專案說明](https://www.explorationbench.com/)

實驗起點是同一份含錯誤的手冊與固定示例。代理進行四輪探索,自選程式或證明作為探測,接收環境回饋;每輪結束另複製對話、停用工具,要求陳述規則並作答,測試副本隨後丟棄。整個過程不更新權重,衡量的是單次上下文內取得及運用知識的能力,尚未涵蓋跨會話的長期學習。[作者解說](https://www.explorationbench.com/blog/)

依論文 v1,Claude Opus 5 在 AlienCode 三次獨立探索中,最佳終點為 87.6%,平均 72.5%,最差 49.0%。這個落差說明,最佳成績不足以代表穩定表現;30 條程式探索軌跡中,六條的最終分數還比先前某輪低至少三個百分點。主榜採三次取最佳的 Best@3,工程評估應同時檢視平均值、最差值與探索成本。[結果與評測方法](https://arxiv.org/html/2609.30199v1)

對研究代理開發者而言,可據此測試在記憶中保留規則的支持證據與適用條件,是否能減少後續推理推翻正確發現的情況。這是實驗引出的工程假設,效果仍須在真實工作流程驗證。

目前仍有兩項查核限制:專案頁把 AlienCode 最高分列為 89.0%,與論文 v1 的 87.6% 不同,不能混用;網站也明言測試題未公開,外部模型須聯絡團隊代測。因此,這項工作提供了可研究的評測設計,但公開材料尚不足以讓第三方完整重跑。後續應關注分數版本對齊、評測材料釋出,以及相同預算下增加重複試驗後的穩定性。[官方評測入口](https://www.explorationbench.com/)

來源

  1. ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds
  2. ExplorationBench 論文全文 v1
  3. ExplorationBench 官方專案與評測入口
  4. 談到探索,我們到底在評測什麼?