返回首頁

評測/AI 代理

DiG-bench 隱藏遊戲規則測主動發現:Opus 5 解出 50/70,通用代理框架未帶來增益

DiG-bench 用 70 個全新文字遊戲,要求模型自行實驗並推斷未知規則與勝利條件。Opus 5 解出 50 題居首,但現成代理框架在最高難度題目上沒有穩定勝過基礎模型迴圈。

Berthe Morisot · Public domain · Image source
zh-Hant

DiG-bench 把「發現」從知識問答拆成可控制的互動實驗:每個遊戲都是以短 Unicode 字串呈現的部分可觀察環境,規則、目標與狀態轉移均不公開。代理每回合只能選擇一個合法動作,部分遊戲另提供不計入正式步數的 creative mode,讓系統設計實驗、排除假說,再回到主線解題。70 個人工設計遊戲分成七級,21 個公開供開發,49 個保留作防污染評測。

基礎 harness 的完整測試中,Opus 5 解出 50/70,Gemini 3.1 Pro 解出 18 題,Qwen3.6-27B 僅解出 1 題;若逐題挑選最佳模型,合計也只有 57 題,最高兩級則為 9/20。更能定位瓶頸的是控制實驗:直接提供精簡規則後,Gemini 從 18/70 升至 69/70,表示主要失敗點確實接近規則發現,而非已知規則下的規劃。Claude Code、Codex、Kimi Code、PRO-LONG 與 Prime Agent 等通用代理外殼在高難度題上也未顯示一致增益;工具更多並不等於會提出資訊量更高的下一個實驗。

這對科學代理與自動研發系統的訊息很直接:harness 應記錄競爭假說、預期觀察與反例,並按資訊增益選擇行動,而不只是延長上下文或增加 shell 工具。不過,多數「模型×遊戲」只有單次執行,各模型的成本上限、上下文長度與服務方式亦不完全一致;人類樣本只用來確認可解性。工程團隊下一步應關注公開 API 的重跑結果、跨 seed 變異,以及專為實驗設計建立的記憶與規劃器能否真正突破高階私有題。

來源

  1. DiG-bench: Discovery in Games
  2. DiG-bench 官方網站