返回首頁

代理評測

NVIDIA AVO 完成 ARC-AGI-3 公開集全部 183 關,動作數較 VISTA 少約 12%

NVIDIA 把原用於 GPU 核心演化搜尋的 AVO 代理架構移植至互動推理,搭配 Claude Opus 5 取得 100.00 RHAE。結果顯示代理記憶與驗證迴圈可大幅改變同一模型的表現,但只涵蓋公開環境,且與 VISTA 的比較不是受控消融。

Strubbl · CC BY-SA 4.0 · Image source
zh-Hant

NVIDIA 表示,其 Agentic Variation Operators(AVO)系統在 ARC-AGI-3 的 25 個公開環境完成全部 183 個關卡,以 6,624 次環境動作取得 100.00 RHAE。ARC-AGI-3 不提供遊戲規則、操作說明或明示目標,代理必須透過試探觀察狀態變化,再把發現沿用至後續關卡;RHAE 同時考慮完成度與相對人類基準的動作效率,因此「100%」並不只是最終過關率。

AVO 最初是為自動演化 GPU 核心而設計。其研究版本不把語言模型限制為一次性的候選程式生成器,而是讓代理查閱既有版本譜系、領域知識與執行回饋,反覆提出、修補、批判及驗證修改。NVIDIA 此次把相同的長流程設計套用到陌生互動環境,後端使用 Claude Opus 5。官方以同樣使用 Opus 5 的 VISTA 作參考:VISTA 完成公開集用了 7,542 次動作,AVO 少約 12%。這個差距支持一項重要工程判斷:排行榜量到的是模型、觀測表示、記憶、上下文管理與控制迴圈的合成系統,而非基礎模型的單獨能力。

不過,這不是足以宣告 ARC-AGI-3 已被解決的受控實驗。NVIDIA 明確指出,AVO 與 VISTA 的代理後端、記憶及表示方式不同,無法把動作節省單獨歸因於某個模組;測試又只覆蓋已公開的 25 個環境,長期調整代理架構可能吸收公開集特徵。AVO 原論文與這次網誌也未提供能完整重演 6,624 次動作結果的公開執行包。研究者接下來應關注隱藏環境成績、固定模型與預算下的消融、總 token 和牆鐘成本,以及記憶是否真正跨環境轉移,而非只避免在同一遊戲重複探索。

來源

  1. NVIDIA AVO Reaches 100% on ARC-AGI-3
  2. Announcing ARC-AGI-3
  3. AVO: Agentic Variation Operators for Autonomous Evolutionary Search