代理系統與評測
NVIDIA AVO 在 ARC-AGI-3 公開集解完 183 關,關鍵增益來自代理框架而非換模型
AVO 以持久記憶、監督代理及文字網格介面,讓 Claude Opus 5 在 6,624 次環境動作內完成全部公開關卡。100 分只涵蓋公開集,不能視為通過半私有或私有競賽測試。

NVIDIA 將原本用於 GPU 核心最佳化的 Agentic Variation Operators(AVO)接上 ARC-AGI-3,結果在 25 個公開環境、共 183 個關卡取得 100.00 RHAE。這項互動式評測不提供遊戲規則或明確目標,代理必須透過動作觀察狀態轉移,再自行完成探索、世界模型建立、目標推斷與規劃。
AVO 並未為 Claude Opus 5 加入視覺輸入,而是把每個畫面轉成精確的 64×64 文字網格。主代理負責提出假設、執行動作及修正策略;持久記憶則保存先前觀察與實驗結果,避免模型上下文重置後重複探索。另有監督代理偵測停滯或無效循環,必要時改變搜尋方向。完整測試使用 6,624 次環境動作,比同樣解完公開集的 VISTA 所報 7,542 次少約 12%。
這個結果延續 AVO 在效能工程上的設計:其原始版本把傳統演化搜尋的固定 mutation/crossover,改成能查閱候選譜系、文件、編譯器及 profiler 回饋的自主編碼代理。論文中的七日 B200 實驗探索逾 500 個方向,產生 40 個提交版本,部分注意力配置較 FlashAttention-4 快最多 10.5%。
但 100 分不能直接解讀為 Claude Opus 5 本身由約 30% 躍升至通用智能。NVIDIA 明言這不是受控消融:AVO 與比較系統的記憶、推理設定、觀察格式及上下文管理均不同;測試亦未涵蓋半私有和私有環境。ARC Prize 的正式競賽要求無網路、受算力限制且得獎方案須開源,因此接下來應觀察 AVO 是否公開完整實作、成本與重跑變異,以及能否在未見環境維持同等效率。