代理系統與評測
NVIDIAのAVO、ARC-AGI-3公開セットの全183レベルを攻略――主要な性能向上はモデル変更ではなくエージェントフレームワークに由来
AVOは永続メモリ、監督エージェント、テキストグリッドインターフェースを活用し、Claude Opus 5で全公開レベルを6,624回の環境アクション以内に完了した。ただし、100点というスコアは公開セットのみを対象としており、セミプライベートまたはプライベートの競技テストに合格したことを意味しない。

NVIDIAは、もともとGPUカーネルの最適化に使用していたAgentic Variation Operators(AVO)をARC-AGI-3に接続し、25の公開環境、計183レベルで100.00 RHAEを達成した。このインタラクティブ評価ではゲームのルールや明確な目標が提示されず、エージェントはアクションを通じて状態遷移を観察しながら、探索、ワールドモデルの構築、目標の推定、計画を自律的に行わなければならない。
AVOはClaude Opus 5に視覚入力を追加せず、各画面を正確な64×64のテキストグリッドに変換した。メインエージェントは仮説の提示、アクションの実行、戦略の修正を担う。永続メモリには過去の観察結果や実験結果が保存され、モデルのコンテキストがリセットされた後に同じ探索を繰り返すことを防ぐ。さらに、監督エージェントが停滞や無効なループを検出し、必要に応じて探索の方向を変更する。全テストで使用した環境アクションは6,624回で、同じ公開セットをすべて攻略したVISTAが報告した7,542回より約12%少ない。
今回の成果は、パフォーマンスエンジニアリングにおけるAVOの設計思想を引き継いでいる。AVOの初期バージョンでは、従来の進化的探索における固定的なmutation/crossoverを、候補の系譜、ドキュメント、コンパイラ、profilerからのフィードバックを参照できる自律型コーディングエージェントに置き換えた。論文で報告されたB200を用いた7日間の実験では、500を超える方向性を探索して40の提出バージョンを生成し、一部のattention構成はFlashAttention-4を最大10.5%上回る速度を記録した。
ただし、100点という結果を、Claude Opus 5自体の能力が約30%から汎用人工知能の水準へ飛躍したものと直接解釈することはできない。NVIDIAは、これが統制されたアブレーションではないと明言している。AVOと比較対象システムでは、メモリ、推論設定、観察形式、コンテキスト管理がいずれも異なり、テストにはセミプライベート環境とプライベート環境も含まれていない。ARC Prizeの正式な競技では、ネットワークアクセスの禁止、計算資源の制限、受賞ソリューションのオープンソース化が要件となる。そのため今後は、AVOの完全な実装が公開されるか、コストや再実行時のばらつきがどの程度か、さらに未知の環境でも同等の効率を維持できるかを見極める必要がある。