代理系統/評測
TWIN、プログラムエージェントに未知のゲームをリアルタイムで再構築させ、ARC-AGI-3スコアを7.8から93.3へ向上
TWINでは、エージェントがまず未知の環境を実行可能なPython世界モデルとして記述し、過去の履歴を完全に再現できた場合にのみ、実環境での行動を許可する。同一の基盤モデルによるARC-AGI-3のスコアは、直接操作時の7.8から93.3へ向上した。

TWINは、ARC-AGI-3のインタラクティブな課題を「まず環境を再構築し、その後に行動を計画する」問題へと置き換える。エージェントは空の`step(grid, action)`と`goal_reached(grid)`から始め、観測するたびに得られる64×64グリッドの遷移に基づいてPythonプログラムを修正する。実行ゲートは、全履歴を使ってモデルをセル単位で検証し、一つでも不一致が残っていれば、次の採点対象となる行動の送信を拒否する。プランナーは、この実行可能な複製環境内でBFSを用いて経路を探索する。予測と実環境が初めて食い違った時点で直ちに停止し、その結果を反例としてモデルを再修正する。
[論文](https://arxiv.org/abs/2608.14490)によると、システムは公開されている25ゲームのうち23ゲームをクリアし、全183レベル中179レベルを達成して、93.3点を獲得した。同じ基盤モデルが直接操作した場合のスコアは7.8、一般的なエージェントharnessを適用した場合は61.1だった。クリアしたレベルのうち156レベルでは、初めて報酬を得る前に正しい目標を推論できていた。研究者らは、実際には選択しなかった行動についても事後テストを実施した。最終的な世界モデルが画面全体を正確に予測した割合は68.6%であり、単に履歴を再生しているだけではないことを示す一方、正確なシミュレーターにはなお程遠い。
技術的な価値は、コストが高く不可逆な環境とのインタラクションを、繰り返し実行できるローカルプログラムによる検証へ変換した点にある。この方式は、ブラウザエージェント、ロボット、インフラストラクチャ操作にも拡張できる可能性がある。ただし、この成果は「内部計算は無料で、実環境での行動のみが採点される」というARC-AGI-3のルールを大いに活用しており、約26億推論tokenも消費している。公開された[コードと実行アーティファクト](https://github.com/Alexyskoutnev/TWIN-ARC-AGI-3)により、外部から記録を検証できるものの、現時点では各ゲームにつき正式な実行は1回だけであり、異なるモデル間での安定性を推定するには不十分だ。次に注目すべきは、部分観測可能な環境、確率的要素を含む環境、あるいはシミュレーションコスト自体にも制約がある環境において、厳格な再生ゲートが引き続き機能するかどうかである。