代理系統/評測
TWIN 讓程式代理即時重建未知遊戲,ARC-AGI-3 分數由 7.8 升至 93.3
TWIN 要求代理先把未知環境寫成可執行 Python 世界模型,重播歷史完全一致後才允許採取真實動作。相同基礎模型在 ARC-AGI-3 的分數由直接操作時的 7.8,提升至 93.3。

TWIN 把 ARC-AGI-3 的互動問題改寫成「先重建環境,再規劃動作」。代理從空白的 `step(grid, action)` 與 `goal_reached(grid)` 開始,根據每次觀察到的 64×64 網格轉移修改 Python 程式;執行閘門會以全部歷史逐格驗證模型,只要仍有一格不符,就拒絕提交下一個計分動作。規劃器則在這個可執行副本內用 BFS 搜尋路徑,預測與真實環境第一次分歧時立即停下,將結果作為反例重新修補。
[論文](https://arxiv.org/abs/2608.14490)報告,系統在 25 款公開遊戲中完成 23 款、183 個關卡完成 179 個,取得 93.3 分;同一基礎模型直接操作只有 7.8,套用一般代理 harness 為 61.1。已完成關卡中有 156 個在首次獲得獎勵前便推斷出正確目標。研究者亦對未實際採取的動作做事後測試,最終世界模型的完整畫面命中率為 68.6%,顯示它並非只會重播歷史,但距離準確模擬器仍很遠。
技術價值在於把昂貴、不可逆的環境互動,轉換成可反覆執行的本地程式驗證;這種模式可延伸至瀏覽器代理、機器人或基礎設施操作。不過成果高度利用 ARC-AGI-3「內部計算免費、真實動作計分」的規則,也耗用約 26 億推理 token。公開[程式與執行產物](https://github.com/Alexyskoutnev/TWIN-ARC-AGI-3)讓外界可檢查紀錄,但目前每款遊戲只有一次正式執行,尚不足以估計跨模型穩定性。下一步應觀察在部分可觀測、含隨機性或模擬成本也受限的環境中,嚴格重播閘門是否仍能成立。