代理系統/評測
Tycho 讓代理在互動中編寫世界模型,兩款前沿模型完成 ARC-AGI-3 全部公開關卡
Tycho 把未知遊戲規則寫成可執行的狀態轉移模型,再依驗證結果決定修正或繞過模型。GPT-5.6 Sol 與 Claude Opus 5 在一次公開集測試中完成全部 183 個關卡,但結果仍高度依賴前沿 API、單次執行與公開題目。

ARC-AGI-3 不再只要求模型從靜態範例推斷規則,而是讓代理進入未知的 64×64 互動環境,透過成本有限的動作找出目標、隱藏狀態及遊戲機制。新公開的 Tycho 將這類問題視為「主動抽象」:代理保存畫面、動作與狀態變化,必要時委派另一個模型,把假設寫成包含 `State`、`transition`、`render` 與 `outcome` 的 Python 世界模型,再用既有軌跡驗證並規劃下一步。
團隊以 Claude Opus 4.8 比較四種編排政策。完全不用世界模型時,相對人類動作效率(RHAE)為 79.07;由主要代理自行決定何時呼叫模型建構器,分數升至 88.49。固定在驗證失敗後自動修復模型反而只有 83.07,顯示模擬器更符合已觀察轉移,不代表它理解目標,也不保證下一個動作更好。換用同一編排政策後,GPT-5.6 Sol 與 Claude Opus 5 均在 25 款公開遊戲、183 個關卡取得 100 RHAE;後者使用的計分動作比官方人類彙總基線少 61%。
工程價值在於,Tycho 並未把世界模型固定成單一神經網路,而是讓代理按資訊價值決定何時建立、修補、查詢或放棄可執行假設。公開倉庫包含提示、規劃器、驗證器、重播檢視器、容器沙箱及 OpenAI/Anthropic 傳輸層,便於檢查完整軌跡。
但這不是通用推理已被解決的證據:政策選擇以公開集完成,主要比較每種政策各一次執行,結果可能受隨機性與公開環境調校影響;重現還需昂貴的前沿模型呼叫。下一步應看隱藏測試集、多次種子、成本與失敗率,以及較小模型能否從同一套可驗證世界模型獲得相近收益。