世界模型與評測
PlayWorld 讓多模態代理實際操控九款世界模型,長時一致性最高仍僅 2.12/5
PlayWorld 用可觀察畫面的代理動態修正控制指令,避免不同世界模型的移動幅度令固定軌跡失去可比性。171 個場景顯示,現有模型雖能生成流暢畫面,卻仍難以保存全域空間與視野外持續演變的狀態。

互動式世界模型常以相同按鍵序列比較,但同一個「向右三次」可能令某模型旋轉一圈,另一個只轉小角度,最後測到的是控制粒度而非世界一致性。PlayWorld 改以高階目標作共同條件,例如繞雕像一周、走入水中,或轉身後再查看持續進行的事件,並由多模態 Agent Player 觀看生成畫面後調整操作。
每個案例仍提供人工編寫的基本動作序列,以限制不同模型的路徑差異;代理只能作 Keep、Stop、Extend、Correct 或 End 決策,最多執行 40 步。這種「預設路徑加小幅修正」在 Genie 3 與 HappyOyster 的 25 題對照中,只改動約 12%至15%動作,人類偏好率分別達 65.6%與67.4%,高於純固定軌跡及完全由代理規劃。代理可替換為 Claude Haiku、Claude Sonnet 或 Gemini 3.1 Pro,但論文最後採用延遲較低的 Claude Haiku。
[PlayWorld 資料集](https://huggingface.co/datasets/jocelynd/playworld-bench)包含 171 個人工整理場景、50 種動作模式及超過 820 條題目,評測九款開放或封閉世界模型產生的逾 1,400 段、長約10至60秒的互動影片。評分涵蓋幾何一致性、互動逼真度、視野外演變及持續可見的狀態演變;若軌跡根本未抵達待測位置,該維度先被閘門判為最低分,避免漂亮但沒有完成任務的影片獲益。
九款模型沒有一款總分超過 2.12/5。Genie 3 以 2.12 最高,HappyOyster 為 1.92;最佳開放模型 LingBot-World2 為 1.82。模型普遍較能維持局部畫面或即時碰撞,卻會在環繞地標時複製建築、讓離開視野的物件原狀返回,或使烹飪、繪畫等事件停滯或重置。這說明傳統美學與幀間流暢度不足以代表可用的世界狀態。
[程式與介面](https://github.com/kxding/PlayWorld)已公開,但評分仍依賴 Gemini 3.1 Pro 回答樣本專屬 VQA rubric,控制代理亦使用封閉模型。171 題對快速迭代中的世界模型仍偏小,而五款系統透過網頁操作、四款本機分段生成,底層推論條件並不完全一致。下一步應觀察評分器跨模型偏差,以及新模型能否在固定狀態記憶測試上重現排名。