模型與代理研究
Photon-1 從未標註螢幕影片學習操作電腦,以潛在狀態預測取代動作標記
Induction Labs 發表 106B-A5B 稀疏 MoE 模型 Photon-1,預訓練時只觀看螢幕影片,不需要滑鼠與鍵盤動作標籤。模型先預測下一個潛在畫面狀態,再生成抵達該狀態的操作,但目前效能證據主要來自團隊內部評測。

Induction Labs 公開「imagination model」架構及首個實驗模型 Photon-1,嘗試繞過電腦操作代理常見的資料瓶頸:不先用 inverse dynamics model 為影片反推出滑鼠、鍵盤等動作,而是直接從前後畫面學習狀態如何變化。預訓練目標是自回歸的 next-latent-token prediction;差分視覺編碼器以有限標量量化(FSQ)把每幀壓成 960 個離散 token、約 2.2 KB,並著重描述相鄰畫面的差異。
[官方技術說明](https://www.inductionlabs.com/news/scaling-video-pretraining)稱,Photon-1 是總參數 106B、每 token 啟用 5B 的 MoE,在約 200 萬段螢幕錄影中取出 5.75 億幀,以每秒一幀計算相當於 18 年影片、552B token。32K 上下文的一輪預訓練耗用約 3 萬 H200 GPU 小時;完成後,再以少於 3.5 萬條含動作軌跡的資料微調,讓模型先「想像」下一個桌面狀態,再輸出對應操作,並透過虛擬機上的可程式驗證結果進行線上強化學習。
團隊宣稱,Photon-1 在內部電腦操作題目超過 Gemini 3.1 Flash-Lite,預訓練 FLOPs 少至少 30 倍、推論成本低約三倍;只以電腦影片預訓練的表徵,微調後也能下西洋棋及模擬撞球。這些比較尚無公開測試集、權重或獨立重現,[Y Combinator 的發布頁](https://www.ycombinator.com/companies/induction-labs)也明確將數字列為團隊結果。工程上真正值得追蹤的是:壓縮後的潛在狀態能否跨網站與作業系統泛化、RL 後變得難以解讀的 latent 是否妨礙除錯,以及無動作標籤預訓練在更廣泛實體影片上能否維持因果可控性。