模型發布
Atria Dawn Preview 釋出 744B MoE 權重,以可驗證環境訓練長程研究代理
上海人工智慧實驗室公開 Atria Dawn Preview、FP8 權重與推論配方,主打從搜尋、寫程式到執行實驗的完整代理迴圈。官方在 16 項基準中宣稱五項最佳,但模型規模、測試時計算與自家評測設定仍限制了可比性。

上海人工智慧實驗室 9 月 14 日發布 Atria Dawn Preview,一款建立在 744B 參數 GLM-5.2 MoE 基座上的文字型代理模型。團隊同步公開原始精度與 FP8 權重,採 MIT 授權,提供 256K token 上下文,並列出 SGLang 0.5.13.post1、vLLM 0.23.0 以上的部署路徑。這使它不只是託管 API:具備多機 GPU 資源的團隊可以下載 checkpoint,自行控制工具、沙箱與資料邊界。
訓練上的重點是「Verifiable Experience Pipeline」。模型不是只從文字答案學習,而是在可執行環境中搜尋資料、編寫程式、跑實驗、分析結果及從失敗復原,再由外部可檢查的結果提供回饋。論文把能力分成 discovery、creation、delivery 與 cybersecurity,試圖讓模型處理長程、開放式任務,而非只解單輪問答或孤立的程式題。
官方橫跨搜尋、coding、工具使用、辦公生產力及資安的 16 項評測,宣稱 Atria 在其中五項取得最高已報告分數;例如 BrowseComp 為 92.5、AutomationBench 為 53.8、CyberGym 為 86.5。不過它在 SWE-bench Pro、Terminal-Bench 2.1、GDPval 等測試仍落後部分閉源模型。論文另分析 56 名參與者的 769 筆研發任務紀錄,受試者認為約三分之一已完成的 AI 輔助任務若沒有 AI 將難以完成,但這是團隊內部工作紀錄,不能直接外推成一般開發效率。
工程端接下來應關注兩件事:第一,744B MoE 即使只啟用部分專家,權重容量與跨 GPU 通訊仍使本地部署門檻很高;第二,目前表格主要由發布團隊產生,尚缺同一代理框架、工具預算與測試時計算下的獨立重跑。Preview 名稱也意味 API、提示格式及推論支援仍可能變動。