模型發布
Atria Dawn Preview、検証可能な環境で長期研究エージェントを訓練した744B MoEの重みを公開
上海人工知能研究所は、Atria Dawn Preview、FP8の重み、推論レシピを公開した。検索からコーディング、実験の実行までを網羅する完全なエージェントループを特徴とする。公式発表では16のベンチマーク中5つで最高性能を達成したとしているが、モデル規模、テスト時計算量、独自の評価設定により、比較可能性にはなお制約がある。

上海人工知能研究所は9月14日、744BパラメータのGLM-5.2 MoE基盤モデルをベースとするテキスト型エージェントモデル「Atria Dawn Preview」を公開した。チームは同時に、オリジナル精度とFP8の重みをMIT Licenseで公開。256K tokenのコンテキストをサポートし、SGLang 0.5.13.post1およびvLLM 0.23.0以降を用いたデプロイ手順も示した。これにより、Atriaは単なるホスト型APIにとどまらない。複数ノードのGPUリソースを持つチームはcheckpointをダウンロードし、ツール、sandbox、データ境界を自ら管理できる。
訓練の中心となるのは「Verifiable Experience Pipeline」だ。モデルはテキストの回答だけから学ぶのではなく、実行可能な環境で情報を検索し、コードを書き、実験を実行し、結果を分析し、失敗から復旧する。そのうえで、外部から検証可能な結果をフィードバックとして受け取る。論文では能力をdiscovery、creation、delivery、cybersecurityに分類し、単発の質疑応答や独立したコーディング問題だけでなく、長期的かつオープンエンドなタスクをモデルに処理させることを目指している。
公式評価は、検索、coding、ツール利用、オフィス生産性、サイバーセキュリティにまたがる16のベンチマークを対象としている。Atriaはそのうち5つで報告済みスコアの最高値を記録したとしており、例としてBrowseCompで92.5、AutomationBenchで53.8、CyberGymで86.5を挙げている。ただし、SWE-bench Pro、Terminal-Bench 2.1、GDPvalなどでは、一部のクローズドモデルに依然として及ばない。論文ではさらに、56人の参加者による769件の研究開発タスクの記録を分析している。参加者は、完了したAI支援タスクの約3分の1について、AIなしでは完遂が困難だったと評価した。しかし、これはチーム内部の業務記録であり、一般的な開発生産性にそのまま外挿することはできない。
エンジニアリング面では、今後2点に注目すべきだ。第1に、744B MoEは一部のexpertだけを有効化する場合でも、重みの容量とGPU間通信のため、オンプレミスでのデプロイに必要なハードルが依然として高い。第2に、現時点の表に掲載された結果は主に公開元のチームが生成したものであり、同一のエージェントフレームワーク、ツール予算、テスト時計算量を用いた独立した再評価が不足している。「Preview」という名称が示すとおり、API、プロンプト形式、推論サポートも今後変更される可能性がある。