模型發布與評測
Agnes‑3.0‑Flashという同名モデルには実際には2つのバージョンがある:オープンウェイト版とランキング成績を混同してはならない
Agnes AIはHugging Face上の33BウェイトをPreviewと改めて明記し、Artificial AnalysisがテストしたAPIモデルとは異なることを明確にした。両者はコンテキスト長、パラメータの公開状況、評価結果まで異なるため、デプロイ担当者はランキングの36点をオープンなcheckpointの裏付けとして使うことはできない。

Agnes‑3.0‑Flashはリリース後、ローカルモデルのコミュニティで急速に注目を集めた。しかし、最新のモデルカードによって、バージョンに関する重要な問題が明らかになった。Hugging Faceで提供されているのは初期の33B Preview checkpointである一方、Artificial Analysisに掲載されているのはSapiens AI API経由で提供され、ウェイトもパラメータ数も非公開のproduction checkpointである。両者は同じ名称を共有しているが、同一のモデルではない。
オープン版は72層のハイブリッドデコーダーを採用しており、そのうち54層がgated delta ruleによる再帰状態を使用し、グローバルアテンションを使用するのは18層のみだ。そのため、シーケンス長に応じてKV cacheが増加するのは全レイヤーの4分の1に限られる。このほか、5120のhidden size、262,144 tokenのcontext、vision towerを備え、テキスト、画像、動画を入力できる。BF16ウェイトは約66GBで、モデルカードでは少なくとも80GBのH100または141GBのH200の使用を推奨している。ロード時には`trust_remote_code=True`を有効にする必要もあり、これはデプロイ前にリポジトリ付属のPython実装をレビューすべきことを意味する。
一方、API版は100万tokenのcontextをうたっている。Artificial Analysisはこれをproprietaryと分類し、Intelligence Indexを暫定36点としている。また、プロバイダー側で約234.8 output token/秒、最初のtokenまでの遅延1.82秒を計測したとしているが、同ページには独立した完全評価がまだ実施されていないことも明記されている。これらの数値を公開ウェイトに当てはめることはできない。Preview版が独自に掲載しているGPQA Diamond 85.05、SciCode 38.08などのスコアも、異なるharness、snapshot、情報源から集約されたものだ。モデルカードも、これらが統制された同一条件での比較ではないと警告している。
エンジニアリングチームが本当に注意すべきなのは名称をめぐる議論そのものではなく、モデルの識別情報を評価記録とデプロイ記録に組み込む必要があるという点だ。最低限、checkpoint revision、ウェイトのハッシュ、remote-code revision、context設定、実際のAPI providerを保存すべきである。次に注目すべきは、Agnes AIがproduction checkpointのアーキテクチャ、パラメータ、再現可能な評価を公開するか、あるいは第三者が現在のPreviewウェイトを直接テストできるようにするかだ。それまでは、「オープンな33BモデルがAAで36点を獲得した」という主張は、技術的に成立する結論ではない。