模型發布與評測
Agnes‑3.0‑Flash 同名模型其實有兩個版本:開放權重與榜單成績不可混用
Agnes AI 已把 Hugging Face 上的 33B 權重改標為 Preview,明確表示它不是 Artificial Analysis 測試的 API 模型。兩者連上下文長度、參數公開程度與評測結果都不同,部署者不能再用榜單的 36 分替開放 checkpoint 背書。

Agnes‑3.0‑Flash 上線後迅速在本地模型社群引起注意,但最新模型卡澄清了一個關鍵版本問題:Hugging Face 提供的是較早期的 33B Preview checkpoint,而 Artificial Analysis 列出的則是由 Sapiens AI API 供應、權重與參數量未公開的 production checkpoint。兩者共用名稱,卻不是同一份模型。
開放版本採 72 層混合解碼器,其中 54 層使用 gated delta rule 循環狀態,只有 18 層使用全域注意力,因此只有四分之一層的 KV cache 會隨序列增長。它另有 5120 hidden size、262,144 token context、視覺塔,以及文字、圖片和影片輸入;BF16 權重約 66GB,模型卡建議至少使用 80GB H100 或 141GB H200。載入時還必須啟用 `trust_remote_code=True`,這代表部署前應審查倉庫附帶的 Python 實作。
API 版本則宣稱 100 萬 token context。Artificial Analysis 將它標為 proprietary,暫估 Intelligence Index 36 分,並透過供應商端測得約 234.8 output token/秒與 1.82 秒首 token 延遲;頁面同時寫明獨立完整評測仍待進行。這些數字不能套用到公開權重。Preview 自己列出的 GPQA Diamond 85.05、SciCode 38.08 等成績,又是從不同 harness、snapshot 和來源彙整,模型卡已警告不是受控的同場比較。
真正值得工程團隊注意的不是名稱爭議本身,而是模型識別必須進入評測與部署紀錄:至少保存 checkpoint revision、權重雜湊、remote-code revision、context 設定與實際 API provider。下一步要看 Agnes AI 是否公開 production checkpoint 的架構、參數及可重現評測,或讓第三方直接測試目前的 Preview 權重;在此之前,「開放 33B 模型取得 AA 36 分」並不是成立的技術結論。