返回首頁

開放模型與推論基礎設施

Qwen3.8 首次開放 2.4T 參數 Max 級權重,每個 token 啟用 95B

阿里千問公開 Qwen3.8‑2.4T‑A95B,以 512 個專家、混合線性與標準注意力支援最長約 101 萬 token。模型可調整推理深度,但只接受文字、不能關閉思考模式,實際部署門檻遠高於一般開放權重模型。

猫猫的日记本 · CC BY-SA 4.0 · Image source
zh-Hant

阿里千問於 8 月 12 日公開 Qwen3.8‑2.4T‑A95B,首次把其 Max 級模型的權重交付社群。模型共有 2.4 兆參數,每個 token 啟用 95B;92 層網路以 23 組區塊排列,每組包含三層 Gated DeltaNet 線性注意力及一層標準 Gated Attention。MoE 層設有 512 個專家,每次選取十個路由專家及一個共享專家,並使用多 token 預測訓練。原生上下文為 262,144 token,可延伸至約 101 萬 token。

開放版目前是純文字模型,而且所有回應都必須進入思考模式;`reasoning_effort` 提供 low、medium、xhigh 三級,`preserve_thinking` 則可把先前推理保留於多輪訊息。這些介面對長時代理尤其重要:工程師可用推理預算交換延遲與成本,而不用改寫提示或切換模型。權重已相容 vLLM、SGLang 及 TokenSpeed,但 2.4T 參數的 BF16 檔案意味完整部署需要多節點、專家平行與高容量儲存,不能把「每 token 只啟用 95B」誤解為只需載入 95B。

官方測試顯示 Qwen3.8‑Max 在 Terminal Bench 2.1 得 86.6、SWE‑bench Pro 得 67.7,較 Qwen3.7‑Max 的 74.5 與 60.6 上升;PaperBench 則報 93.0。不過多項結果採 Claude Code、OpenCode 或 Qwen 自家 harness,部分基準亦為內部資料,未形成完全一致的橫向比較。開放權重模型與雲端 Qwen3.8‑Max 也不等同:後者另有視覺輸入、非思考模式、預設 1M 上下文及內建工具。下一步應觀察獨立重現、不同 expert-parallel 配置的吞吐,以及縮短推理預算後代理成功率是否維持。

來源

  1. Qwen3.8-2.4T-A95B model card and weights
  2. Qwen3.8-Max: A New Bar for Coding and Cowork
  3. QwenLM/Qwen3 repository