模型發布與推論架構
Qwen3.8-Flash-Next 以線性注意力配合區塊稀疏檢索,預覽 Qwen4 架構
阿里巴巴開放 Qwen3.8-Flash-Next 權重,以 Gated DeltaNet 壓縮大部分歷史狀態,再由 Qwen Sparse Attention 檢索完整上下文。模型原生支援 262K token,但官方的百萬 token 效能與代理評測仍有待獨立重現。

阿里巴巴 Qwen 團隊釋出 Qwen3.8-Flash-Next,定位為下一代 Qwen4 架構的實驗性預覽。語言主幹共有 125B 參數,每個 token 啟用約 6B;此外另設 51B n-gram embedding 與 4B multi-token prediction 模組。模型亦包含視覺編碼器,原生上下文為 262,144 token,透過 YaRN 可延伸至一百萬 token。權重採 `qwen-community-1.0`,並已提供 Transformers、vLLM、SGLang 與 TokenSpeed 的載入路徑。
核心變化是把 48 層排成重複的「三層 Gated DeltaNet、一層 Qwen Sparse Attention」結構。DeltaNet 以固定大小的循環狀態壓縮歷史,避免每層 KV cache 隨序列線性增長;QSA 則把 token 聚合成微型區塊,先估算區塊重要性,再從完整上下文選取最多 512 個區塊、合計 2,048 token 進行精確注意力。這比逐 token 建立稀疏索引更容易控制長上下文的索引成本,但也意味被檢索器漏選的細節無法進入該層注意力。
官方報告 QSA kernel 相對完整注意力最高取得 7.6 倍 prefill、4.9 倍 decode 加速;在一百萬 token、90% prefix-cache 命中的特定服務測試中,prefill 吞吐量為 Qwen3.7-Plus 的 8.6 倍。NVIDIA 另以 FP8、GB300 NVL72 測得每張 GPU 峰值逾 16,000 token/s,但這是機架級硬件上的 Pareto 峰值,不能直接推算單機延遲或一般併發成本。
模型卡列出的 SWE-bench Pro 為 62.5、DeepSWE 1.1 為 58.7;部分測試使用自家 benchmark、修訂題目或在兩種 harness 中取較高結果,因此尚不能視為獨立排名。工程團隊下一步應關注 QSA 在不同框架的 kernel 成熟度、長上下文召回失誤,以及 51B n-gram 參數對顯存、卸載頻寬和量化品質的實際代價。