模型與推論架構
Qwen3.8-Flash-Next 用區塊稀疏注意力與 n-gram 參數擴展,為 Qwen4 預演新架構
阿里巴巴公開 Qwen3.8-Flash-Next 權重,以 Qwen Sparse Attention、Gated Residual 與 510 億個 n-gram embedding 參數降低長上下文運算成本。模型原生支援 26.2 萬 token,但效能數字主要來自官方評測,授權亦不是常見的 Apache 2.0。

阿里巴巴 Qwen 團隊發布實驗性模型 Qwen3.8-Flash-Next,稱其架構將成為 Qwen4 的基礎。語言模型主體有 1,250 億參數,每個 token 約啟用 60 億,另配置 510 億個 bigram/trigram embedding 參數及 40 億個多 token 預測參數;原生上下文為 262,144 token,可延伸至 100 萬。
核心變化是把 Gated DeltaNet 與 Qwen Sparse Attention(QSA)交錯排列。QSA 不逐 token 選取注意力位置,而以 micro-block 為單位建立索引,每層最多讀取相當於 2,048 個 token 的區塊;理論上可讓長上下文成本不再隨序列長度等比例增加。新增的 Gated Residual 則以資料相依的 read gate 和各分支 write gate 控制加寬殘差流。團隊也把短 n-gram 查表視為一條低運算、容易卸載至主記憶體的擴展軸,與需要路由及矩陣乘法的 MoE 並用。
官方報告 Qwen3.8-Flash-Next 在 SWE-bench Pro 得到 62.5%、SWE-bench Multilingual 得到 81.0%,均高於自家 27B 密集模型;但 DeepSWE 分數取兩種 agent harness 中較高者,SWE-bench Pro 又使用修訂後題目重跑基線,不能直接與公開榜單橫向比較。部分長期辦公及應用重建測試也是內部基準。
部署端已列出 Transformers、vLLM、SGLang 與 TokenSpeed 路徑,但新注意力、n-gram embedding 和 MTP 都要求近期 runtime 支援。工程團隊應實測不同上下文長度下的顯存、首 token 延遲及區塊索引開銷,也要留意模型採用 Qwen Community License 1.0,而非較熟悉的 Apache 2.0。