模型與推論系統
DeepSeek V4.1 Flash 以非對稱編解碼器壓縮 KV cache,舊模型端點將改道
DeepSeek 開放具原生視覺與百萬 token 上下文的 V4.1 Flash,利用 Causal Encoder-Decoder、稀疏注意力與 FP4 快取,把每 token 的全域 KV cache 壓至 890 bytes。API 已替換舊 Flash,9 月 14 日起 V4 Pro 也會暫時改道至新模型,既有服務須重新驗證輸出與延遲。

DeepSeek 9 月 10 日發布 V4.1 Flash,核心變化不是單純擴大參數,而是把 40 層 Transformer 分成 20 層因果編碼器與 20 層解碼器。解碼器不再為每層各自保存完整輸入 KV,而是從編碼器最終狀態投影全域 KV,使預填與解碼分別只啟用約 8B、16B 參數。模型另以 CSA2 讓注意力層共用 KV、索引鍵與 Top-K 結果,並透過 bounded replay 重建滑動視窗狀態;主 KV 採 E2M1 FP4、每 16 個通道共用一個 E4M3 scale。官方稱全域快取降至每 token 890 bytes,約為前代四分之一,持久化至 SSD 的占用則約剩八分之一,對長歷史、多輪工具代理尤其重要。
模型含 552B backbone、196B Engram 條件式記憶,以及從頭訓練的 DeepSeek-ViT,訓練語料達 45T token,上下文延伸至 100 萬 token。這也解釋了不同頁面對「模型大小」的口徑落差:發布文以 backbone 計算 552B,Hugging Face 介面則顯示約 763B,部署者不應把前者直接視為完整權重規模。官方甚至表示大規模自架可能需要約 2,000 張 GPU,開放 MIT 權重不代表一般團隊能低成本落地。
API 的遷移風險更立即:`deepseek-v4-flash` 與視覺實驗端點已暫時轉送 V4.1 Flash;9 月 14 日中午起,在 V4.1 Pro 上線前,`deepseek-v4-pro` 也會被改道並按 Flash 價格計費。雖然官方在 Terminal-Bench 2.1、DeepSWE 等代理基準報告明顯提升,結果使用最高推理強度、特定代理 scaffold 與最高 100 萬 token 上下文,且部分比較來自內部評測。工程團隊應保存舊版回歸樣本,分別量測首 token 延遲、快取命中成本、視覺輸入與工具呼叫格式,而不能只依模型別名假設行為相容。