返回首頁

模型架構與推論

DeepSeek 公開 V4.1-Flash 壓縮設計,全域 KV 快取降至每 token 890 位元組

新技術報告揭示跨層快取重用、FP4 儲存與局部狀態重建,如何降低長上下文代理的部署成本。壓縮數字不代表整體顯存需求,近似重建的品質邊界也仍待驗證。

Unknown authorUnknown author · Public domain · Image source
zh-Hant

DeepSeek 於 9 月 17 日公開 V4.1-Flash 技術報告,拆解長程代理如何降低上下文儲存與重讀成本。模型支援百萬 token,報告把最佳化分成預填運算、全域快取與持久化狀態三部分,讓部署者能分別檢視算力、顯存及磁碟瓶頸。[技術報告](https://arxiv.org/abs/2609.19969)

其因果編碼器—解碼器架構,把四十層網路分為各二十層的前後段;解碼器的全域鍵值由編碼器最終狀態投影產生,讓多數輸入省去後半段完整運算。每 token 啟用參數因此在預填時為 8B、解碼時為 16B;但骨幹仍有 552B 參數,另有 Engram 條件記憶,硬體需求不能只看啟用量。[模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash)

快取部分,CSA2 讓不同層選擇自行建立鍵值、共用鍵值後重新索引,或連稀疏注意力選取結果一起重用。搭配 FP4 主快取,全域 KV 降至每 token 890 位元組,約為前代四分之一。這個口徑只涵蓋全域快取,部署容量仍須加上局部狀態、權重與其他執行記憶體。[架構說明](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash)

另一項設計只重播最近一個滑動視窗,近似重建局部注意力狀態,因而不必把這些狀態長存於 SSD。作者稱持久化 KV 用量降至前代約八分之一,但重建結果並非數學上完全等價;論文也承認,稀疏選取與快取恢復邊界仍可能出現尚未測到的能力退化。[重建方法與限制](https://arxiv.org/html/2609.19969v1)

公開的最小推論程式有助檢查架構,卻仍使用一般自回歸生成;即使包含草稿模型的前向路徑,也不能據此假定已重現完整推測解碼效能。內建自測使用未初始化權重,只驗證形狀與核心串接,不驗證數值正確性。[推論實作](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/inference/README.md)

從工程角度看,這套設計把儲存成本轉成有限重算,特別值得以多輪工具回覆測試。接下來應比較快取命中與恢復時的延遲、長文稀疏檢索正確率及整體顯存,再判斷壓縮能否轉化為服務容量。對輸入持續增長的代理,前綴保存、跨節點搬移與恢復品質必須一起評估;短提示測出的生成速度,無法反映長任務重用歷史狀態的完整成本。

來源

  1. DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
  2. DeepSeek-V4.1-Flash 官方模型卡
  3. DeepSeek-V4.1-Flash Minimal inference