推論系統
HeadWiseKV 按注意力頭配置長上下文快取,將 Qwen3.6-27B 可用長度推至 161K
HeadWiseKV 不再讓所有注意力頭保存相同歷史,而是離線校準每個 head 的多級視窗並真正縮減實體 KV residency。論文在固定模型測試中把最大成功上下文由 114K 延至 161K,但公開程式庫的更高數字來自特定量化與單張 4090D。

長上下文模型即使混合局部注意力、循環或線性路徑,少數全域注意力層仍可能讓 KV cache 隨序列增長,最終由顯示記憶體而非運算量決定可服務長度。9 月 2 日公開的 HeadWiseKV 把配置單位從整個模型或整層細分到每個實體 KV head:對依賴遠距資訊的 head 保留較長歷史,其他 head 使用較短的滑動視窗,並在總快取預算內分配 residency。
核心校準器 SeqCalib 把配置問題表述成受限制的率失真最佳化,依實際執行次序逐層決策;校準較高層時,會沿用較低層部署時的快取策略,以捕捉跨層誤差,而不是各層獨立評估。執行期則以 grouped-cache 直接配置所選 head 的 KV 儲存,不是保留完整 cache 後只加遮罩,因此節省的是實際裝置記憶體。方法不需重新訓練模型,也不改動模型原有的局部、循環與線性狀態路徑。
論文在四種混合式長上下文模型上測試品質,並以 Qwen3.6-27B 進行系統實驗;在 112K context 時,取樣峰值裝置記憶體降低 8.59%,最大驗證成功長度由 114K 增至 161K,RULER 與 LoCoMo 表現接近完整 KV。公開的 llama.cpp 分支另報告:24GB RTX 4090D 上,UD-Q4_K_XL 可達模型 262,144-token 上限;Q6_K 搭配 q8_0 KV cache 可達 159,744,而相同條件下未修改版本為 53,248。
後一組數字不能與論文結果混為一談:它綁定特定 GGUF 量化、CUDA 全 GPU offload 與配置,程式庫也缺少部分原始預測、完整容量探測紀錄、GGUF hash 及驅動版本,且未做統計顯著性檢定。後續關鍵是把校準成本、不同提示分布下的品質漂移,以及純 Transformer、MoE 與多使用者批次服務的效益納入可重現評測。