推論系統
KeysAndValues 讓 4B 模型用固定 32K KV cache 微調 128K 上下文
新方法讓模型在微調時直接適應 H2O 等 KV 淘汰策略,部分 128K 任務的準確率由約 20% 至 64% 提高至逾 90%。但自然問答結果並非全面領先,開源實作也仍定位為研究工具。

AWS、阿姆斯特丹大學與柏林工大研究者提出長上下文稀疏注意力微調方法,並以 Apache 2.0 授權釋出 [KeysAndValues](https://github.com/awslabs/keys_values) 0.2.0。核心問題是:模型若以完整注意力訓練,部署時才突然套用固定容量 KV cache,便從未學過哪些資訊會遭淘汰,輸出可能退化甚至無法正常停止。
新方法在前向階段記錄 cache policy 的覆寫決策,反向傳播時重播;再以雙層 activation checkpointing、CPU offload,以及 KV buffer 的差分表示控制記憶體。它不必對離散淘汰策略求導,理論上可配合任意固定容量策略。團隊亦重寫 H2O 路徑,結合 FlashInfer SDPA 與 Triton 核心,在注意力運算時直接累加各 KV slot 的權重。
[論文](https://arxiv.org/abs/2608.19920)以 Qwen3-4B-Instruct-2507、LoRA rank 16 及 32K cache 測試 64K、128K HELMET。128K 的 TREC coarse 任務中,與 cache policy 共同微調後達 96.0% 至 96.4%,完整注意力微調模型改跑稀疏推論時僅得 23.2% 至 77.6%;CLINC150 亦由 61.6% 至 68.0% 升至 94.0% 至 97.4%。工程上重要之處,是長上下文訓練不再必然要求按序列切分至多張 GPU;單張 40GB A100 已可執行範例,更多 GPU 可改用於提高 batch throughput。
限制同樣明顯:四項自然問答資料的結果混合,sequence parallelism 在 NQ、HotpotQA 多數設定仍較佳;論文主要只測一款 4B 模型。FlashInfer 擴充要求 NVIDIA compute capability 8.0 以上,專案也明言生產部署仍需大量工程。下一步應觀察方法能否接入 vLLM、SGLang 的 paged batching,並在較大模型、量化 cache 與多租戶負載下維持品質及延遲優勢。