返回首頁

推論系統與評測

KVDiagnosis 逐筆追查 KV 快取壓縮失敗,公開 12,520 筆正確轉錯誤案例

KVDiagnosis 不只比較長上下文總分,而是為每種壓縮設定建立 FullCache 配對,追蹤證據保留、注意力及機率漂移。團隊亦因實作稽核排除 7,800 組結果完全相同的 PyramidKV 紀錄,凸顯跨方法評測容易被轉接器錯誤污染。

William Vaughn Tupper Flickr uploader BPL · Public domain · Image source
zh-Hant

阿卜杜拉國王科技大學團隊發布 KVDiagnosis,針對長上下文推論中的 KV-cache 壓縮建立逐案例診斷基準。一般評測只報告壓縮比例、記憶體與任務總分,無法說明某個原本答對的樣本為何轉錯;更棘手的是,不同方法所稱的「50%」可能分別代表保留一半 token、裁減通道、重新分配各層預算或降低數值精度,並非等量位元組。

KVDiagnosis 先整理 25 種方法及五類機制,實際驗證其中八種實作。每個資料來源都先以 FullCache 執行,再在相同模型、提示、tokenizer、解碼器及評分器下跑各方法與 75%、50%、25% 設定;只有完整矩陣凍結後,才抽取 FullCache 正確、壓縮後錯誤的 C→W 紀錄。這避免用某一壓縮器的失敗集合替其他方法出題,也把不支援、執行失敗和不適用的診斷明確保留,而非從分母消失。

公開資料以固定版本 Qwen3-8B、確定性解碼測試 RULER-8K、RULER-16K、Qasper 與 HotpotQA,共含 2,600 筆 FullCache 控制、59,800 次受支援壓縮執行及 12,520 筆 C→W 紀錄。63.2% 失敗只有低度或部分的證據覆蓋;十項診斷區分失敗與成功案例的分層 AUROC 為 0.684 至 0.871。對 96 筆可重現的低證據注意力失敗,把證據注意力提高四倍可修復 29.2%,計數匹配的假介入則僅修復 6.3%,提供有限但具因果意味的驗證。

值得注意的是,作者稽核後排除 PyramidKV:歷史轉接器誤用了與 SnapKV 相同的固定預算路徑,導致 7,800 組配對的保留位置、輸出、分數與 gold NLL 全部相同。儲存庫現已公開資料、雜湊清單、驗證程式與稽核紀錄。不過結果仍集中於單一 8B 模型,配置比例也不是跨機制的等位元記憶體比較;工程團隊不應把它直接當成壓縮器速度或服務成本排行榜。

來源

  1. KVDiagnosis: A Diagnostic Benchmark for KV-Cache Compression in Long-Context Language Models
  2. ChosenQC/KVDiagnosis