推論系統
NVIDIA 以線性映射跨模型轉移 KV cache,模型切換 prefill 最快縮短至二十五分之一
新方法把同一家族小模型產生的 KV cache 映射至較大模型,避免長對話切換模型時重新處理整段提示。六組模型中僅四組保留 73% 至 98% 的原始準確率,顯示張量相容不等於語意相容。

NVIDIA 研究團隊提出跨模型 KV cache 轉移,針對成本路由、模型升級及長對話中的動態切換,省去接收模型重新執行 prefill 的成本。現有 prefix cache 通常只能由同一模型重用;這項方法則在來源與目標模型具有相同 KV head 數及每個 head 維度時,為每個目標層與 head 建立獨立映射。
研究者先從來源模型選出最能預測各目標層的數個層,串接其 key、value,再以封閉形式的 ridge regression 求解轉換矩陣。為避免映射只適用於校準時見過的位置,key 會先移除 RoPE 旋轉,於不含位置的內容空間完成轉換,最後套回目標模型的 RoPE。校準只使用 500 段、每段 1,024 token 的 FineWeb-Edu 資料,毋須梯度訓練。
在 Qwen3、Llama 3.1 與 Ministral 3 的六組小模型到大模型配對中,四組於五項基準保留目標模型自行 prefill 時 73% 至 98% 的平均準確率,映射速度則比重新 prefill 快 2.7 至 25 倍;較差的兩組最低僅保留約 42%。非線性 MLP 能在部分失敗配對把 HellaSwag 保留率提高最多 37 個百分點,但也失去簡單、免訓練的優勢。
工程限制相當實際:線性 mapper 本身仍有 10.1 億至 33.6 億參數、占用 4 至 12 GB,配對校準需在八張 H100 上花約 47 至 87 分鐘;實驗亦只涵蓋同家族、共享 tokenizer 且 KV 形狀相符的模型。後續重點是把映射整合進 vLLM、SGLang 等分頁式 cache runtime,並驗證長上下文、多租戶與量化 KV 下的真實端到端效益。