返回首頁

AI 推論系統

SemPIC 將文件預先編譯成可重排 KV cache,長上下文任務平均 F1 接近完整重算

SemPIC 以獨立 Writer 模型離線產生不依賴輸入位置的文件 KV,Reader 則維持原模型與標準快取介面。三款模型、四項任務的平均 micro-F1 由既有方法的 0.53 升至 0.60,但尚未公布端到端延遲、快取容量與程式碼。

Adam Cuerden · Public domain · Image source
zh-Hant

長上下文 RAG 與代理經常重複讀取同一批文件,卻會改變查詢、對話歷史及文件順序。一般 prefix cache 只能重用完全相同的前綴;若把每份文件獨立計算成 KV,再任意拼接,位置編碼與缺少未來上下文又會令注意力分布偏移。

SemPIC 將快取生成與使用拆成 Writer/Reader。Writer 是加入 LoRA 的模型,透過行為蒸餾學習把文件離線編譯成每層 KV;Reader 保留原始預訓練解碼器,不需在命中快取時新增轉換層。訓練目標不只是逼近局部 KV 數值,而是讓 Reader 使用預編譯狀態後重現完整重算的輸出行為。研究另提出 KV Gradient Checkpointing,在保留穿過快取張量梯度的同時降低訓練尖峰記憶體。

三款模型與四項長上下文任務中,SemPIC 的平均 micro-F1 為 0.60,高於 KV Packet 的 0.53,距完整重算的 0.62 剩兩點。這代表可重排文件快取可能不必修改線上推論核心,較容易接入既有 serving stack;對反覆查閱固定知識庫的代理尤其有吸引力。

不過,論文目前主要證明品質可行性,摘要未提供不同命中率下的端到端吞吐、首 token 延遲、離線編譯成本與每份文件的儲存負擔。Writer 也可能需要針對模型重新訓練。工程團隊下一步應關注公開實作、跨模型泛化,以及快取失效與知識庫更新時的整體成本,而不能只比較 F1。

來源

  1. SemPIC: Learning Semantic Position-Independent KV Caches
  2. SemPIC 論文 HTML 全文鏡像