返回首頁

推論系統

ReCache 將工具 schema 拆成可重用 KV 區塊,配置記憶體減少 92.43%

ReCache 改寫注意力與位置編碼,讓不同請求可重用個別工具或技能的 KV cache。Qwen3 實驗顯示首 token 延遲最多加速 3.655 倍,但方法需要微調模型,尚非可直接套用的推論外掛。

William Holman Hunt · Public domain · Image source
zh-Hant

工具型代理每次請求取得的 API、MCP 工具或技能組合可能不同,即使某份 schema 完全未變,傳統 prefix cache 也會因前綴順序不一致而失效。[ReCache 論文](https://arxiv.org/abs/2608.19662)提出把每項資源獨立編碼:遮蔽不同 schema 之間的注意力,並讓各區塊從自己的局部位置重新起算,使產生的 KV 表徵不受相鄰資源及排列順序影響。

系統再從兩個方向壓縮成本。結構路由以「單獨開放某層或 KV head group 能降低多少工具呼叫損失」排序,只讓對呼叫決策重要的路徑讀取資源;語意裁剪則保留工具名稱、參數名稱、參數描述及末端聚合 token,而非保存完整 schema。作者整合 ToolACE、APIGEN、WildToolBench 等七套資料,在 Qwen3-1.7B 與 4B 上訓練及評估。

僅採資源級注意力時,域內 Inv-F1 為 82.3%,幾乎等於密集基線的 82.4%,TTFT 加速 3.655 倍。完整 ReCache 的域內與未見資源 Inv-F1 分別為 80.3% 與 60.8%,配置的 KV tensor 記憶體減少 92.43%,注意力運算加速 1.423 倍;在超過 10K 資源 token 的分組中,作者量得近乎固定的約 5 毫秒 prefill 與 0.03 GiB 資源 KV 配置量。[公開程式庫](https://github.com/EIT-NLP/ReCache)已包含修改後的 Qwen3 注意力、DeepSpeed 訓練設定及評估程式。

這不是對既有伺服器透明的快取層:模型必須適應新的 mask 與位置配置,實驗也主要集中於 Qwen3-4B。工程端接下來應觀察它能否擴展至大型、凍結權重模型,以及跨工具依賴或 schema 頻繁更新時,切斷資源間注意力是否仍安全。

來源

  1. ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents
  2. EIT-NLP/ReCache