推論系統
KVMem 將代理歷史分頁至記憶體與 NVMe,24GB 筆電 GPU 可定址百萬 token 工作區
KVMem 不再把溢出的代理歷史壓成摘要,而是保留已計算的 KV 狀態,依查詢載入相關區塊。作者以 Qwen 27B 在 RTX 5090 Laptop GPU 展示百萬 token 邏輯工作區,但支援範圍與效能數據仍高度綁定自製執行期。

長時間運作的程式代理會累積對話、工具輸出與檔案內容;當歷史超過模型視窗或 GPU 的 KV cache 容量,常見做法是摘要舊內容,或在需要時重新檢索文字並再次 prefill。KVMem 提出另一條路:把已完成注意力運算的 KV 區塊視為虛擬記憶體頁面,分層存放於 GPU、主記憶體與 NVMe,再以目前查詢建立注意力空間索引,只把相關區塊按時間順序搬回有限的執行視窗。
論文以 LongMemEval、MemoryAgentBench、AgentLongBench 及 DeepSWE 長上下文測試評估。作者稱,在 Qwen3.8-27B 的 DeepSWE 設定中,任務成功率由只使用壓縮的 43.8%升至 48.4%;使用 NVFP4 權重、MTP 與 24GB RTX 5090 Laptop GPU 時,可定址模型原生 256K 視窗四倍的百萬 token 工作區,單一工作階段約生成每秒 50 token。這裡的「百萬 token」是可查詢的邏輯歷史,不代表模型一次對全部 token 執行完整注意力。
公開的 QW3 執行期包含 CUDA 核心、分頁 KV、連續批次、MTP,以及 OpenAI/部分 Anthropic 相容端點。部署者可分別設定歷史選取預算、生成保留空間與 NVMe 容量。不過目前主要針對 Qwen3.6、Qwen3.8 27B 與 NVIDIA GPU,AMD、Metal 和 CPU 生成尚未支援;內建伺服器也沒有驗證或 TLS。接下來值得檢查的是跨模型可攜性、NVMe 尾端延遲、多租戶批次下的吞吐,以及查詢索引漏掉早期關鍵證據時,是否會形成比摘要更難察覺的失憶模式。