LLM 推論/測試時計算
Prefix Sliding 保留提示前綴與近期推理,將超長思考的 KV 記憶體變成定額
Prefix Sliding 在生成期間淘汰中段推理 token,只保留系統提示、任務前綴及最近數千個 token,毋須重新訓練即可套用。研究報告長推理的整體思考時間可縮短約三倍,但現有實作依賴分支版 vLLM 與 FlashAttention,短輸出及需回看早期細節的任務收益有限。

推理模型若使用完整注意力,每產生一個新 token 都要讀取持續增長的 KV cache;思考軌跡越長,單步成本與記憶體需求便越高。Prefix Sliding 根據 Qwen3-1.7B 的注意力分析,把上下文切成兩個永久可見區域:包含系統指令、工具定義與原始問題的前綴,以及最近數千個推理 token 的滑動窗口。兩者之間的舊草稿會被淘汰。以 100-token 前綴和 4,096-token 窗口為例,注意力最多只處理 4,196 個 token,因此生成成本不再隨整條思考軌跡線性增加。
方法沿用持續遞增的位置編號,使已套用 RoPE 的 KV 項目毋須因窗口移動而重新計算。團隊另修改 FlashAttention,以 tile 內遮罩和整塊跳過兩級過濾,只計算前綴與近期窗口。其單張 80GB H100 測試以 vLLM 生成 1,024 條序列;窗口進入穩態後吞吐維持約每秒 5,000 token,而完整注意力會繼續變慢。論文所稱約三倍加速是相同時間內可生成更多推理 token 的端到端結果,並不代表每個 token 的推理品質提高。
研究亦把此結構帶入強化學習。100,000-token rollout 毋須全部送進訓練器;範例只傳回末端 8,192 token,將前 6,144 個當上下文,並只對最後 2,048 個計算損失。作者在 7B 模型的受控測試中報告可接近完整注意力,但梯度屬截斷近似,尚未證明可擴展至前沿尺寸。
限制同樣具工程意義:LiveCodeBench 中,模型可能在數千 token 後才續寫先前程式,窗口過小便會遺失函式開頭;大量工具輸出也可能瞬間沖走有效上下文。公開程式碼仍使用舊版 Torch、vLLM、Prime-RL 與 FlashAttention,安裝自訂核心約需十小時。工程團隊應先按工作負載測試窗口大小、長輸出比例與資訊回看需求,再評估是否值得整合至正式推論引擎。