返回首頁

推論系統

ReCo 以步驟獎勵協調 KV cache 與推理長度,端到端延遲縮短逾兩倍

ReCo 依每個推理步驟的程序獎勵動態壓縮 KV cache,同時抑制重複反思並提早停止。三款推理模型、六項基準的作者實驗顯示,生成 token 減少 37% 至 65%,延遲改善 2.08 至 2.35 倍。

Kenneth Allen · CC BY-SA 2.0 · Image source
zh-Hant

大型推理模型的成本不只來自不斷增長的 KV cache,也來自模型在快取遭壓縮後生成更多補償性推理。8 月 5 日提交的 ReCo 因此沒有把「刪多少快取」當成唯一目標,而是用輕量程序獎勵估計器為每個已完成的推理步驟評分,再同步控制保留的上下文與後續生成行為。

方法包含三個互相協調的元件。第一,reward-adaptive KV-cache compression 會在高獎勵、推理狀態較穩定的步驟更積極縮減快取,在低獎勵、仍可能需要回查前文時保留更多資訊。第二,系統依獎勵區間處罰反思類 token,減少模型重述、回頭檢查及無效延伸。第三,當估計信心足夠時提前停止。作者的核心觀察是,同樣刪除一筆 token 預算,選在高獎勵步驟比隨機位置更能保存答案準確率;而只縮快取、不約束生成,可能因輸出變長而抵銷節省。

在三款推理模型與六項基準上,ReCo 相較完整思維鏈減少 37% 至 65% 的生成 token,端到端延遲縮短至原本的約二分之一,報告加速為 2.08 至 2.35 倍,準確率則大致維持。這對推論服務的啟示是,KV cache 管理與解碼策略不應由兩套彼此無關的規則控制。

不過論文明確標示仍在修訂,頁面也未提供公開實作。程序獎勵估計器本身的計算成本、錯誤評分造成的過度壓縮,以及在連續批次、量化快取與高併發服務中的尾延遲,都尚待外部驗證。工程團隊應等待程式碼、逐模型準確率及硬體設定公開後,再判斷兩倍加速能否轉移至生產環境。

來源

  1. Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning
  2. DataCite DOI record for Reward-Coordinated Efficient Reasoning