推論系統
Random Attention 保留提示後隨機淘汰 KV cache,長推理吞吐量高於評分式方法
Salesforce AI Research 發現,保護原始提示後,在每個 KV head 隨機保留推理 token,準確率可匹配多種內容評分策略。H200 的 32K 輸出測試中,它比 TriAttention 多處理 32% 至 43% token,但短輸出與長程式碼提示不一定受益。

長鏈推理會讓每一層注意力的 KV cache 隨輸出持續增長;現有淘汰器通常計算注意力權重、key 統計或冗餘分數,再保留排名最高的 token。Salesforce AI Research 等團隊提出的 [Random Attention](https://arxiv.org/abs/2609.03430)反其道而行:固定保護完整提示與短期 recent window,其餘生成 token 則在每個 KV head 內均勻隨機抽樣。它不讀取 attention score、value 統計,也不需要模型校準,因此每輪工作只剩實體 cache 壓縮。
研究涵蓋 Qwen3-4B、14B、32B 與 Phi-4-reasoning,以及 MATH-500、GPQA-Diamond、AIME、HMMT、LiveCodeBench 等六組推理任務。在相同 cache 預算下,隨機策略整體匹配或超過 SnapKV、R-KV、VaSE 與 TriAttention。作者的解釋是雙重冗餘:推理文字常會重述仍需使用的資訊,同一 token 又分散存在多個 KV head;只要問題本身未被淘汰,隨機抽樣通常仍留下足夠副本。合成實驗則顯示,只在單一 head 保留一次性事實時幾乎無法可靠取回,保留於多個 head 後成功率才快速提高。
實際 serving 測試使用單張 H200、vLLM 0.19、1K-token 提示、32K-token 輸出、K=2048,並讓 128 個請求並行。Random Attention 在四款模型達到完整注意力的 1.58 至 2.67 倍吞吐量,且比使用相同 paging、排程與壓縮核心的 TriAttention 高 32% 至 43%。原因不是抽樣本身更快很多,而是評分步驟在分頁 cache 上反覆跨 block table 讀取資料,數萬次同步壓縮會令整個批次等待。
這不是「隨機永遠勝過內容選擇」的結論。當輸出只有 8K token、運算而非記憶體成為瓶頸時,壓縮策略的吞吐量僅為完整注意力的 0.52 至 0.96 倍;長程式碼提示也可能吃掉大部分預算,未被重述的一次性事實仍需要內容感知保護。公開的 [Apache-2.0 程式庫](https://github.com/SalesforceAIResearch/Random-Attention)包含評測、顯著性檢定與 vLLM port,但效能數字仍集中於 H200、特定模型及停用 prefix caching 的設定。部署者應先依提示長度、生成長度、併發量及硬體重跑基準。