返回首頁

推論系統

Declarative Attention 讓模型自行指定 KV cache 讀取範圍,長上下文解碼少看逾三成 token

KAIST 與 Google DeepMind 提出 Declarative Attention,讓現成模型在推理文字中切換全域、聚焦與本地注意力。作者在兩款模型上減少 31.1% 至 52.0% 的 attended tokens,但速度提升仍主要是模型推算,且準確率略有下降。

Segnargsed · CC BY-SA 4.0 · Image source
zh-Hant

長上下文模型解碼時,每產生一個 token,通常都要從顯示記憶體讀取龐大的 KV cache;即使答案只涉及少數段落,查找成本仍隨上下文長度成長。KAIST 與 Google DeepMind 研究團隊提出 Declarative Attention(DA),把「該看哪裡」變成模型可輸出的控制協定,不另設一個必須掃描完整上下文的檢索器。

系統預先把輸入切成約 2,000-token、可定址的區塊。模型在思考過程輸出 `<global>`、`<focus>` 或 `<local>` 標記:全域模式能查看全部區塊;聚焦模式只讀指定區塊;本地模式則不讀原始長文本,只保留問題、固定指令與已生成內容。推論引擎以狀態機解析標記,動態改寫 KV-cache block table,讓既有 FlashAttention 類核心直接跳過不需要搬入的區塊。方法不必微調模型,也沒有外部 selector 每步執行 O(N) 掃描的成本。

團隊以 Gemma-4-31B 與 Qwen-3.6-27B 零樣本測試 15 項長上下文任務,平均 attended tokens 分別減少 52.0% 與 31.1%,準確率則下降 1.27 與 2.75 個百分點。roofline 分析推估兩者的解碼時間可降至基線的 0.71 倍與 0.77 倍,但這不是完整線上服務的實測吞吐量。

工程上的關鍵問題是,模型是否能穩定且誠實地標示資訊需求。較小模型遵循協定的能力明顯較差;全域步驟仍可能主導總成本,錯選區塊也會直接遮蔽證據。論文目前未提供公開實作,後續應觀察真實 GPU 延遲、批次服務相容性,以及針對注意力標記訓練後能否縮小準確率差距。

來源

  1. Language Models Can Control Their Own Attention
  2. Large Language Models Can Control Their Own Attention Span