ホームへ戻る

推論系統

HeadWiseKV、アテンションヘッドごとに長文脈キャッシュを構成し、Qwen3.6-27Bの利用可能長を161Kへ拡張

HeadWiseKVは、すべてのアテンションヘッドに同一の履歴を保持させる方式を改め、各headの多段階ウィンドウをオフラインでキャリブレーションし、実際の物理KV residencyを削減する。論文では、モデルを固定したテストで最大成功コンテキスト長を114Kから161Kへ延長したが、公開リポジトリのさらに大きな数値は、特定の量子化方式と単一の4090Dを使用した結果である。

The GGML authors · Public domain · Image source
zh-Hant

長文脈モデルでは、局所アテンション、再帰経路、線形経路を組み合わせていても、少数のグローバルアテンション層によってKV cacheがシーケンス長に応じて増大し、最終的に提供可能なコンテキスト長が計算量ではなくGPUメモリによって制約されることがある。9月2日に公開されたHeadWiseKVは、構成単位をモデル全体または層全体から、個々の物理KV headへと細分化する。長距離情報に依存するheadにはより長い履歴を保持させ、それ以外のheadには短いsliding windowを適用し、KV cacheの総予算内でresidencyを割り当てる。

中核となるキャリブレーターSeqCalibは、構成問題を制約付きrate-distortion optimizationとして定式化し、実際の実行順序に従って層ごとに決定を行う。上位層をキャリブレーションする際には、下位層のデプロイ時に用いるキャッシュ戦略を引き継ぐことで、各層を独立に評価するのではなく、層間で蓄積する誤差を捉える。実行時にはgrouped-cacheによって、選択されたheadのKVストレージを直接割り当てる。完全なcacheを保持したままmaskだけを追加する方式ではないため、実際のデバイスメモリを削減できる。この手法はモデルの再学習を必要とせず、モデル本来の局所経路、再帰経路、線形状態経路にも変更を加えない。

論文では、4種類のハイブリッド長文脈モデルで品質を評価し、Qwen3.6-27Bを用いてシステム実験を行った。112K contextでは、サンプリング時のピークデバイスメモリを8.59%削減し、検証で成功した最大コンテキスト長を114Kから161Kへ拡張した。RULERとLoCoMoの性能はfull KVに近い。公開されているllama.cppのブランチでは、24GBのRTX 4090D上で、UD-Q4_K_XLがモデルの上限である262,144 tokensに到達し、Q6_Kとq8_0 KV cacheの組み合わせでは159,744 tokensに到達した一方、同一条件の未変更版では53,248 tokensだったと報告されている。

後者の数値を論文の結果と同一視することはできない。これは特定のGGUF量子化、CUDAによるfull GPU offload、および特定の構成に依存している。また、リポジトリには一部の元の予測結果、完全な容量探索ログ、GGUF hash、ドライバーバージョンが欠けており、統計的有意性検定も実施されていない。今後は、キャリブレーションコスト、異なるプロンプト分布における品質ドリフト、さらにpure Transformer、MoE、マルチユーザーバッチサービングでの効果を、再現可能な評価に組み込むことが重要となる。

出典

  1. HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models
  2. HeadWiseKV reference implementation and experiment artifacts
  3. HeadWiseKV project and reproduction boundaries