ホームへ戻る

檢索與推論系統

Tevatron-Elastic、単一の検索checkpointで深度・token・ベクトル幅を調整

Tevatron-Elasticは、early exit、Matryoshkaベクトル、層間token圧縮を設定可能なoperating pointとして統合し、1つのcheckpointで複数のコスト構成に対応する。Qwen3‑0.6B rerankerは第16層で完全な品質を維持しつつ、著者らのテスト環境で1.75倍の高速化を達成した。

Fermilab, Reidar Hahn · Public domain · Image source
zh-Hant

Tevatron-Elasticは、本番検索システムで一般的なモデルの断片化、すなわち低レイテンシ、低ストレージ、高品質といった要件ごとに別々のモデルを訓練する問題の解決を目指す。このフレームワークは、3つの圧縮軸を単一の`Granularity`に組み込む。`layer`は早期の出力読み出しまたは上位層の削除を決定し、`dim`はMatryoshka embeddingを切り詰め、`keep_ratio`と`pool_layer`は中間段階でのtoken統合を制御する。訓練時には、必要なoperating pointをscheduleとして列挙し、デプロイ時に`prune_to`または`encode_at`を使って構成を選択する。

深度とtokenの圧縮はencodingまたはscoringの計算量を削減し、ベクトル幅の縮小はインデックス容量と近傍探索のコストを抑えるため、3つがもたらす節約の種類は同一ではない。このフレームワークは、Hugging Faceモデルが既に備えるhidden state、層リスト、poolingインターフェースを利用して動作する。著者らはBERT、ModernBERT、Qwen3、Llama 3、Mistralの各パスを検証済みで、新たに提案されたMLTCでは、単一の検索checkpoint内で複数のtoken保持率を共同訓練することもできる。

チームはRLHN‑680Kを使って20個のcheckpointを訓練し、BEIR‑15で検索性能とBM25 top‑100のreranking性能を評価した。共同訓練による「弾力性税(elasticity tax)」は、完全にゼロというわけではない。ModernBERT retrieverの完全なoperating pointでは、nDCG@10が専用モデルの0.476から0.450へ低下した。BERTは0.013低下した一方、Qwen3‑0.6Bは0.008向上した。単一GPUでの実測では、Qwen3‑0.6B rerankerは第16層で0.342 MRR@10を維持しながら、スループットを1.75倍に高めた。第4層では実測で6.86倍となり、FLOPsモデルが予測した7倍に近い結果だった。

制約も明確だ。token圧縮は8 tokenの短いqueryではほとんど効果がなく、3つの軸を同時に組み合わせて実行することは可能だが、論文ではその品質評価がまだ示されていない。また、実験は特定のデータ、単一GPU、教師ありfine-tuningのレシピに限定されている。今回のリリースの主な価値は、新たな最高検索スコアではなく、統一インターフェースと検証可能な20組のweightsにある。

出典

  1. Tevatron-Elastic: A Unified Abstraction for Training Elastic Retrievers and Rerankers
  2. Tevatron-Elastic source code
  3. Tevatron-Elastic checkpoint collection