ホームへ戻る

最新模型

Liquid AIが視覚ドラフトモデルを公開、M5 Maxでデコード速度が最大3.13倍に

約2億8,000万パラメータのDSparkドラフトモデルが、既存の視覚言語モデルに投機的デコーディングを追加。公式の主な速度測定はバッチサイズ1、16ビット設定で行われており、全体の効果は画像処理や同時実行負荷にも左右される。

The GGML authors · Public domain · Image source
zh-Hant

Liquid AIは9月24日、実験的モデルLFM2.5-VL-3B-DSparkを公開した。既存の視覚言語モデルに、約2億8,000万パラメータのドラフトモデルを追加するものだ。まず候補トークンを生成し、それをターゲットモデルが検証することで、ターゲットモデルがトークンごとにデコードする際の呼び出し回数の削減を狙う。公式には重みと、3つの推論フレームワーク向けの統合手段が提供されている。[公開発表](https://www.liquid.ai/blog/lfm2-5-vl-dspark)

ドラフトモデルは、ターゲットモデルの複数の層から隠れ状態を取得する。画像とテキストは、これらの層に入る時点ですでに共通の次元数を持つベクトルに変換されているため、テキスト版DSparkの投機的デコーディングの手順を流用できる。モデルは4層構造で、学習時のブロック長は9、推論時はハードウェアに応じて8または9を使う。追加パラメータ数はターゲットモデルの約8.9%に相当するが、これはパラメータ数の比率にすぎず、サービス全体のメモリ使用量の増加率とそのまま見なすことはできない。[アーキテクチャの説明](https://huggingface.co/blog/LiquidAI/lfm2-5-vl-dspark)

モデルカードには6種類の視覚タスクが掲載されている。M5 MaxとMLX-VLMを組み合わせたCOCOテストでは、デコード速度がベースラインの3.13倍、全体では2.59倍に高速化した。TextVQAでは、それぞれ2.69倍と1.56倍だった。これらのAppleハードウェアでのテストは、FP16、バッチサイズ1、温度0、ブロック長8の設定で実施された。結果は開発チームによる測定値であり、量子化した重みや同時実行数の多いサービスでは別途検証が必要となる。[テスト結果の表](https://huggingface.co/LiquidAI/LFM2.5-VL-3B-DSpark)

統合にはモデルのインターフェースの変更も伴う。9月22日にマージされたSGLangの修正では、最上位で必要となる出力ヘッドと隠れ状態取得インターフェースを内部の言語モデルに委譲し、サービス起動時にメンバーが見つからない問題を防いでいる。出力ヘッドにはプロパティによる委譲を使い、重みのキー名を維持した。このPRでテスト用ドラフト重みを使って測定したところ、バッチサイズを8から64に増やすと、高速化倍率は1.55倍から1.18倍に低下した。同時実行数が増えると、効果が小さくなる可能性を示している。[統合と速度測定の記録](https://github.com/sgl-project/sglang/pull/40651)

検証結果についても、アルゴリズムの設計と実装を分けて考える必要がある。今回のSGLangのテストでは、出力トークンの総数がベースラインと異なり、著者は検証時のテンソル形状に起因する数値的な差によるものと説明している。このテストだけでは、すべての回答の品質が同等であることを証明するには不十分であり、デプロイ時には別途比較すべきだ。[テストの限界](https://github.com/sgl-project/sglang/pull/40651)

実際の用途では、画像エンコード、プリフィル、デコードの所要時間を分けて確認すべきだ。投機的デコーディングが高速化するのは最後の段階だけであり、画像処理が所要時間の大半を占める場合、全体の改善幅は限られる。エンジニアは今後、中国語の図表や文書に関する質疑応答、さまざまな回答長を使って、候補トークンの受け入れ率、最初のトークンが出力されるまでの遅延、総遅延を測定し、出力品質も確認する必要がある。また、モデルカードによると、MLX-VLMのこの処理経路では現在、貪欲サンプリングを使用しており、温度を0に設定する必要がある。[制約の説明](https://www.liquid.ai/blog/lfm2-5-vl-dspark)、[実行設定](https://huggingface.co/LiquidAI/LFM2.5-VL-3B-DSpark)

出典

  1. LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond
  2. Accelerating vision-language models with LFM2.5-VL-DSpark
  3. LFM2.5-VL-3B-DSpark 模型卡
  4. [LFM2-VL] Add DSpark speculative decoding