ホームへ戻る

模型壓縮與 CPU 推論

CompactifAI、Llama 3.3 70Bを約65 GiBに圧縮し、単一のXeon 6上でvLLM CPUにより実行

Multiverse Computingは、圧縮および修復学習を施したLlama 3.3 70Bを発表した。vLLM CPUとIntel AMXを利用してXeon 6上でサービングできる。公式テストではスループットがほぼ倍増したものの、出力速度は毎秒4 token未満で、チェックポイントと生データは公開されていない。

Yuening Jia · CC BY-SA 3.0 · Image source
zh-Hant

Multiverse Computingは、CompactifAIで圧縮したLlama 3.3 70BをvLLMのCPUバックエンドに接続し、アクセラレータカードを搭載しないIntel Xeon 6サーバーへの大規模モデルのデプロイを目指した。同社によると、モデルファイルは約130 GiBから65 GiBに縮小された。この手法は単なる量子化ではなく、テンソルネットワークを用いてモデル表現を削減した後、「healing」と呼ばれる修復学習を行う。サービング層にはvLLM CPUを使用し、行列演算にはXeonのAdvanced Matrix Extensions(AMX)を活用する。vLLMの公式ドキュメントでもIntel XeonがCPUサポート対象の一つであることが確認できるが、CompactifAIのチェックポイントはvLLMアップストリームが提供するものではない。

テスト機は、32コア/64スレッドのXeon 6737Pを1基と約1 TBのメモリのみを搭載し、tensor parallelismは1に設定された。入力1,024 token、出力1,024 tokenの固定されたランダムtokenを使用した場合、単一の同時リクエストにおける出力スループットは2.00 token/sから3.86 token/sへ、総tokenスループットは4.02 token/sから7.81 token/sへ向上した。平均TTFTは6.94秒から3.71秒へ、TPOTは494.71ミリ秒から255.76ミリ秒へ短縮された。テストは同時ユーザー数256まで拡張され、公式発表では最大107%のスループット向上を達成したとしている。

品質面では、BoolQ、GSM8K、HellaSwag、MMLUのスコアがそれぞれ約0.95%〜2.48%低下した一方、WinoGrandeは6.86%上昇した。後者は修復学習の効果である可能性もあれば、評価のばらつきやテンプレートへの感度を反映している可能性もある。今回の発表は、70Bクラスのモデルを単一ソケットのCPUサーバーに収容できることを実証したが、インタラクティブな使用感がGPUに近づいたことを意味するわけではない。4 token/s未満の生成速度と数秒のTTFTを踏まえると、低速のバッチ処理、データ主権、バックアップ用途により適している。同社は手法とワークロード設定を示しているものの、圧縮済みの重み、コマンドライン、コンテナのバージョン、生のJSONは公開していない。エンジニアリングチームは次の段階として、ダウンロード可能な成果物の提供を求め、実際のプロンプト長、KV cacheへの負荷、テールレイテンシー、消費電力、リクエスト当たりのコストを用いて再検証すべきだ。

出典

  1. All CompactifAI Models Now Run on Intel Xeon 6 Processors
  2. CompactifAI: Extreme Compression of Large Language Models using Quantum-Inspired Tensor Networks