GitHub Repo
vLLM、Qwen3.8-2.4Tの分離型推論テストを公開、GPU当たりの総スループットは毎秒約5,000トークン
チームはGB300 NVL72でプレフィルとデコードを分離した構成を測定し、バージョン情報と設定リポジトリも公開した。最大スループットと1ユーザー当たり毎秒約180トークンの生成速度は異なる構成で得られたもので、実際の負荷に応じた検証が必要だ。

vLLMチームは9月21日、Qwen3.8-2.4Tのプレフィルとデコードを分離したテスト結果を公開した。GB300 NVL72クラスタで、GPU当たり毎秒最大約5,000の入力・出力トークンを処理し、低遅延構成では1ユーザー当たり毎秒約180トークンを生成した。両者は異なる構成による性能のトレードオフ曲線上に位置しており、同一サービスで両方を保証する数値として扱うことはできない。[テストレポート](https://vllm.ai/blog/2026-09-21-qwen38-pd-serving)
このようなデプロイでは、プロンプトの読み取りと逐次生成を別々のインスタンスに割り当て、コネクタを介してキャッシュを転送する。技術的な利点は、最初のトークンが出るまでの遅延と、その後の出力間隔を個別に調整し、デコード中に新しいプロンプトの処理が割り込むことで生じるテールレイテンシを抑えられる点にある。公式ドキュメントでは、この機能は依然として実験的とされており、分離そのものがスループットを向上させるわけではないとも明記されている。今回の結果は、ハードウェアと設定全体による成果として捉えるべきだ。[分離型プレフィルのドキュメント](https://docs.vllm.ai/en/latest/features/disagg_prefill/)
チューニングの鍵となるのは、キャッシュ容量の見積もりだ。モデルの92層は、Gated DeltaNetの69層とフルアテンションの23層で構成される。前者はリクエストごとの再帰状態を保持し、後者のKVキャッシュはトークン数に応じて増加する。このハイブリッド構造では、コンテキスト長だけで必要容量を見積もることはできない。モデルカードにはマルチトークン予測への対応も記載されており、投機的デコーディングを有効にする場合は追加の領域を確保する必要がある。[モデルカード](https://huggingface.co/Inferact/Qwen3.8-2.4T-A95B-NVFP4)、[キャッシュ分析](https://vllm.ai/blog/2026-09-21-qwen38-pd-serving)
実験では入力を8,192トークン、出力を1,024トークンに固定し、同時リクエスト数を1から2,560まで変化させた。NVFP4の重みと、指定されたvLLM開発版イメージを使用している。チームはまず両段階を個別に測定し、その後に構成を組み合わせた。選定された構成はいずれもGSM8Kの正解率が95%だったが、単一の数学ベンチマークだけでは、量子化後の中国語、コード生成、長時間にわたるタスクの品質を検証するには不十分だ。[実験設定](https://vllm.ai/blog/2026-09-21-qwen38-pd-serving)
再現用の資料にはNVIDIAのsrt-slurm設定リポジトリが使われており、モデル、GPU、フレームワーク別にパラメータ探索の設定を管理している。このリポジトリは再利用可能な設定を保存し、実際の実行ロジックはsrt-slurmプロジェクトが担う。そのため、モデルの重みを固定するだけでなく、両方のバージョンも実験条件に含める必要がある。導入にあたっては、コードとモデルのバージョンを固定し、両側のキャッシュブロックに互換性があるかを確認するとともに、プレフィル用の機器もコストに含めるべきだ。今後さらに有益な検証となるのは、実際のリクエスト長、到着率、遅延のしきい値を用いた再測定だ。成功した応答1件当たりのコストを把握し、失敗率と再試行率も確認する必要がある。現時点で公開されているピーク値を、そのまま本番サービスの処理能力に換算することはできない。[設定リポジトリ](https://github.com/NVIDIA/srt-slurm-recipes)