GitHub Repo
vLLMコミュニティ、画像入力が黙って失われると報告 リクエスト単位の思考設定が視覚理解に影響する可能性
vLLM 0.30.0でのコミュニティ報告によると、画像リクエストにchat_template_kwargsを追加すると、モデルにはテキストしか届かない可能性がある一方、サーバーは成功を返す。問題は上流で未確認であり、視覚入力と思考モード制御を組み合わせるデプロイでは、実際の入力を検証すべきだ。

10月3日、vLLMコミュニティでマルチモーダル入力に関する報告があった。/v1/chat/completionsリクエストにchat_template_kwargsを追加すると、画像がモデル入力から消える可能性があるが、エンドポイントはHTTP 200を返し、エラーや警告も出ないという。報告の構成は、vLLM 0.30.0、NVFP4量子化版Gemma-4-26B-A4B、RTX PRO 4500 Blackwellだった。これは特定構成でのユーザー報告であり、すべての視覚モデルに影響すると推定することはできない。問題報告
報告者は、同じ画像とテキストを使った2種類のリクエストを比較した。リクエスト単位のテンプレートパラメータを付けない場合、プロンプトトークン数は276で、モデルは画像を説明できた。一方、enable_thinking: trueを加えると、プロンプトトークン数は22に減り、回答は画像を受け取っていないと述べた。設定をfalseにした場合や、画像を1枚または3枚にした場合にも、同じ現象が起きた。注目すべき点として、サーバー側ではすでに思考モードがtrueに設定されていたため、同じ値をリクエスト単位で再指定しても、入力結果が変化した。比較テスト
公式ドキュメントでは、このパラメータは通常の思考制御インターフェースとして説明されている。デプロイ担当者は--default-chat-template-kwargsでグローバルなデフォルトを設定でき、クライアントはリクエスト単位のパラメータで優先的に上書きできる。ドキュメントによると、Gemma 4ではenable_thinkingで思考を有効にできる。このため、この報告は実務上の意味を持つ。タスクに応じて推論動作を調整するアプリケーションが、視覚データがモデルに渡るかどうかも同時に変えてしまう可能性がある。ただし、ドキュメント自体は、この不具合やその原因を裏付けてはいない。公式ドキュメント
画像分析や視覚エージェントでは、ステータスコードだけを確認する監視では、この種の失敗を見逃す可能性がある。工学的な推論として、受け入れテストに固定画像の認識テストを加え、パラメータの有無による入力使用量と、回答が画像に即しているかを比較することが考えられる。トークン数の異常は調査の手掛かりにはなるが、それだけで画像の欠落を証明することはできない。報告に基づいてリクエスト単位の設定を一時的に外す場合も、グローバル設定がアプリケーションの要件を満たすことを確認する必要がある。
確認時点で、このissueは未解決で、ページには関連する修正やメンテナーによる確認は記載されていなかった。今後は、詳細ログ、ほかのモデルや量子化構成での再現結果、上流で入力処理経路を特定して回帰テストを追加できるかに注目したい。現時点で、この現象を量子化や特定のGPUに直接起因すると断定するのは適切ではない。issueの状態