返回首頁

GitHub Repo

vLLM 社群回報圖片輸入靜默遺失,逐請求思考設定可能影響視覺理解

vLLM 0.30.0 的社群案例顯示,圖片請求加入 chat_template_kwargs 後,模型可能只收到文字,伺服器仍回傳成功。問題尚待上游確認,結合視覺輸入與思考模式控制的部署應驗證實際輸入。

Large Language Models, Knowledge Graphs and Search Engines: A Crossroads for Answering Users' Questions, by Aidan Hogan, Xin Luna Dong, Denny Vrandečić, Gerhard Weikum, https://arxiv.org/abs/2501.06699v1 · CC BY 4.0 · Image source
zh-Hant

10 月 3 日,vLLM 社群提出一項多模態輸入回報:在 /v1/chat/completions 請求加入 chat_template_kwargs 後,圖片可能從模型輸入中消失,但端點仍回傳 HTTP 200,且沒有錯誤或警告。案例使用 vLLM 0.30.0、NVFP4 量化的 Gemma-4-26B-A4B,以及 RTX PRO 4500 Blackwell。這是特定配置的使用者回報,尚不能推定所有視覺模型均受影響。問題回報

回報者提供兩組對照請求:相同圖片與文字,不帶逐請求模板參數時,提示 token 數為 276,模型能描述圖片;加入 enable_thinking: true 後,提示 token 數降至 22,回答表示沒有收到圖片。將設定改為 false,或使用一張、三張圖片,也出現相同現象。值得注意的是,伺服器原本已設定思考模式為 true,因此逐請求重複指定相同值,仍改變了輸入結果。對照測試

官方文件將這項參數列為正常的思考控制介面:部署者可用 --default-chat-template-kwargs 設定全域預設,客戶端則以逐請求參數優先覆寫。文件也說明,Gemma 4 可透過 enable_thinking 啟用思考。這使回報具有實務意義:應用程式按任務調整推理行為時,可能同時改變視覺資料是否進入模型;但文件本身並未證實這項缺陷或其成因。官方文件

對圖片分析與視覺代理而言,這類失敗可能逃過只檢查狀態碼的監控。工程上的推論是,驗收應加入固定圖片的辨識測試,並比較帶參數與不帶參數的輸入用量、回答是否符合圖片;token 數異常可作為調查線索,不能單獨證明圖片遺失。依回報暫時移除逐請求設定,也須確認全域設定仍符合應用需求。

截至查核時,議題仍開放,頁面未列出關聯修補或維護者確認。下一步應關注完整日誌、其他模型與量化配置的重現結果,以及上游能否定位輸入處理路徑並加入回歸測試;目前不宜將現象直接歸因於量化或特定 GPU。議題狀態

來源

  1. vLLM Issue #59876:逐請求模板參數可能造成圖片輸入遺失
  2. vLLM Reasoning Outputs:伺服器預設與逐請求覆寫