本機推論
Ollama 0.32.14 在送入 llama-server 前轉碼 WebP,並放寬 Qwen system 訊息位置
新版修補兩個位於模型前處理層的相容性缺口:WebP 影像會先轉碼,Qwen renderer 亦不再要求 system 訊息必須排在最前。變更雖不涉及新模型或 kernel,卻可避免多模態及代理對話在進入推論核心前失敗。

Ollama 0.32.14 集中修補請求進入 `llama-server` 前的兩條轉換路徑。第一項變更會轉碼 WebP 影像,再交給底層伺服器處理。Ollama 的 vision API 允許在 chat message 的 `images` 欄位傳入影像路徑或內容;當上游應用直接接收網頁圖片、截圖服務或瀏覽器代理產物時,WebP 十分常見。若 API 層接受檔案、底層解碼器卻無法處理,故障會發生在視覺 encoder 之前,與模型權重或提示無關。新版把格式正規化放在 Ollama 與 llama-server 的邊界,讓呼叫端毋須各自增加轉檔分支。
第二項變更位於 Qwen chat renderer:它現在容許 system message 不在對話陣列第一項。傳統單輪聊天通常把 system prompt 固定在開頭,但代理框架在恢復歷史、插入政策提醒、壓縮上下文或跨代理交接時,可能於後段加入 system 訊息。舊有 renderer 若依賴「第一則必為 system」的版型假設,就可能拒絕請求或生成與預期不同的模板。放寬位置限制可提升非標準歷史的互通性,但不代表所有 Qwen 模型都以相同方式解讀中途 system 指令;應用仍應測試模板輸出與工具呼叫行為。
這是相容性修補而非推論效能更新。官方 release note 沒有公開 WebP 的目標編碼、額外記憶體與延遲成本,也沒有列出受影響模型矩陣。部署多模態 RAG 或瀏覽器代理的團隊,升級後應以透明 WebP、動畫 WebP、大尺寸圖片及多個 system 訊息的保存對話做回歸測試,並確認輸出 token 與工具參數沒有因模板變更而漂移。