返回首頁

開放模型與多模態推論

DeepSeek-V4-Flash-Vision-Exp 開放 305B 權重,但 vLLM 尚未能載入視覺張量

DeepSeek 在 API 上線十天後,以 MIT 授權公開首個 V4 多模態模型的權重、提示編碼器及最小 PyTorch 推論實作。模型卡雖顯示通用部署指令,vLLM 社群實測仍因 316 個視覺張量無對應模組而無法直接載入。

Unknown authorUnknown author · Public domain · Image source
zh-Hant

DeepSeek 已把 **DeepSeek-V4-Flash-Vision-Exp** 的 305B 參數權重放上 Hugging Face,補齊 8 月 21 日僅提供託管 API 的缺口。這是 V4 系列首個官方多模態版本:在 V4-Flash 上加入視覺編碼器與對齊模組,再持續訓練以處理圖片、文字及工具混合輸入;權重與參考程式採 MIT 授權。

公開內容不只 checkpoint。儲存庫包含 OpenAI 風格訊息至模型提示的編碼器,以及涵蓋 vision encoder、aligner、DFlash attention、MoE、Hyper-Connections 和 DSpark forward path 的最小 PyTorch 實作。它也讓 JSON 圖片內容區塊與 `<image>path</image>` 表記產生相同 token 序列,方便推論框架核對前處理結果。官方 API 則接受 base64、外部網址或 Files API,單張圖片最多按 384 token 計費。

DeepSeek 自評顯示,模型在 ApexBench Pass@1 得 36.5,較忽略圖像輸入的 V4-Flash-0731 的 26.2 高;ZeroBench Pass@5 為 35.0。文字代理評測並非全面進步,例如 Cybergym 從 76.7 降至 75.3,而且所有數字均使用 DeepSeek Harness、最高推理力度及指定取樣參數,不能直接外推至其他代理堆疊。

部署者尤其不應把 Hugging Face 頁面的自動產生 `vllm serve` 範例視為相容性證明。vLLM 新開的支援議題指出,現有路由會把 checkpoint 交給純文字類別,導致 316 個視覺張量找不到目的地。下一步應觀察正式 vLLM/SGLang 模型整合、顯存與多 GPU 拓撲需求,以及第三方能否重現多模態代理成績。

來源

  1. DeepSeek-V4-Flash-Vision-Exp model card and reference implementation
  2. DeepSeek-V4-Flash-Vision-Exp Release: Multimodal API Now Live
  3. vLLM feature request: DeepSeek-V4-Flash-Vision-Exp multimodal support