返回首頁

多模態模型與 API

DeepSeek V4-Flash-Vision-Exp 開放圖片輸入,1M 上下文但仍屬 API 實驗版

DeepSeek 為 V4-Flash 加入圖片理解,可透過三種相容介面處理文字與影像,並維持原有 Flash 計價。官方公布的代理評測成績仍缺乏獨立重現,模型權重與視覺架構也未公開。

Unknown authorUnknown author · Public domain · Image source
zh-Hant

DeepSeek 8 月 21 日在官方 API 上線 `deepseek-v4-flash-vision-exp`,為原本偏重文字與程式代理工作的 V4-Flash 系列補上圖片輸入。模型接受 JPEG、PNG、GIF 與 WebP,開發者可把圖片寫成 Base64、提供公開網址,或先上傳至 Files API,再透過 Chat Completions、Messages 或 Responses 介面送入;輸出仍只有文字。

規格頁列出 100 萬 token 上下文及最高 38.4 萬 token 輸出。圖片會先縮放並轉成視覺 token,單張最多約 384 token;低解析度模式則適合只需粗略辨識的代理。圖片只能出現在使用者訊息,既有應用若把附件掛在 system 或 assistant role,會直接收到請求錯誤。這些限制意味著「相容 OpenAI 格式」不等於任何既有用戶端都能即插即用:模型目錄及 provider adapter 也必須把輸入模態明確標成 `text, image`。

DeepSeek 自報 Terminal-Bench 2.1 為 83.9、NL2Repo 為 57.7、DeepSWE 為 59.3,並稱純文字能力與 V4-Flash 相若。測試使用 DeepSeek Harness minimal mode、最高推理強度及指定取樣設定,因此分數同時反映模型和代理鷹架,不能直接視為裸模型能力;多項基準本身也不是純視覺測試。

工程上的吸引力是可讓同一代理處理終端截圖、圖表和文件頁面,而毋須額外串接 OCR 或另一個 VLM。模型目前仍帶有 `-exp` 後綴,而且只提供 API:DeepSeek 沒有公開權重、視覺編碼器、投影層、訓練配方或圖片 token 佈局。團隊應先以真實文件測量小字、密集表格及多圖排序的準確度,保留文字模型後備路由,並避免把官方自報成績當成生產穩定性保證。

來源

  1. DeepSeek-V4-Flash-Vision-Exp Release
  2. DeepSeek Vision Input Guide
  3. DeepSeek Harness discussion: image requests and API readiness