返回首頁

模型發布與開發者API

DeepSeek-V4-Pro 進入 GA:代理評測上升,API 原生支援 Responses 格式

DeepSeek 將 V4-Pro-0813 推至正式版,既有 `deepseek-v4-pro` 名稱會直接指向新版。新版強化程式代理與工具操作,並加入 OpenAI Responses API 相容層,但公開分數仍主要來自官方 harness。

Unknown authorUnknown author · Public domain · Image source
zh-Hant

DeepSeek 於8月13日把 DeepSeek-V4-Pro 從預覽版推進至 GA,部署範圍涵蓋網頁、App 與 API。既有應用不必更換模型識別字,`deepseek-v4-pro` 會直接路由至0813版本;這種原地升級雖降低遷移成本,卻也意味著需要可重現行為的團隊應立即固定測試集、保存回覆與工具軌跡,避免把版本變動誤判為提示或代理程式退化。

GA 更新的重點是代理後訓練。DeepSeek 報告 Terminal-Bench 2.1 達87.9,較預覽版72.1提高15.8點;NL2Repo 由38.5升至61.5,CyberGym 由52.7升至83.3,DeepSWE 由12.8升至62.7,Toolathlon-Verified 則達74.1。這些基準分別涵蓋終端操作、由規格建立儲存庫、漏洞重現與工具使用,增幅方向一致,但不同基準使用的代理框架、時間限制和推理預算並不相同,尚不能證明所有生產工作流都會同比改善。

模型底層仍是1.6兆總參數、每 token 啟用490億參數的 MoE,支援一百萬 token 上下文。技術報告描述其以 CSA 與 HCA 組成混合稀疏注意力;在一百萬 token 設定下,官方估算單 token 推論 FLOPs 為 V3.2 的27%,KV cache 為10%。後訓練先以 SFT 與 GRPO 培養不同領域專家,再用 on-policy distillation 合併能力。公開權重採 MIT 授權,MoE expert 主要使用 FP4、其餘多為 FP8,完整部署仍需要相當大的多卡或叢集資源。

API 同時原生支援 OpenAI Responses 格式並針對 Codex 類代理整合,減少自行轉換串流工具呼叫與推理欄位的工作。工程端下一步應驗證 Responses 與 Chat Completions 的工具語意是否完全一致、長工具迴圈能否保留 reasoning 狀態,以及官方 GA 分數能否由第三方在相同 token 與時間預算下重現。

來源

  1. DeepSeek API change log
  2. DeepSeek-V4-Pro model card and weights
  3. DeepSeek-V4 technical report