模型與程式代理
DeepSeek-V4-Flash 0731 只重做後訓練,Terminal-Bench 2.1 官方成績升至 82.7
DeepSeek 將重新後訓練的 V4-Flash 推入 API 公測,模型架構、284B 總參數與 13B 啟用參數均未改變。新版原生支援 Responses API,主打程式代理與工具使用,但關鍵測試依賴尚未公開的 DeepSeek Harness。

DeepSeek 7 月 31 日把正式版 DeepSeek-V4-Flash API 推入公測;呼叫端仍使用 `deepseek-v4-flash`,但後端已換成 V4-Flash-0731。這不是新的基礎模型:官方明確表示架構和規模均沿用預覽版,只重新進行後訓練。模型仍是 284B 總參數、每個 token 啟用 13B 的 MoE,支援 100 萬 token 上下文;官方模型卡提供混合 FP4/FP8 權重,MoE 專家採 FP4,其餘多為 FP8。
更新的重點是代理能力。DeepSeek 報告 Terminal-Bench 2.1 得分 82.7、CyberGym 76.7、Toolathlon Verified 70.3,另在 NL2Repo 與 DeepSWE 分別取得 54.2、54.4。API 也原生接受 Responses API 格式並針對 Codex 型工作流調整,降低現有程式代理改接端點時的協定轉換成本。官方同時強調,這次只更新 Flash API;V4-Pro、網頁版與 App 仍維持舊模型。
工程團隊不宜直接把表中數字視為可重現的模型能力。程式代理評測使用尚未發布的 DeepSeek Harness minimal mode,設定為最大推理強度、`top_p=0.95`、temperature 1.0;DSBench-FullStack 與 DSBench-Hard 更是內部題庫。較可信的下一步是等待 harness、完整軌跡與成本資料公開,再以相同容器、token 預算和重試政策比較其他模型。另一方面,後訓練就能在固定架構上大幅改變工具使用表現,也顯示代理部署的版本鎖定不能只記錄模型名稱,還應保存實際快照、系統提示與推理設定。