模型發布與開發者API
DeepSeek-V4-ProがGA提供開始:エージェント評価が向上、APIがResponses形式をネイティブサポート
DeepSeekはV4-Pro-0813を正式版としてリリースし、既存の`deepseek-v4-pro`という名称は新版を直接参照する。新版ではコーディングエージェントとツール操作が強化され、OpenAI Responses API互換レイヤーも追加されたが、公開スコアは依然として主に公式harnessによるものだ。

DeepSeekは8月13日、DeepSeek-V4-Proをプレビュー版からGAへ移行し、Web、App、APIで提供を開始した。既存アプリケーションでモデル識別子を変更する必要はなく、`deepseek-v4-pro`は0813バージョンへ直接ルーティングされる。このインプレースアップグレードは移行コストを抑える一方、再現可能な挙動を必要とするチームは、バージョン変更をプロンプトやエージェントプログラムの性能劣化と誤認しないよう、直ちにテストセットを固定し、応答とツール実行トレースを保存する必要がある。
GAアップデートの重点は、エージェント向けのpost-trainingだ。DeepSeekの報告によると、Terminal-Bench 2.1はプレビュー版の72.1から15.8ポイント上昇して87.9に達した。NL2Repoは38.5から61.5、CyberGymは52.7から83.3、DeepSWEは12.8から62.7へ向上し、Toolathlon-Verifiedでは74.1を記録した。これらのベンチマークは、それぞれターミナル操作、仕様に基づくリポジトリ構築、脆弱性の再現、ツール使用を対象としており、改善傾向は一貫している。ただし、ベンチマークごとに使用されるエージェントフレームワーク、時間制限、推論予算は異なるため、すべての本番ワークフローで同程度の改善が得られることを証明するものではない。
基盤モデルは引き続き、総パラメータ数1.6兆、tokenごとに490億パラメータを有効化するMoEで、100万tokenのコンテキストをサポートする。技術レポートでは、CSAとHCAを組み合わせたハイブリッド疎注意機構を採用していると説明されている。100万tokenの設定では、公式推定によるtokenあたりの推論FLOPsはV3.2の27%、KV cacheは10%となる。post-trainingでは、まずSFTとGRPOによって各分野の専門モデルを育成し、その後on-policy distillationで能力を統合する。公開weightはMIT Licenseで提供され、MoE expertには主にFP4、それ以外の大部分にはFP8が使用されているが、完全なデプロイには依然として大規模なマルチGPU環境またはクラスタリソースが必要だ。
APIはOpenAI Responses形式をネイティブサポートし、Codex系エージェントとの統合にも最適化されているため、ストリーミングされるtool callやreasoningフィールドを独自に変換する作業を削減できる。エンジニアリングチームは次に、ResponsesとChat Completionsでツールのセマンティクスが完全に一致するか、長時間のツールループでもreasoningの状態を保持できるか、また公式GAスコアを第三者が同一のtoken予算と時間予算で再現できるかを検証すべきだ。