AI API/推論成本
DeepSeek V4 API 改採尖峰計價,Pro 快取命中單價最高升至原來 12.1 倍
DeepSeek 已為 V4 Flash 與 Pro 啟用分時費率,尖峰時段價格是離峰兩倍。受衝擊最大的不是一般輸入,而是長對話與程式代理大量使用的快取命中 token。

DeepSeek 在 8 月 16 日 16:00 UTC 啟用新版 V4 API 計價,把原本全天固定費率改為尖峰與離峰兩級。官方文件列出的尖峰時段為每日 01:00–04:00、06:00–10:00 UTC;其餘時間半價。V4 Pro 每百萬輸出 token 現為離峰 1.98 美元、尖峰 3.96 美元,cache miss 輸入為 0.66/1.32 美元;V4 Flash 對應價格則為輸出 0.66/1.32 美元、cache miss 0.22/0.44 美元。
工程上更值得注意的是 cache hit。Pro 舊價每百萬 token 0.003625 美元,新離峰價 0.022 美元,約為原來 6.1 倍;尖峰 0.044 美元,約為 12.1 倍。Flash 也由 0.0028 美元升至 0.007/0.014 美元。這會改寫代理成本模型:程式代理通常反覆傳送大型 system prompt、工具定義、程式庫內容與歷史訊息,因此帳單可能主要由快取讀取量,而非新輸入或輸出決定。
一名社群使用者以 650 次真實請求、1.559 億輸入 token 重算,稱其 98.09% 快取命中的工作負載成本約增至 2.7 倍;這只是單一實例,不能外推所有服務,卻說明只比較 headline input/output 價格會低估代理成本。團隊應依實際 usage 欄位重播帳單,分開統計 hit、miss、output 與 UTC 時段;可延遲的批次評測及資料處理則應考慮排到離峰。快取仍比 miss 便宜得多,因此不應盲目停用,下一步要觀察網關能否感知分時價格,以及模型供應商是否調整第三方轉售費率。