模型與開發者平台
微軟推出 MAI-Image-2.5-Pro 與 MAI-Voice-2-Flash,以自研模型切分品質與成本曲線
微軟將最高畫質的影像生成模型與高吞吐語音模型同步帶入 Foundry 公開預覽,分別瞄準精細編輯及即時語音代理。官方公布多項產品環境成本與延遲數據,但跨供應商比較仍缺乏一致、可重現的測試條件。

微軟在 7 月 23 日開放預覽 MAI-Image-2.5-Pro 與 MAI-Voice-2-Flash,把同一家族拆成兩個不同的部署取向。Image-2.5-Pro 主攻英雄圖、局部編輯與圖中文字,Foundry 定價為每百萬文字輸入 token 5 美元、影像輸入 token 8 美元、影像輸出 token 106 美元;Voice-2-Flash 則面向客服及即時語音代理,價格為每百萬字元 15 美元。微軟宣稱後者比 MAI-Voice-2 快兩倍、便宜 32%,並保留自然韻律與聲學品質。
這次更新的技術重點不只是新增 API 型號,而是微軟開始用自研模型覆蓋完整產品資料面。Bing Image Creator 已預設完全採用 MAI-Image-2.5;OneDrive 上線後,官方觀察到儲存率提高 26%、P95 延遲下降約 25%。PowerPoint 的影像工作負載據稱比 GPT-Image-2 少用最多 84% GPU 成本,Dynamics 365 Contact Center 改用 Voice-2-Flash 後則節省最多 89%。這些數字來自實際產品遙測,比單一公開榜單更接近工程決策,但微軟未披露流量組成、硬體、品質門檻或比較模型版本。
影像模型卡顯示,基礎版 MAI-Image-2.5 的文字轉圖整體 Elo 為 1254,文字呈現項目為 1278;評測依賴盲測者偏好,不能直接證明 Pro 版本在特定品牌、中文字型或高解析編輯工作流中的可靠性。開發者接下來應實測首包延遲、併發限制、語音串流中斷恢復、人物一致性及安全過濾誤判,並注意 Pro 的影像輸出價格明顯高於同系列一般版。