ホームへ戻る

模型與開發者平台

Microsoft、MAI-Image-2.5-ProとMAI-Voice-2-Flashを発表、自社開発モデルで品質とコストの曲線を切り分け

Microsoftは、最高画質の画像生成モデルと高スループットの音声モデルをFoundryのパブリックプレビューで同時に提供開始し、それぞれ高精度な編集とリアルタイム音声エージェントをターゲットに据えた。公式は本番環境における複数のコストおよびレイテンシデータを公表したが、プロバイダー横断の比較には依然として一貫性と再現性のあるテスト条件が欠けている。

Steven C. Price · CC BY-SA 4.0 · Image source
zh-Hant

Microsoftは7月23日、MAI-Image-2.5-ProとMAI-Voice-2-Flashのプレビュー提供を開始し、同一ファミリーを異なるデプロイメント方針を持つ2つのモデルに分けた。Image-2.5-Proはヒーロー画像、部分編集、画像内テキストを主な用途とし、Foundryでの料金はテキスト入力100万token当たり5ドル、画像入力100万token当たり8ドル、画像出力100万token当たり106ドル。Voice-2-Flashはカスタマーサービスとリアルタイム音声エージェント向けで、料金は100万文字当たり15ドルとなる。Microsoftによると、後者はMAI-Voice-2の2倍高速で、32%安価でありながら、自然な韻律と音響品質を維持している。

今回のアップデートにおける技術上の要点は、単にAPIのモデルが追加されたことだけではない。Microsoftが、自社開発モデルによって製品のデータプレーン全体をカバーし始めた点にある。Bing Image Creatorでは、すでにMAI-Image-2.5が全面的にデフォルト採用されている。OneDriveへの導入後、Microsoftは保存率が26%向上し、P95レイテンシが約25%低下したことを確認した。PowerPointの画像ワークロードでは、GPT-Image-2と比べてGPUコストを最大84%削減できたとされ、Dynamics 365 Contact CenterではVoice-2-Flashへの切り替えにより最大89%のコストを削減したという。これらの数値は実際の製品テレメトリに基づくため、単一の公開ランキングよりもエンジニアリング上の意思決定に近い。ただしMicrosoftは、トラフィック構成、ハードウェア、品質基準、比較対象モデルのバージョンを開示していない。

画像モデルカードによると、ベースモデルのMAI-Image-2.5は、text-to-imageの総合Eloが1254、テキストレンダリング項目が1278だった。評価はブラインドテスト参加者の選好に依存しており、特定ブランド、中国語フォント、高解像度編集ワークフローにおけるPro版の信頼性を直接証明するものではない。開発者は今後、初回チャンクのレイテンシ、同時実行数の上限、音声ストリーミング中断後の復旧、人物の一貫性、安全フィルターの誤判定を実環境で検証すべきだ。また、Proの画像出力料金が同シリーズの通常版を明確に上回る点にも注意が必要である。

出典

  1. Introducing MAI-Image-2.5-Pro and MAI-Voice-2-Flash
  2. 微软最新模型 MAI-Image-2.5-Pro、MAI-Voice-2-Flash 发布