ホームへ戻る

模型與推論

Mercury 2.5、拡散型テキスト生成を継承 第三者ゲートウェイでの実測スループットは公式ピーク値を下回る

Inceptionは、26万tokenのコンテキスト、調整可能な推論強度、並列ツール呼び出しを備えたMercury 2.5を発表した。純粋な自己回帰デコーディングに代わり、複数のtokenを反復的に修正する方式を引き続き採用する。公式発表では毎秒1,107 tokenとしているが、Vercel AI Gatewayのリアルタイム中央値は約616 tokenであり、導入者は自社のプロンプトと同時実行条件で改めて検証する必要がある。

NASA · Public domain · Image source
zh-Hant

Inceptionは9月8日、Mercuryシリーズの拡散型言語モデル路線を引き継ぐ[Mercury 2.5](https://www.inceptionlabs.ai/blog/introducing-mercury-2-5)をリリースした。従来の自己回帰型LLMは、左から右へ厳密に順序どおりtokenを生成する。一方、Mercuryは複数回のノイズ除去を通じて候補テキストを並列に修正し、デコーディング処理の一部を並列化しようとする。この設計は、検索エージェント、音声サービス、サブエージェント・ワークフローに特に適している。1回のユーザーリクエストに、クエリの書き換え、ルーティング、要約、構造化出力など複数の短い推論が含まれる場合、個々のレイテンシーがチェーン全体で累積するためだ。

新版は、26万tokenのコンテキスト、調整可能な推論強度、並列ツール呼び出し、指定されたschemaに準拠するJSONを提供する。Inceptionは、NVIDIA GPU上で毎秒1,107 tokenに達し、総合的な「知能」がMercury 2より40%向上したとしている。また同社によると、Augment Codeがコンテキスト圧縮に利用したところ、レイテンシーは約150秒から27秒に短縮された。ただし、パラメーター数、トレーニングデータ、ハードウェアの型番、バッチ設定、完全な評価手法はいずれも公開されていない。これらは依然としてベンダーおよび顧客が提示した結果であり、そのまま再現可能なベンチマークとみなすことはできない。

外部サービスには、より実務的な検証材料がある。[Vercel AI Gateway](https://vercel.com/ai-gateway/models/mercury-2.5)ではすでに、OpenAI Chat Completions、Responses、Anthropic Messages、AI SDKの各パスが提供されている。9月10日時点でページに表示されていたスループットの中央値は毎秒約616 token、最初のtokenまでのレイテンシーは約1.4秒で、公式のピーク値を明確に下回る。この差は必ずしもモデルまたはいずれかのテストの誤りを意味するものではなく、共有サービス、推論強度、コンテキスト長、バッチ、ネットワークオーバーヘッドに起因する可能性がある。

エンジニアリングチームは、token/sだけを比較するのではなく、最初のtokenまでのレイテンシー、定常状態のスループット、完了までの総時間、ツール呼び出しの正確性を個別に測定すべきだ。このモデルはAPI経由でのみ提供され、weightsは公開されていない。現在の価格にはローンチ時の80%割引も含まれているため、アーキテクチャ上の優位性、サービス層のキャパシティ、プロモーション価格を切り分けて評価する必要がある。

出典

  1. Introducing Mercury 2.5
  2. Mercury 2.5 API, Pricing & Playground
  3. Mercury: Ultra-Fast Language Models Based on Diffusion