返回首頁

模型與推論

Mercury 2.5 延續擴散式文字生成,第三方閘道實測吞吐量低於官方峰值

Inception 發布具 26 萬 token 上下文、可調推理及平行工具調用的 Mercury 2.5,繼續以反覆修正多個 token 取代純自回歸解碼。官方宣稱每秒 1,107 token,但 Vercel AI Gateway 的即時中位數約為 616 token,部署者仍須用自身提示與併發條件重測。

NASA · Public domain · Image source
zh-Hant

Inception 在 9 月 8 日推出 [Mercury 2.5](https://www.inceptionlabs.ai/blog/introducing-mercury-2-5),延續 Mercury 系列的擴散式語言模型路線。傳統自回歸 LLM 嚴格按由左至右順序產生 token;Mercury 則以多輪去噪、平行修正候選文字,嘗試把部分解碼工作併行化。這種設計尤其適合搜尋代理、語音服務及子代理工作流:一次使用者請求可能包含查詢改寫、路由、摘要與結構化輸出等多次短推論,單次延遲會在整條鏈上累積。

新版提供 26 萬 token 上下文、可調推理強度、平行工具調用及符合指定 schema 的 JSON。Inception 宣稱模型在 NVIDIA GPU 上可達每秒 1,107 token,整體「智慧」較 Mercury 2 增加 40%;公司亦稱 Augment Code 將其用於上下文壓縮後,延遲由約 150 秒降至 27 秒。不過參數量、訓練資料、硬體型號、批次設定及完整評測方法均未公開,這些仍是供應商與客戶提供的結果,不能直接視為可重現基準。

外部服務面提供了一個較務實的校驗點。[Vercel AI Gateway](https://vercel.com/ai-gateway/models/mercury-2.5) 已暴露 OpenAI Chat Completions、Responses、Anthropic Messages 與 AI SDK 路徑;9 月 10 日頁面所示中位吞吐量約為每秒 616 token、首 token 延遲約 1.4 秒,明顯低於官方峰值。差距未必代表模型或任一測試錯誤,而可能來自共享服務、推理強度、上下文長度、批次與網路開銷。

工程團隊應分別量測首 token 延遲、穩態吞吐量、整體完成時間與工具調用正確率,不能只比較 token/s。模型僅透過 API 提供,未公開權重;價格目前亦包含 80% 上線折扣,因此架構優勢、服務層容量與促銷成本必須拆開評估。

來源

  1. Introducing Mercury 2.5
  2. Mercury 2.5 API, Pricing & Playground
  3. Mercury: Ultra-Fast Language Models Based on Diffusion