返回首頁

AI 基礎設施

OpenAI 公布 Jalapeño 實測:700W 推論 ASIC 在三款開放模型取得延遲與每瓦吞吐優勢

OpenAI 首次公開自研 Jalapeño 推論晶片的完整系統測試,稱其在 GPT‑OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 上同時改善延遲和每瓦吞吐。SemiAnalysis 到場核驗部分測試,但晶片仍是工程樣品,且尚未經長上下文、多回合 AgentX 負載驗證。

European Commission - Photographer: Aurore Martignoni · CC BY 4.0 · Image source
zh-Hant

OpenAI 公開首代自研推論 ASIC Jalapeño 的首批量測結果。測試採用 SemiAnalysis 的 InferenceX,以名義 8K 輸入、1K 輸出及單 token 預測(STP)運行 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T;比較指標不是單晶片峰值算力,而是符合指定延遲時,每千瓦能完成多少混合 token 工作。

Jalapeño 額定功耗為 700W,OpenAI 稱三組測試的持續功耗不超過 550W。相較所選 NVIDIA 系統,其尖峰每瓦吞吐提高 1.5 至 1.9 倍,端到端延遲降低 1.7 至 3.6 倍。DeepSeek R1 測試錄得每千瓦 19,641 mixed TPS,對照 GB300 為 11,781;最低 token 間延遲為 1.43ms,約等於每名使用者每秒 700 token。Kimi K2.5 的尖峰每瓦效能則約高 1.5 倍,端到端延遲低 3.4 倍。

架構重點是讓 prefill、decode、KV cache 與跨晶片通訊留在同一個可明確配置的系統域,減少模型狀態搬移。程式模型以本地 tensor、顯式通訊和可預測同步描述工作,方便編譯器及 AI 安排映射與排程。OpenAI 表示,Codex 配合 GPT‑Astra 在兩個月內完成三款額外模型的核心最佳化;部分 GPT‑OSS attention 與 MoE block 的 AI 生成實作比既有人工 kernel 快 1.5 至 1.8 倍,但這不是整體模型加速比。

結果仍需保守解讀。SemiAnalysis 到場觀察 InferenceX 執行,卻沒有獨立跑完整測試套件;原始數據由 OpenAI 提供,且 8K/1K 單回合負載未涵蓋真實代理的長上下文、共享前綴、路由和 KV-cache 壓力。Jalapeño 使用 HBM4,與已開始出貨的 Rubin 世代比較會比 Blackwell更合理。晶片目前不對外出售,OpenAI計畫年底前才開始內部部署;接下來應觀察量產良率、機架級功耗、AgentX 成績與生產服務可用率。

來源

  1. Jalapeño’s first results show industry-leading speed and efficiency in AI inference
  2. OpenAI Jalapeño: Better Than Nvidia Blackwell