返回首頁

資料中心基礎設施

Azure 將導入 AMD Helios,新增面向大型推論、資料管線與晶片設計的運算執行個體

Microsoft 計畫在 Azure 規模化部署 AMD Helios,並推出搭載第六代 EPYC 的 HDv2、HXv2 與 MI455X 推論執行個體。這是 GPU、CPU、DPU、網路與軟體共同設計的基礎設施更新,實際性價比仍待公開測試。

zh-Hant

Microsoft 與 AMD 擴大 Azure 基礎設施合作,核心是把 AMD Helios 機架級系統導入雲端,用於前沿模型、Azure AI 服務及客戶的大型推論。Helios 並非單一加速卡產品,而是整合 Instinct MI455X GPU、代號 Venice 的第六代 EPYC CPU、Pensando 網路元件與 ROCm 軟體的完整平台。AMD 表示將在 2026 年下半年開始向包括 Microsoft 在內的客戶出貨;Azure 對外提供的推論產品將以 ND MI455X v7 為主,鎖定推理、搜尋及代理型工作負載。

同一批更新也處理加速器以外的瓶頸。HDv2 面向資料準備、搜尋、強化學習及代理協調,規格包括接近 500 顆實體 EPYC 核心、4 TB 記憶體、32 TB 本機 NVMe 與 400 Gb Azure Boost 網路。HXv2 則針對 RTL 模擬、電子設計自動化與分散式科學運算,配置 176 顆 EPYC 核心、超過 5 GHz 時脈、每核心多 50% 可定址快取、接近 2 TB 或 4 TB 記憶體,以及 800 Gb InfiniBand。Azure 還將擴大部署 Pensando DPU,並與 Azure Boost 整合,把連線及部分網路處理從主機運算資源卸載。

技術意義在於,雲端 AI 的競爭單位正從 GPU 轉為整個機架與資料路徑。推論服務的吞吐量會同時受模型權重記憶體、節點內互連、跨節點網路、CPU 資料處理和排程軟體限制;Helios 若能在 Azure 形成可重複部署的標準配置,工程團隊便多了一條不同於單一供應商封閉堆疊的路徑。

不過,兩家公司尚未公布 ND MI455X v7 的價格、可用區域、正式上線日、功耗或經第三方驗證的每美元/每瓦推論數據。「規模化部署」也沒有公開機架數量。接下來應觀察 ROCm 的模型與核心支援、跨卡通訊穩定性、實際供貨,以及主流模型在長上下文、稀疏 MoE 和代理並行負載下的尾端延遲。

來源

  1. Microsoft expands Azure AI and HPC infrastructure with AMD
  2. Microsoft to Deploy Next-Gen AMD Instinct and AMD EPYC Processors