返回首頁

AI 基礎設施

ROCm 10 將代理式核心最佳化推向正式版,但升級同時帶來 ABI 斷裂與已知故障

AMD 發布 ROCm 10,並讓整合 Hyperloom、AMD Skills 與統一 CLI 的 ROCm.AI 正式可用。官方宣稱同硬體推論與訓練平均提升 3.3 倍及 2.4 倍,但數字涵蓋整套最佳化流程,不能視為單純升級執行環境的收益。

Thornbury, Walter, 1828-1876 · No restrictions · Image source
zh-Hant

AMD 於 8 月 27 日發布 ROCm 10,重點不只是版本號跳升,而是把 ROCm.AI 從預覽推進一般可用。這套開發層由 Hyperloom、AMD Skills 與 ROCm CLI 組成:Hyperloom 先透過追蹤與 roofline 分析找出主機程式、記憶體調度或 GPU kernel 的瓶頸,再搜尋、實作及驗證最佳化;目前可處理 vLLM、SGLang 工作負載,並以 HIP、Triton或 FlyDSL 產生修改。Skills 則把 AMD 的除錯、部署與效能流程帶入 Codex、Claude Code及 Cursor。

仍屬技術預覽的 ROCm CLI 可在 Windows、Linux 建立並切換多個受管理的 ROCm 環境,也能執行模型服務、診斷與回滾。AMD 宣稱「配置 ROCm.AI 的系統」相較同硬體 ROCm 7,平均推論及訓練效能分別提高 3.3 倍與 2.4 倍;這是結合 kernel、記憶體和排程最佳化的系統結果,不代表既有程式換套件後會自動獲得同等加速。

底層 Core SDK 已改採 TheRock 建置系統,並擴大 Instinct 虛擬化、HIP API、profiling 與通訊函式庫支援。升級風險也很具體:AMD SMI 的 SONAME 升至 `libamd_smi.so.27`,部分資料欄位及 API 不相容,依賴舊 ABI 的監控程式必須重編;官方另列出 MI350X 訓練吞吐可能倒退、部分 Radeon 上 PyTorch 可能重設 GPU、SGLang 的 AITER 後端可能失敗,以及 Ryzen AI 執行 vLLM 或 ComfyUI 可能崩潰。工程團隊應先以實際模型與序列長度重跑正確性、吞吐和穩定性測試,再評估代理生成的最佳化是否適合併入正式分支。

來源

  1. AMD ROCm 10: Bringing ROCm.AI’s AI-Native Developer Experiences to AMD Platforms
  2. ROCm Core SDK 10.0.0 release notes
  3. ROCm Hyperloom repository
  4. AMD Jumps From ROCm 7.14 To ROCm 10.0 With ROCm.AI