AI 基礎設施
ROCm 10 將代理式核心最佳化推向正式版,但升級同時帶來 ABI 斷裂與已知故障
AMD 發布 ROCm 10,並讓整合 Hyperloom、AMD Skills 與統一 CLI 的 ROCm.AI 正式可用。官方宣稱同硬體推論與訓練平均提升 3.3 倍及 2.4 倍,但數字涵蓋整套最佳化流程,不能視為單純升級執行環境的收益。

AMD 於 8 月 27 日發布 ROCm 10,重點不只是版本號跳升,而是把 ROCm.AI 從預覽推進一般可用。這套開發層由 Hyperloom、AMD Skills 與 ROCm CLI 組成:Hyperloom 先透過追蹤與 roofline 分析找出主機程式、記憶體調度或 GPU kernel 的瓶頸,再搜尋、實作及驗證最佳化;目前可處理 vLLM、SGLang 工作負載,並以 HIP、Triton或 FlyDSL 產生修改。Skills 則把 AMD 的除錯、部署與效能流程帶入 Codex、Claude Code及 Cursor。
仍屬技術預覽的 ROCm CLI 可在 Windows、Linux 建立並切換多個受管理的 ROCm 環境,也能執行模型服務、診斷與回滾。AMD 宣稱「配置 ROCm.AI 的系統」相較同硬體 ROCm 7,平均推論及訓練效能分別提高 3.3 倍與 2.4 倍;這是結合 kernel、記憶體和排程最佳化的系統結果,不代表既有程式換套件後會自動獲得同等加速。
底層 Core SDK 已改採 TheRock 建置系統,並擴大 Instinct 虛擬化、HIP API、profiling 與通訊函式庫支援。升級風險也很具體:AMD SMI 的 SONAME 升至 `libamd_smi.so.27`,部分資料欄位及 API 不相容,依賴舊 ABI 的監控程式必須重編;官方另列出 MI350X 訓練吞吐可能倒退、部分 Radeon 上 PyTorch 可能重設 GPU、SGLang 的 AITER 後端可能失敗,以及 Ryzen AI 執行 vLLM 或 ComfyUI 可能崩潰。工程團隊應先以實際模型與序列長度重跑正確性、吞吐和穩定性測試,再評估代理生成的最佳化是否適合併入正式分支。