返回首頁

AI 推論基礎設施

MoAI 在 32 張 MI300X 上展示 GLM-5.1,將異質 GPU 路由與推理解耦整合成單一服務

Moreh 展示以四節點、32 張 AMD MI300X 執行 GLM-5.1 的分散式推論服務,現場同步呈現 TTFT、TPOT 與 GPU 使用率。MoAI 進一步主張可跨不同廠牌拆分 prefill 與 decode,但最新展示未公開完整吞吐數據或可重現設定。

Daehan · CC BY-SA 4.0 · Image source
zh-Hant

韓國 AI 基礎設施公司 Moreh 在 AMD Advancing AI 2026 現場展示 MoAI Inference Framework,以四個節點、共 32 張 AMD Instinct MI300X GPU 提供 GLM-5.1 聊天推論。展示介面不只輸出答案,也即時顯示 GPU 使用率、每秒 token 數、首 token 延遲(TTFT)及每個輸出 token 延遲(TPOT),讓觀察者能區分提示處理與逐 token 生成的效能,而不只看單一平均速度。

MoAI 的技術定位是資料中心級推論控制層。它可把計算量大、平行度高的 prefill 與受記憶體頻寬限制的 decode 分配到不同 GPU 池,再依前綴快取命中、請求長度、裝置效能及服務等級目標進行路由。官方文件列出的底層引擎包括 Moreh 修改版 vLLM、上游 vLLM 與 SGLang;支援清單則橫跨 NVIDIA、AMD 與 Tenstorrent 加速器。配套 Performance Gateway 負責請求分配,MoAI Fabric 處理跨裝置 KV cache 傳輸,未來的 Autopilot 則預定依流量與延遲限制自動選擇平行策略和資源配置。

這種設計值得注意,因為企業機房常同時保有多代、甚至多廠牌加速器;若能把既有 GPU 用於 prefill 或特定長度工作負載,就可能降低為單一模型全面換機的成本。Moreh 官網宣稱跨廠牌 prefill-decode 解耦可帶來 1.7 倍吞吐,前綴快取路由最高可將 TTFT 降低 20 倍,但這些數字來自不同情境,不能視為本次 GLM-5.1 展示結果。新聞稿沒有公布模型精度、量化格式、批次分布、網路拓撲或實測 TPS,因此目前證明的是系統已能運作,而不是已建立可公平比較的效能領先。後續應關注公開部署設定、故障切換,以及異質節點間搬移 KV cache 是否會在長上下文流量下成為新瓶頸。

來源

  1. MOREH Showcases High-Performance LLM Inference on AMD GPUs at AMD Advancing AI 2026
  2. MoAI Inference Framework
  3. MoAI Inference Framework documentation