推論系統
Colibrì 把兆級 MoE 權重分層放進 VRAM、RAM 與 NVMe,但低記憶體不等於高速推論
近期社群熱度上升的 Colibrì,以純 C 引擎按需載入稀疏專家,讓 744B 至 2.8T 參數模型可在非資料中心硬體啟動。它降低的是模型常駐記憶體門檻,實際解碼速度仍高度受 SSD 頻寬、專家命中率與量化品質限制。

Colibrì 近期因支援更多前沿 MoE 模型而重新受到技術社群關注。它目前列出 GLM‑5.2/5.3、Inkling、Kimi K3、DeepSeek V4、Qwen3.8 Flash Next 等九個家族,核心做法不是把全部權重擠進記憶體,而是把 VRAM、RAM 與 NVMe 視為同一套分層儲存。以 744B 的 GLM‑5.2 為例,約 17B 的稠密部分以 int4 常駐約 9.9 GB RAM,近兩萬個路由專家則留在約 370 GB 的磁碟容器中,只在被 gate 選中時讀取。
為減少每個 token 等待磁碟,執行時會記錄專家熱度、建立逐層 LRU 與固定熱門區,並讓路由器提前一層預取。相同 batch 內重複選中的專家只讀一次;雙 SSD 模式則以確定式雜湊分配唯讀權重,讀取失敗時回退主磁碟。專案也實作 CUDA、HIP、Metal、Vulkan、NUMA 與 CPU kernel,並把 MTP 推測解碼、壓縮 MLA KV cache 和持久化對話狀態放入同一引擎。
這項設計的工程價值在於分離「能否載入」與「是否夠快」。官方紀錄顯示,25 GB 開發機冷啟解碼只有約 0.05 至 0.1 token/s;128 GB CPU 桌機暖機後約 1.8 token/s;六張 RTX 5090 全常駐才達約 5.8 至 6.8 token/s。數字來自不同機器與工作負載,不能當成橫向排行榜。
部署者還要注意,推薦的 GLM‑5.2 容器本身約 372 GB,舊式逐列 int4 版本在專案測試中損失約九個百分點品質;MTP head 若量化成 int4,接受率也可能接近零。下一步應觀察社群能否在固定模型、提示、快取狀態與硬體上重現效能,以及熱度學習是否會對單一工作負載過度擬合。