返回首頁

模型壓縮與 CPU 推論

CompactifAI 將 Llama 3.3 70B 壓縮至約 65 GiB,以 vLLM CPU 在單顆 Xeon 6 執行

Multiverse Computing 公布經壓縮與修復訓練的 Llama 3.3 70B,可透過 vLLM CPU 和 Intel AMX 在 Xeon 6 上服務。官方測試顯示吞吐接近倍增,但每秒不到 4 個輸出 token,且檢查點與原始結果未公開。

Yuening Jia · CC BY-SA 3.0 · Image source
zh-Hant

Multiverse Computing 將 CompactifAI 壓縮版 Llama 3.3 70B 接上 vLLM 的 CPU 後端,目標是在沒有加速卡的 Intel Xeon 6 伺服器部署大型模型。公司表示模型檔案由約 130 GiB 縮至 65 GiB;其方法不只量化,而是以張量網路削減模型表示,再進行「healing」修復訓練。服務層使用 vLLM CPU,矩陣運算則利用 Xeon 的 Advanced Matrix Extensions(AMX)。vLLM 官方文件亦確認 Intel Xeon 是其 CPU 支援路徑之一,但 CompactifAI 檢查點並非 vLLM 上游提供。

測試機只有一顆 32 核、64 執行緒的 Xeon 6737P 與約 1 TB 記憶體,tensor parallelism 設為 1。使用固定 1,024 個輸入與 1,024 個輸出隨機 token 時,單一並行請求的輸出吞吐由 2.00 提升至 3.86 token/s,總 token 吞吐由 4.02 升至 7.81 token/s;平均 TTFT 從 6.94 秒降至 3.71 秒,TPOT 從 494.71 毫秒降至 255.76 毫秒。測試延伸至 256 個並行使用者,官方宣稱最高吞吐增幅為 107%。

品質方面,BoolQ、GSM8K、HellaSwag 與 MMLU 分數分別下降約 0.95% 至 2.48%,WinoGrande 則上升 6.86%;後者可能來自修復訓練,也可能反映評測波動或模板敏感性。這項發布證明 70B 級模型可被塞進單路 CPU 伺服器,但不代表互動體驗已接近 GPU:不到 4 token/s、數秒 TTFT,較適合低速批次、資料主權或備援情境。公司雖列出方法與負載設定,仍未公開壓縮權重、命令列、容器版本及原始 JSON;工程團隊下一步應要求可下載產物,並以真實提示長度、KV cache 壓力、尾延遲、能耗和每請求成本重測。

來源

  1. All CompactifAI Models Now Run on Intel Xeon 6 Processors
  2. CompactifAI: Extreme Compression of Large Language Models using Quantum-Inspired Tensor Networks