返回首頁

推論系統

Liquid AI 為 LFM2.5 加入 DSpark 草稿模型,單張 H100 解碼最高加速 3.18 倍

Liquid AI 釋出三款約 3 億參數的 DSpark 草稿模型,讓 LFM2.5 以推測解碼一次驗證多個候選 token。單批、貪婪解碼測試最高加速 3.18 倍,但 SGLang 支援仍在開放中的 PR,部署成熟度有待驗證。

NASA · Public domain · Image source
zh-Hant

Liquid AI 8 月 20 日為 LFM2.5-1.2B-Instruct、2.6B 與 8B-A1B 釋出 DSpark 草稿模型,並提供 Safetensors、GGUF、llama.cpp 及 SGLang 整合。這不是量化或修改主模型,而是在解碼時先由約 2.96 億至 3.28 億參數的輕量模型提出最多一組候選 token,再讓目標模型以一次前向運算批次驗證。

DSpark 的草稿器結合平行 backbone、描述相鄰 token 依賴的序列式 Markov head,以及按存活機率刪去低信心後綴的 verifier。這處理了純平行草稿器常見的問題:候選序列愈長,後段 token 因缺乏前文依賴而愈容易被拒絕,驗證失敗候選反而浪費運算。

Liquid AI 以 batch size 1、temperature 0 測試。8B-A1B 在 H100 80GB 的 MATH500 從 428 提升至 1,362 token/s,即 3.18 倍;但其 M4 Max 平均僅加速 1.18 倍,團隊歸因於 llama.cpp 的 MoE Metal 實作及多 token 驗證會啟動更多專家。2.6B 在 H100、M4 Max 的五項測試平均分別加速 2.67 與 2.27 倍,多工具情境延遲平均降低 57%。

貪婪解碼下,候選只有與目標模型分布相符才會被接受,拒絕時改用主模型 token,因此輸出可與基線一致。不過這項「品質不變」結論不能直接外推至有溫度取樣、長上下文、多使用者並行或記憶體受限服務。SGLang 的 LFM2 支援 PR 截至查核時仍未合併,工程團隊應先重測自身提示分布的接受長度、峰值記憶體及併發吞吐,再決定是否投入正式環境。

來源

  1. Up to 3.2x Faster Inference with LFM2.5-DSpark
  2. DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
  3. Add LFM2 and LFM2-MoE DSpark speculative decoding support