最新模型
Liquid AI 釋出視覺草稿模型,M5 Max 解碼測得最高 3.13 倍
約 2.8 億參數的 DSpark 草稿模型,為既有視覺語言模型加入推測解碼。官方主要測速採單批次、16 位元設定,整體收益仍受影像處理與併發負載影響。

Liquid AI 於 9 月 24 日釋出實驗性 LFM2.5-VL-3B-DSpark,為既有視覺語言模型增加約 2.8 億參數的草稿模型。它先提出候選 token,再由目標模型驗證,希望減少目標模型逐字解碼所需的呼叫次數。官方已提供權重及三套推論框架的整合入口。[發布公告](https://www.liquid.ai/blog/lfm2-5-vl-dspark)
草稿模型擷取目標模型不同層的隱藏狀態。影像與文字進入這些層時,已轉成共同維度的向量,因此可沿用文字版 DSpark 的推測流程。模型採四層架構,訓練區塊長度為九;推論依硬體使用八或九。新增參數約占目標模型的 8.9%,但這只是參數量比例,不能直接當成完整服務的記憶體增幅。[架構說明](https://huggingface.co/blog/LiquidAI/lfm2-5-vl-dspark)
模型卡列出六類視覺任務。在 M5 Max 搭配 MLX-VLM 的 COCO 測試中,解碼速度為基準的 3.13 倍,整體加速為 2.59 倍;TextVQA 則分別為 2.69 與 1.56 倍。這些 Apple 測試採 FP16、批次一、溫度零及區塊長度八。結果來自開發團隊測量,量化權重與高併發服務須另驗證。[測試表格](https://huggingface.co/LiquidAI/LFM2.5-VL-3B-DSpark)
整合也涉及模型介面的修改。9 月 22 日合併的 SGLang 修補,將頂層需要的輸出頭與隱藏層擷取介面,轉接至內部語言模型,避免服務啟動時找不到成員;輸出頭使用屬性轉接,以保留權重鍵名。該 PR 使用測試草稿權重的量測顯示,批次由八升至六十四時,加速從 1.55 倍降到 1.18 倍,說明併發提高後收益可能縮小。[整合與測速紀錄](https://github.com/sgl-project/sglang/pull/40651)
驗證結果也須區分演算法設計與實作。SGLang 該次測試的總輸出 token 數與基準不同,作者歸因於驗證形狀造成的數值差異;這份測試仍不足以證明所有回答品質等價,部署時應另行比對。[測試限制](https://github.com/sgl-project/sglang/pull/40651)
實際應用應分開觀察影像編碼、預填充與解碼時間。推測解碼只加速最後一段;若圖片處理占去大部分耗時,整體改善自然受限。工程師接下來應以中文圖表、文件問答及不同回答長度,量測候選接受率、首字延遲和總延遲,並核對輸出品質。模型卡另註明,MLX-VLM 的此路徑目前使用貪婪取樣,須設溫度零。[限制說明](https://www.liquid.ai/blog/lfm2-5-vl-dspark)、[執行設定](https://huggingface.co/LiquidAI/LFM2.5-VL-3B-DSpark)