返回首頁

模型發布

LFM2.5‑VL‑3B 以約 3GB 記憶體執行視覺模型,原生支援 vLLM、llama.cpp 與 MLX

Liquid AI 發布 3.1B 參數的 LFM2.5‑VL‑3B,加入畫面定位、版面 OCR、多圖理解與函式呼叫能力。官方在 Apple M5 Max 測得 228 token/s,單張 H100 高併發吞吐約 11,000 token/s,但數據尚待獨立重現。

NASA · Public domain · Image source
zh-Hant

Liquid AI 在 8 月 13 日公開 LFM2.5‑VL‑3B 權重與多種部署格式,定位不是長鏈推理模型,而是可在終端裝置執行的低延遲視覺語言模型。其語言骨幹為 LFM2.5‑2.6B,搭配約 400M 參數的 SigLIP2 NaFlex 視覺編碼器,總規模約 3.1B;上下文長度為 32,768 token,支援中文等 16 種語言。大圖會切成互不重疊的 512×512 區塊,並額外加入整圖縮圖,以保留原生長寬比與局部細節。

工程層面的主要更新是部署路徑已同時涵蓋 Transformers、vLLM、SGLang、llama.cpp、MLX、ONNX 與 GGUF。模型亦能輸出含區域類型、正規化座標及內容的版面 OCR 結果,並以特殊 token 表達函式呼叫。Liquid AI 報告 ScreenSpot‑v2 平均分數為 80.7,RefCOCO Precision@1 由前代的 57.1 升至 87.9;ToolSandbox 則由 26.4 升至 59.5。這使它較適合本機文件擷取、介面定位、攝影機影像分類及需要視覺輸入的輕量工具代理。

效能數據需要按測試條件解讀。官方稱模型占用不足 3.3GB,在 M5 Max、Ryzen AI Max+ 395 與 Galaxy S26 Ultra 分別達 228、116 及 20 token/s;H100 的約 11,000 token/s 則是在 vLLM 0.26、BF16、高併發持續負載、單張 512×512 圖像、1,024 個輸入 token 與最多 256 個輸出 token 下量得,並非單一互動請求速度。模型卡也明言不建議用於長上下文推理、視覺網頁設計或複雜藍圖問答,實驗性的版面格式仍可能改動。開發者下一步應重測中文 OCR、量化後定位精度及不同影像尺寸的記憶體峰值;其權重採用自訂 LFM 1.0 授權,也應在商用前逐條核對,而不能僅以「open-weight」推定等同 Apache 或 MIT。

來源

  1. LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge
  2. LiquidAI/LFM2.5-VL-3B Model Card
  3. LiquidAI/LFM2.5-VL-3B community release thread