端側 AI 與評測
Pipette 開源端側模型評測:同時量化精度、延遲與記憶體,但跨裝置排名仍不可直接比較
Liquid AI 與 Artificial Analysis 公開 Pipette,以逾千組模型、量化、執行期、裝置及上下文配置測量端側推論。速度和記憶體在實機量測,品質分數卻在 H100 上另行產生,讀取綜合圖表時必須區分兩條測試路徑。

Liquid AI 與 Artificial Analysis 8 月 24 日推出 Pipette,試圖補上模型卡最常缺少的一層:模型量化後,在特定手機、作業系統和推論執行期上的實際表現。首批資料涵蓋逾 1,000 組「模型 × 量化 × runtime × 裝置 × 上下文」配置、30 多款模型,以及 256 至 8,192 token 的上下文長度;客戶端和管理、評分元件均以 Apache 2.0 授權公開。
Pipette 不只量每秒輸出 token。其固定輸入與輸出長度、停用提示快取和提早停止,丟棄一次暖機後重複量測五次,並在執行前檢查溫度及系統負載。提交紀錄保存模型 artifact、量化格式、runtime 版本、旗標、硬件與作業系統,讓同一模型名稱下的不同部署產物不會被混為一談。Rust 客戶端目前可連接 llama.cpp、MLX、OpenVINO、vLLM 和 SGLang,另有原生 iOS 與 Android 應用程式。
首批 iPhone 17 Pro 結果顯示,41 個量化構建中有 33 個能成功運行。LFM2.5-2.6B 在標準 1,024-token 輸入、256-token 輸出測試中需 8.0 秒及 2.3GB 記憶體;同分的 Nanbeige4.2-3B 則需 21.4 秒及 4.0GB,說明品質相近不代表部署成本相近。
最大的解讀陷阱是品質與效能並非同一次端側執行:BFCL、IFBench、AA-Omniscience、GPQA Diamond 和 MATH-500 的品質評估使用相同量化構建,但在 H100 參考系統上產生;裝置只負責速度和記憶體測量。此外,iOS 採 Metal,現有 Android 路徑主要使用 CPU,記憶體計數方式和散熱條件亦不同。現階段最可靠的是同一裝置內比較配置,而非用排行榜宣稱某款手機或 runtime 全面領先。