返回首頁

端側推論

smolperfbenchmark 公開端側 LLM 能效測試,但上線榜單暫時顯示零筆結果

新開源測試集把小模型放到 Jetson、Mac、樹莓派及 Android 裝置,量測解碼速度、每焦耳 token、延遲與溫度,而非只看資料中心 GPU 吞吐。作者宣稱已測約千組 Jetson 配置,但目前公開榜單未載入任何資料,使用者只能先從儲存庫報告與原始產物核對結果。

The GGML authors · Public domain · Image source
zh-Hant

smolperfbenchmark 在 9 月 12 日公開後於 LocalLLaMA 引起明顯討論,主張補上主流模型榜單忽略的端側維度:模型能否裝進 4GB、8GB 或 16GB 記憶體,以及在有限散熱與功率下實際產生多少 token。作者表示首批資料包含 13 個模型家族、約一千組 Jetson Orin Nano Super 8GB 配置,涵蓋吞吐、TTFT、ITL、端到端延遲、功耗與溫度。

相較只公布單一 tok/s,測試管線固定 prompt 與 generation 長度,以 aiperf 0.11.0、單一併發執行每個組合通常約二十次,再取延遲與吞吐的 p50。Jetson 測試鎖定 7W、15W、25W 或 MAXN 模式,透過 `tegrastats` 對齊電源與溫度紀錄;腳本可分別跑相同 GGUF 的 llama.cpp 與 Ollama。Mac 路徑則比較 llama.cpp Metal 和 MLX‑LM,並以 `powermetrics` 取樣 CPU、GPU 與 ANE 功耗。

這套設計的重要之處,是把 output tok/J 放在首頁。對常開的本地代理、離線 RAG 或電池裝置而言,最快模型未必是能源及散熱成本最低的模型。不過專案也明確承認,不同硬體的 tok/J 算法尚不一致:Jetson 與 Mac 採解碼階段能量,樹莓派則以整個測試窗的平均功率計算,因此不能直接跨裝置排名。

目前最大的問題是發布狀態與宣稱不一致。作者貼文及聚合頁仍寫有 13 個家族與約一千種配置,但 live leaderboard 在查核時顯示 `0 families / 0 configs / 0 live`;GitHub README 實際列出的完整報告也主要只有 Jetson 的八款 135M 至 1.2B 小模型及 Bonsai 系列,Mac、樹莓派、Android 與多節點 MoE 多數仍在建置或等待結果。

因此它現階段更適合作為可重現的測試腳手架,而非成熟購機指南。工程師應直接檢查各裝置資料夾內的腳本、版本鎖定與 raw artifacts;後續關鍵是榜單資料恢復、品質指標加入,以及同一模型在不同後端、上下文與散熱狀態下是否能由第三方重現。

來源

  1. smolperfbenchmark repository and reproducibility instructions
  2. smolperfbenchmark on-device leaderboard
  3. Release discussion and author’s scope claims