返回首頁

推論系統

ComputeArena 公開本機推論測速流程,以簽章報告記錄模型與環境

工具以固定負載比較 BaseRT 與 llama.cpp,並保留檔案雜湊和逐次耗時。跨執行環境的預熱差異與自報資料可信度,仍限制榜單的解讀。

Mark Hillary · CC BY 2.0 · Image source
zh-Hant

Base Compute 於 9 月 22 日公開介紹 ComputeArena,把內部使用的本機推論測速流程做成開源命令列工具與公開榜單。它同時記錄模型、量化格式、晶片和執行環境,讓每秒 token 數附帶可追查的測試條件。[技術公告](https://huggingface.co/blog/basecompute/local-inference-benchmarks-computearena)

目前工具接入 BaseRT 與 llama.cpp 的獨立測速程式,支援 macOS Apple Silicon 及 Linux,尚未提供 MLX 與 vLLM 接入器。預設預填充長度由 128 掃描至 16,384 個 token,解碼測試生成 128 個 token,記錄三次量測。自訂負載可留作本機報告;提交榜單則須完成預設掃描。[公開實作](https://github.com/basecompute/computearena-cli)

模型識別分成上游模型、實際轉換檔案與來源證據。下載流程固定檔案版本並核對雜湊;來源不明或有歧義的檔案保留未解析狀態。因此,同樣標示四位元的 BaseRT 與 GGUF 權重仍屬不同變體,不能只看模型名稱就合併成一筆結果。[模型來源規則](https://github.com/basecompute/computearena-cli/blob/main/docs/model-identity.md)

報告保留每次 token 數與耗時,也記錄溫度、記憶體壓力等環境資訊。模型和執行檔在測試前後都會計算雜湊,內容改變就不簽署;結果先留在本機,使用者檢視待公開資料後才提交。榜單目前以指定的預填充及解碼負載顯示排名。[報告設計](https://huggingface.co/blog/basecompute/local-inference-benchmarks-computearena)、[公開榜單](https://computearena.ai/)

降溫模式也有實作差異:目前 BaseRT 在整輪測試前等待一次,llama.cpp 則在每個獨立負載程序前等待。依此可推論,即使選擇同名模式,各段測試開始時的熱狀態仍未必一致,工程師須回看量測紀錄。[執行條件](https://github.com/basecompute/computearena-cli)

比較限制仍需保留。兩種執行環境的預熱與負載順序不同;簽章只證明報告簽署後未被修改,無法證明機器如實回報效能。模型來源核對也不保證發布者標示正確,更不能證明不同量化具有相同輸出品質。[信任邊界](https://github.com/basecompute/computearena-cli/blob/main/docs/model-identity.md)、[作者說明](https://huggingface.co/blog/basecompute/local-inference-benchmarks-computearena)

對部署團隊而言,這套流程提供了重測與追查效能差異的起點。實務上仍應選擇相同負載與上下文條件,檢查各次耗時和環境紀錄,再另外評估中文任務品質。後續值得觀察的是社群能否補齊更多硬體,以及跨執行環境的測試條件能否進一步對齊。

來源

  1. Compute:Arena / Measuring Local Inference Across Models, Quants, Chips, and Runtimes
  2. ComputeArena CLI
  3. ComputeArena:Model identity and provenance
  4. ComputeArena:Local AI Benchmarks