返回首頁

開源工具與推論維運

LocalAI 4.10 統一叢集操作與私有下載憑證,加入端到端測速

新版把節點健康、模型副本與批次生命週期操作整合進叢集儀表板,並統一私有來源驗證。新增 benchmark 可建立回歸測量,但未涵蓋首 token 延遲或高併發容量。

Superchilum · CC BY-SA 4.0 · Image source
zh-Hant

LocalAI 於 9 月 17 日發布 4.10.0,將自架推論服務的管理單位擴展到整個叢集。新版整合節點健康、資源容量、模型副本位置與批次操作,並加入私有來源憑證檔及命令列測速工具,對需要維護多台工作節點的團隊更有直接意義。[版本公告](https://github.com/mudler/LocalAI/releases/tag/v4.10.0)

叢集儀表板會彙整顯存、記憶體、處理器與磁碟狀態,也列出模型分布在哪些節點及進行中的請求。批次排空、恢復與移除最多同時執行八項操作;排空節點時,狀態變更與模型紀錄刪除放入同一筆交易,降低並行更新造成控制資料不一致的風險。這讓介面更新也涉及實際的生命週期管理。[叢集變更](https://github.com/mudler/LocalAI/releases/tag/v4.10.0)

私有模型交付則改由憑證檔依網址前綴匹配驗證方式,涵蓋容器登錄、內部下載站與私有程式庫。祕密值在使用時讀取,因此掛載的 Kubernetes Secret 輪替後可直接生效;重新導向也逐跳檢查,未匹配的 CDN 不會收到原站憑證。模型目錄與下載權限得以分開維護。[私有來源文件](https://localai.io/docs/advanced/private-sources/index.html)

分散式部署仍有一道操作邊界:控制器負責下載模型,但各工作節點自行拉取後端映像。因此,只替控制器設定憑證不足以安裝私有後端,工作節點也必須取得相應設定;LocalAI 不會經由 NATS 傳送這些祕密。工程團隊升級時應一併檢查憑證配置與輪替範圍。[分散式憑證規則](https://localai.io/docs/advanced/private-sources/index.html)

新增的 `local-ai benchmark` 會循序送出非串流請求,以完整請求耗時及回報的完成 token 數計算吞吐量,可輸出 JSON 納入回歸比較。它包含傳輸、排隊、提示處理與生成時間,未測首 token 延遲,也不能代表高併發服務容量;暖機後重複相同提示還可能受快取影響。[測速口徑](https://localai.io/docs/features/benchmark/index.html)

就導入評估而言,這次更新提供了更完整的營運觀察與測量入口。後續應固定硬體、量化、上下文及背景負載,另測並行請求與節點排空期間的行為,才能把單次測速結果連回正式環境的容量規劃。尤其要確認資源遙測缺漏時,儀表板上的容量資訊如何影響操作判斷。

來源

  1. LocalAI v4.10.0 Release
  2. Private Registries and Galleries
  3. Benchmark text models