推論執行環境
llama.cpp 0.2.0 分開穩定版與每日構建,套件維護者終可固定相容版本
llama.cpp 0.2.0 正式以語意化版本標示較慢更新的穩定版,原有 `b[編號]` 標籤則保留為接近逐提交的開發構建。新制度降低 Debian、Homebrew 與下游綁定的版本風險,但「穩定」不代表長期支援或跨硬件完整驗證。

llama.cpp 0.2.0 的核心變化不是單一核心加速,而是發行制度:`vX.Y.Z` 從此代表較慢節奏、適合下游散布的穩定版本;幾乎隨主分支提交產生的 `b[編號]` 標籤,則明確定位為 nightly/開發版。對長期只能追逐構建編號的應用、語言綁定與 Linux 套件而言,這提供了可固定、比較及設定升級政策的版本座標。
維護者另規定,建立正式標籤時,llama.cpp 內嵌的 ggml 必須與已發行的 ggml 完全一致。這是重要的 ABI 與打包細節:Debian 現已把執行工具、`libllama`、開發標頭,以及 CUDA、HIP、Vulkan 等 ggml 後端拆成獨立套件;若內嵌版本與系統函式庫漂移,即使編譯成功也可能在載入或推論時失敗。語意化版本讓套件管理器較容易表達依賴,亦讓下游在採用新模型支援前保留經測試的基線。
0.2.0 同時收進多項執行層改動,包括 Arm SME2 F32 GEMV 核心、SYCL 的 Q5_K 核心與載入修正、Adreno OpenCL 相容性處理、LFM2/LFM2-MoE 張量切分、LFM2 的 DSpark 草稿模型、可指定多模態投影裝置,以及 Metal、CUDA、Vulkan 的量化或 KV-cache 路徑調整。這些功能現在有穩定標籤可供整合,不必直接追蹤主分支。
限制是專案仍處於 0.x;版本規則與自動發布流程剛建立,發行摘要甚至仍列為待完善項目。穩定標籤也不等同 LTS、安全稽核或所有後端均已測試。下游應分開追蹤 `libllama` API、REST 介面、ggml 版本與模型格式,並在 CUDA、Metal、Vulkan、SYCL 等實際部署硬件上建立回歸測試。