本機推論/模型完整性
llama.cpp b10451 為 LoRA 張量補上檔案邊界檢查,截斷權重不再靜默補零
舊版 LoRA 載入路徑未驗證張量位移加大小是否超出 GGUF 檔案,損毀或未完整下載的 adapter 仍可能被當作成功載入。b10451 改為立即報錯,並確認張量索引確實存在。

llama.cpp 8 月 16 日的 b10451 建置修正一個容易被誤判成模型品質問題的 LoRA 載入缺口。主模型載入器原本會檢查每個張量的資料範圍,但 adapter 路徑直接依據 GGUF 內記錄的 offset 與 tensor size 讀取,沒有確認兩者相加後仍位於實際檔案內;張量名稱查找失敗時,也未先驗證索引有效。[合併說明](https://github.com/ggml-org/llama.cpp/pull/27056)指出,截斷或損毀的 LoRA 因此可能被靜默載入,缺少的位元組以零填補,程式卻不回報錯誤。
修正後,LoRA 路徑沿用主模型載入器的 bounds check,並檢查 tensor index。維護者以裁短資料區段的 adapter 測試:新版會回傳「tensor data is not within the file bounds」,有效檔案則照常載入。這不是新的量化方法或推論加速,卻直接改善可觀察性——同一個 adapter 若在下載、快取同步或檔案分發時只取得部分內容,舊版可能產生可運行但行為偏移的模型,使團隊把錯誤歸因於提示、基座模型或微調本身。
影響面來自 GGUF 同時封裝 metadata 與 tensors;[Hugging Face 的 GGUF 文件](https://huggingface.co/docs/hub/gguf)亦說明 Hub 會展示張量名稱、形狀與精度,但 metadata 可解析不代表後方所有 tensor bytes 都完整。使用動態掛載多個社群 LoRA 的本機服務,應升級至含 b10451 的建置,並在下載層保存雜湊或固定 revision。需要注意的是,專案沒有把此修正標為 CVE,也沒有證據顯示它可造成任意程式碼執行;目前已確認的風險是靜默權重損毀與錯誤推論。後續值得觀察其他 GGUF adapter、control vector 與分片載入路徑是否採用一致的範圍驗證。