返回首頁

本機推論

KoboldCpp 1.120 新增 DirectIO 載入模式,mmap 與 mlock 可同時啟用

新版為大型 GGUF 權重加入 `--usedirectio`,並允許以 mmap 映射模型時鎖定相關記憶體頁。它也支援 Qwen3.8-Flash-Next、Ling-3.0-flash 與自訂 JavaScript 工具,但官方尚未公布載入速度或記憶體基準。

EWood45 · CC BY-SA 4.0 · Image source
zh-Hant

KoboldCpp 1.120 把更多模型檔案載入策略暴露給本機推論使用者。[官方版本說明](https://github.com/LostRuins/koboldcpp/releases/tag/v1.120)新增 `--usedirectio`,讓支援的平台以 direct I/O 讀取 GGUF;另一項改動則容許 mmap 與 mlock 同時使用。mmap 由作業系統按需映射模型頁面,適合模型大於可用實體記憶體或多程序共用檔案的情境;mlock 的用途是要求系統不要把已映射頁面交換出去。兩者組合可降低推論期間因換頁造成的延遲波動,但會提高常駐記憶體壓力,並受作業系統鎖頁額度限制。

Direct I/O 的價值主要在載入階段:它提供一條不依賴一般快取路徑的讀取選項,可能避免一次性載入數十 GB 權重時擠掉其他檔案快取。不過實際效果高度取決於 SSD、檔案系統、讀取對齊與 GPU offload 配置;版本說明沒有提供冷啟動時間、吞吐量或支援平台矩陣,因此不能先假定它一定快於 mmap。工程團隊應用同一個 GGUF 分別量測冷、熱載入,以及載入後首 token 延遲和系統記憶體峰值。

1.120 亦加入 Qwen3.8-Flash-Next、Ling-3.0-flash 支援,並警告社群已有不正確的量化檔流傳。Kobold Lite 現在可載入使用者設定的 JavaScript 工具,並透過標準工具呼叫介面交給模型;這也意味著工具程式碼取得的檔案、網路與程序權限必須另行隔離。新版另修正 assistant prefill 誤觸發與 failsafe 模式誤選問題。[LocalLLaMA 討論](https://www.reddit.com/r/LocalLLaMA/comments/1w2c4el/koboldcpp_v1120_released/)顯示 DirectIO 和合併鎖頁是社群最關注的改動,但目前回報仍不足以形成跨硬體結論。

來源

  1. Release koboldcpp-1.120
  2. Koboldcpp v1.120 released