本機模型與推論系統
Bonsai 2 將 27B 語言權重壓至 5.95 GB,部署仍需專用執行核心
PrismML 以三元權重與正交旋轉壓縮 Qwen3.8-27B,並公開模型及推論工具。官方宣稱保留約 98.2% 整體基準表現,但不同評測口徑與執行環境相容性仍需逐項核對。

PrismML 於 9 月 17 日發布 Bonsai 2 27B,以 Qwen3.8-27B 為底座,開放 Apache 2.0 授權權重。這次更新把前代約 95% 的整體基準保留率推至官方宣稱的 98.2%,但實際導入重點仍是壓縮格式、執行核心與任務品質能否一起成立。[發布公告](https://prismml.com/news/bonsai-2-27b)
模型將主要語言權重表示為負一、零、正一,每 128 個權重共用一個半精度縮放值,並在量化前加入分塊 Hadamard 正交旋轉。旋轉已合併進儲存權重,推論時則須對活化值施加對應轉換;少數循環狀態與正規化參數仍保留較高精度,因此不能把整個模型理解成純三元運算。[模型卡](https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf)
可下載檔案有兩種取捨:PTQ1_0 密集封裝三元值,語言模型占 5.95 GB;PQ2_0 使用二位元槽位,占 7.21 GB,換取較低的解包成本。影像輸入另需約 0.63 GB 視覺模組。工程上還要加計上下文快取與暫存空間,不能把權重檔大小直接當成整機記憶體需求。[格式說明](https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf)
相容性是部署門檻。官方示範庫明確要求使用 PrismML 的執行分支;前代格式已進入 llama.cpp 主線,不代表 Bonsai 2 已能直接套用。只有讀懂低位元封裝、卻漏掉活化旋轉的執行環境,仍可能產生錯誤輸出。團隊因此提供固定版本的安裝與測速流程。[執行專案](https://github.com/PrismML-Eng/Bonsai-demo)
這意味著部署單位其實是權重與執行環境的組合。團隊若要提供可重現服務,應固定兩者版本並保留輸出回歸案例;日後切換主線核心時,也要重新驗證影像與工具呼叫路徑。對維護者而言,上游整合進度會直接影響更新成本與套件相容性。
評測也需要對齊口徑:發布頁列出 20 項測試,總分為 83.9 對 85.4;目前模型卡則列 14 項,平均為 84.78 對 86.32。兩者都約為 98.2%,卻不是同一套測量,亦不能推論每項能力只損失 1.8%。[官方評測](https://prismml.com/news/prismml-launches-bonsai-2-27b)、[逐項結果](https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf)
對本機代理開發者,價值在於用較小記憶體預算容納較大的模型;下一步應觀察主線整合,以及固定提示、上下文長度和工具環境下的獨立重測。正式採用前,仍需驗證長流程成功率與尾端延遲,平均跑分無法替這些需求作保。