本機推論與模型量化
GSQ-RCO 依張量敏感度分配位元,將 Qwen3.8-27B 壓至 8.4GB 標準 GGUF
ISTA DASLab 公開三個混合精度 Qwen3.8-27B 量化版本,以 GSQ 學習量化值,再由 RCO 在固定容量下替各張量選擇精度。最小版本僅 8.4GB 且可直接由 llama.cpp、Ollama 與 LM Studio 載入,但近乎無損的結論仍來自團隊自評。

奧地利科技學院 DASLab 公開 Qwen3.8-27B 的 GSQ-RCO GGUF,提供 2.50、2.75 與 3.00 bpw 三種版本,檔案大小分別為 8.4GB、9.3GB 與 10.1GB;另有 0.9GB 的 BF16 視覺投影器。與把所有權重套用相同格式的均勻量化不同,這批模型會依各張量對任務損失的敏感度,分別選用不同量化類型,最後仍輸出為標準 GGUF,毋須修改 llama.cpp、Ollama 或 LM Studio。
流程包含兩個既有研究成果。GSQ 以 Gumbel-Softmax 鬆弛,把離散量化格點轉成可微分問題,同時學習每個座標的格點指派與每組縮放值;RCO 則把總容量限制改寫為黎曼流形上的約束,直接以任務損失搜尋每個張量應分配的量化格式。這讓系統能在嚴格檔案預算內,把較多位元留給敏感權重,而不是手動設定各層精度。
團隊測得 9.3GB 版本在 AIME25 與 BF16 基線同為 100 分,10.1GB 版本在 GPQA-Diamond、LiveCodeBench v6 與基線差距約一分;最小版本的五項零樣本平均甚至略高於 BF16。不過,量化模型偶爾高於基線可能源於評測變異,不能解讀成壓縮普遍改善能力。現有結果也未涵蓋長時間代理、工具呼叫穩定性、視覺任務及不同硬體的實際吞吐量。工程團隊下一步應以自身提示分布測試回歸,並確認低位元核心是否真的帶來延遲與功耗收益,而不只是縮小磁碟與顯存占用。