推論系統
Daedalus-150M 以卷積取代三分之二注意力層,2K 上下文 CPU 解碼加速 1.76 倍
Daedalus-150M 專為單使用者、4-bit CPU 推論設計,讓多數網路層不必反覆讀取持續增長的 KV cache。初步結果顯示速度優勢會隨上下文增加,但模型只有 2K 上限,效能數字也仍待跨硬體獨立重現。

Daedalus-150M 在 8 月 20 日公開論文、程式碼與權重,設計方向不是把標準 Transformer 事後壓縮到 CPU,而是從記憶體存取成本反推模型架構。全模型共有 18 個區塊,其中只有 6 層使用完整注意力;其餘 12 層改用 kernel size 3 的 depthwise convolution,每層只保存兩個時間步的固定狀態。注意力層則採 12 個 query head、4 個 KV head 的 GQA。
這項配置直接縮小自回歸解碼時必須重讀的快取。作者計算,在 2,048 token 上下文中,每生成一個 token,Daedalus 約讀取 12.6 MB 快取,24 層全注意力參考架構則是 25.2 MB。以 4-bit 權重、8 個 CPU 執行緒測試,Daedalus 在空上下文輸出 1,112 token/s,優勢只有 1.20 倍;到 2,048 token 時仍有 739 token/s,相同資料與訓練配方的參數匹配模型只剩 420 token/s,差距擴大至 1.76 倍。對外部同級模型的最高比較為 2.08 倍。
模型從頭使用 599 億 token 訓練,五項常識評測平均為 47.31,勝過多款早期約 1.3 億至 1.6 億參數模型,但仍低於使用兩兆 token 訓練、平均 51.2 的 SmolLM2-135M。專案提供 Apache 2.0 程式、GGUF 與 Hugging Face 權重,也保留評測紀錄及參數匹配消融,便於重跑。
限制同樣明顯:目前只支援英文與 2,048 token,上報結果來自單一訓練種子;Q4_0 量化造成約 6% perplexity 損失,約 48% 卷積通道呈現失活,過大的 49,152 詞彙表又占去約 23% 參數。下一步應觀察不同 x86、ARM CPU 的實測、長上下文擴展,以及精簡失活通道後能否保留相同速度曲線。