邊緣 AI 與工具呼叫
Needle 2 將 45M 工具模型壓進 14MB,並以 schema 文法限制裝置端呼叫
Cactus Compute 近日完善 Needle 2 的 Python API、跨平台執行與 Apache 2.0 授權,模型卡亦持續更新。它以 28MB 峰值記憶體執行工具選擇及結構化抽取,但速度與準確率仍主要來自官方測試。

Needle 2 把工具呼叫模型縮到可嵌入手機、瀏覽器、Raspberry Pi,甚至部分微控制器的尺度。模型只有 4,500 萬參數,經 Cactus Quants 壓成約 14MB 的 CQ2 二位元執行檔,官方稱完整工作階段的峰值記憶體約 28MB。專案在 8 月 20 日前後密集更新 Python 套件,補上公開 API 型別提示、Python 3.9 相容性、CLI 崩潰修正與平台下載模式;模型卡於 8 月 22 日再更新,程式碼及權重的授權亦已由 MIT 改為 Apache 2.0。
架構並非單純縮小 Transformer。Needle 2 的 Simple Attention Network 以固定 Walsh–Hadamard 轉換配合可學習閘門取代傳統 FFN,加入 GQA、雜湊 n-gram 的 engram key-value memory,以及四路殘差的 multi-lane hyper-connections。推論採 256-token 滑動視窗,但把工具描述固定為 KV sink,令對話增長時記憶體保持有界。工具超過五個時,內建檢索頭先為 schema 建立向量,只把最高分五項送入生成;未入選的工具會從當次文法中移除,而非僅降低取樣機率。
輸出端再把 JSON Schema 編譯成 byte-level grammar,因此欄位型別、列舉值、範圍及字串格式可在解碼時強制成立。每次呼叫另附信心值,取校準頭與呼叫 token 機率中較低者,讓應用以門檻決定直接執行或轉交雲端模型。不過文法只能保證格式合法,不能保證選對工具或參數語意正確;256-token 視窗亦不適合長推理。官方宣稱 Raspberry Pi 5 可達每秒 500 個解碼 token,但尚缺統一硬件、功耗及第三方準確率測試,部署實體控制前仍須加入權限檢查與確認步驟。