返回首頁

本機 AI/小型模型

Needle 3 以單組權重提供多種深度,將本機工具模型壓至 8–29 MB

Cactus 讓同一組權重裁出二至二十層模型,支援本機工具呼叫與結構化擷取。官方比較限於微調後的狹窄任務,中文也尚未列入支援語言。

Adam majewski · CC BY-SA 3.0 · Image source
zh-Hant

Cactus 在 9 月 17 至 18 日公開 Needle 3 的架構與部署文件,並由團隊在 Hacker News 展示這款裝置端自動化模型。其重點是把工具選擇與參數填入、結構化資料擷取放進約 8–29 MB 的量化權重,讓手機、穿戴裝置及小型電腦能在本機處理指令。[團隊發布](https://news.ycombinator.com/item?id=49748553)

新版以同一組權重支援二至二十層子網路。裁切保留首尾區塊,再逐步填入中間區塊,因此較淺版本仍涵蓋前後段計算;訓練時抽樣不同深度,並以完整模型的預測進行自我蒸餾。工程師可先微調,再按裝置資源輸出不同深度,減少分別維護多套模型的負擔。目前深度主要在部署時選定;官方仍把依每次請求動態切換深度列為尚未交付的功能。[架構文件](https://cactuscompute.com/blog/intelligence-ladders)

模型卡列出以 Monarch Hadamard 運算取代一般前饋層、搭配分組查詢注意力與查表式記憶等設計。輸出端則從工具綱要編譯位元組層級文法,限制生成的 JSON 形狀;這能保障格式可解析,但指令含意及參數值是否正確仍需另外驗證。官方已提供權重、微調檢查點及各平台執行引擎。[模型卡](https://huggingface.co/Cactus-Compute/needle3)

效能宣稱的範圍相當窄。官方稱四層以上版本經 DroidCall 微調後可超過 DeepSeek V4 Flash,但比較採強制產生呼叫的設定;未微調的兩層版本在啟用信心門檻後,幾乎攔下所有呼叫。這說明檔案最小的版本仍需要特定任務訓練,不能直接推論為通用代理能力。[評測條件](https://cactuscompute.com/blog/intelligence-ladders)

導入還有兩項差異:本機微調匯出的是四位元權重,官方二位元後處理則依賴 Cactus 平台;GitHub 也註明二進位引擎預設啟用遙測,離線與隱私需求須另外核對設定。[部署說明](https://github.com/cactus-compute/needle)

團隊在社群回覆中承認,隱含意圖與多步關係仍難處理,較適合直接明確的指令;目前列出的七種支援語言也未包含中文。中文產品團隊下一步應先建立繁體中文、混合語言與拒絕呼叫測試集,再決定信心門檻及人工確認流程,避免把格式正確當成動作正確。[維護者說明](https://news.ycombinator.com/item?id=49748553)

來源

  1. Intelligence Ladders: One Set of Weights, Every Depth a Model
  2. Show HN: Cactus Needle 3: 8-29MB automation models can match DeepSeek V4 Flash
  3. Cactus-Compute/needle3
  4. cactus-compute/needle