開源模型
Nanbeige4.2-3B 以循環 Transformer 壓縮代理模型,3B 非嵌入參數支援 256K 上下文
Nanbeige Lab 公開以 28 兆 token 從零預訓練的 Nanbeige4.2-3B,重複使用同一組 Transformer 層,在不增加參數下提升計算深度。官方代理評測普遍超越較大的 Qwen3.5-9B,但成績高度依賴自家執行框架,仍需獨立重現。

Nanbeige Lab 發表 Apache 2.0 授權的 Nanbeige4.2-3B;模型共有約 4B 參數,其中非嵌入參數為 3B,並支援最長 262,144 token。其核心是 Looped Transformer:同一組層會被重複執行,以增加有效運算深度,而不是配置更多獨立權重。這種設計降低儲存需求,但不代表推論成本等同一般 3B 模型,因為重複通過層堆疊仍會消耗運算量。
訓練配方同時針對一般推理與代理工作。團隊稱基礎模型從零使用 28T token 預訓練;SFT 階段混合真實與合成的可執行環境、任務資產及多種代理 scaffold,並在軌跡及單輪層級過濾資料。後訓練則結合 Think/Non-Think RLHF、限制推理長度的強化學習,以及同時使用結果與過程獎勵的 agentic RL。
官方報告中,模型在 SWE-bench Verified、SWE-bench Pro 與 Terminal-Bench 2.0 分別取得 63.6、46.9 與 44.1;使用 OpenClaw 測試本機助理工作時,也在六項測試全面高於 Qwen3.5-9B。模型卡已提供 Transformers、SGLang、vLLM、llama.cpp 與 Ollama 路徑,但部分後端需要 Nanbeige 維護的分支,載入 Transformers 權重亦要求 `trust_remote_code=True`。
工程團隊應把「參數較少」與「實際延遲、記憶體及能耗較低」分開驗證。多項比較採用 Nanbeige 自家 scaffold 或內部基準,推理模式也固定保留歷史 thinking;目前尚缺跨框架、相同 token 預算與相同硬體的第三方測試。