開源模型
Nex-N2.5 開放三種代理模型,視覺版與兆參數文字版呈現不同能力邊界
Nex AGI 發布 35B mini、多模態 Pro 與 1.6T MoE Max,主打瀏覽器、桌面操作及長時間工具執行。官方成績顯示 Max 接近頂尖閉源模型的自動化分數,但在依賴視覺的 OSWorld-2 明顯落後,且本機部署門檻高達 16 張 H200。

Nex AGI 在 9 月 8 日公開 Nex-N2.5 系列權重,分為 mini、Pro 與 Max。mini 和 Pro 延續多模態路線,利用螢幕畫面驗證動作結果,面向網頁瀏覽、GUI 操作與程式執行;Max 則是 1.6 兆參數的純文字 MoE 模型。三者採 Apache-2.0 授權、提供 262,144 token 上下文,並以相容 OpenAI Chat Completions 的 `reasoning_effort` 切換直接回答、自適應及強制推理模式。[官方儲存庫](https://github.com/nex-agi/Nex-N2.5)亦指定 Qwen3 Coder 工具解析器;Max 的推理軌跡則要用 DeepSeek-R1 parser 分離。
公布的結果揭示「代理能力」不能只看模型尺寸。Max 在 AutomationBench v1.0.6 得 50.2,僅比官方列出的 Claude Opus 5 低 0.1;Terminal-Bench 2.1 為 86.1。然而在需要理解螢幕並操作電腦的 OSWorld-2,純文字 Max 只有 30.5,多模態 Pro 為 56.4,Claude Opus 5 對照值則是 68.3。這種反差顯示,擴大文字模型不足以取代視覺接地與動作回饋迴路。
部署成本同樣重要。[mini 模型卡](https://huggingface.co/nex-agi/Nex-N2.5-mini)建議兩張 H100,Pro 需要八張 H100;Max 的參考配置是兩個節點、共 16 張 H200,並依賴 Nex 修改的 SGLang 映像、FP8 KV cache、DeepEP 與 DeepGEMM。工程團隊接下來應觀察官方尚未開源的 NexCUA 評測框架、第三方重跑結果,以及不同模型在失敗恢復、權限控制和長任務成本上的表現。目前分數主要由發布者提供,不能視為獨立驗證。