Nex-N2.5 开源发布:一项基准仅落后 Claude Opus 5 零点一分,电脑操作却不到其一半
总部位于上海的 Nex AGI 发布三款 Apache-2.0 智能体模型。公告主打单项基准上 0.1 分的差距,而模型卡自带的表格显示 OSWorld-2 为 30.5 比 68.3。
总部位于上海的 Nex AGI 以开源方式发布了 Nex-N2.5 系列。共三款模型:mini(350 亿参数)、Pro,以及 Max(1.6 万亿参数、纯文本的混合专家模型)。三者均采用 Apache-2.0 许可,上下文窗口为 262144 个 token。该机构自述为“由上海创新研究院发起的创新联盟”。
公告主打的数字是:Max 在 AutomationBench v1.0.6 上取得 50.2 分,仅落后 Claude Opus 5 的 50.3 分 0.1 分。这个数字属实。但同一张模型卡上表格的其余部分,公告并未提及。
| 基准 | N2.5-Max | N2.5-Pro | Claude Opus 5 | Qwen3.8-Max |
|---|---|---|---|---|
| AutomationBench v1.0.6 | 50.2 | 44.2 | 50.3 | 39.8 |
| OSWorld-2 | 30.5 | 56.4 | 68.3 | 46.7 |
| Terminal-Bench 2.1 | 86.1 | 82.7 | 89.1 | 86.6 |
| SWE-Bench Pro | 65.7 | 61.2 | 79.2 | 67.7 |
模型卡讲的和公告不是一回事
先看 OSWorld-2。Max 在这里是 30.5 分,Opus 5 是 68.3 分。公告所说的“0.1 分”只属于一项基准;在衡量操作电脑能力的这项测试上,差距超过一倍。
第二行更奇怪:更小的 Pro 在同一项基准上比更大的 Max 高出 25.9 分,56.4 比 30.5。模型卡没有给出解释。Pro 是多模态的,Max 是纯文本的,而 OSWorld-2 衡量的是依据屏幕内容完成任务的能力,差距可能由此而来。这是我们的推断,模型卡上并无此说明。
在已公布的各行中,Nex-N2.5 没有一款模型超过 Claude Opus 5。相较 Qwen3.8-Max,Pro 在部分行领先(AutomationBench 44.2 比 39.8,OSWorld-2 56.4 比 46.7),在其他行落后(Terminal-Bench 82.7 比 86.6,SWE-Bench Pro 61.2 比 67.7,OSWorld-Verified 82.2 比 86.1)。
开源,但跑起来是另一回事
模型卡为 Max 推荐的配置是两个节点、16 张 H200,还需使用 Nex 自行修改的 SGLang 分支。Apache-2.0 许可随权重一同发布,但能搭起这套硬件的人并不多。这里的开源意味着可下载,而不是人人可运行。
模型卡列出的能力包括:持续执行动作、通过视觉反馈自我纠错、在 Blender 与 CAD 工具间工作,以及在浏览器和桌面上独立运行程序。本文所有数字均由厂商自行公布,尚无独立评测。