> ## Content Index
> Fetch the complete content index at: https://globalfeed.ai/llms.txt
> Use this file to discover other available public pages before exploring further.

# Nex-N2.5 开源发布：一项基准仅落后 Claude Opus 5 零点一分，电脑操作却不到其一半
- URL: https://globalfeed.ai/zh/nex-n2-5-kai-yuan-fa-bu-yi-xiang-ji-zhun-jin-luo-hou-claude-opus-5-ling-dian-yi-fen-dian-nao-cao-zuo-que-bu-dao-qi-yi-ban/
- Published: 2026-09-08T20:02:17.000Z
- Updated: 2026-09-08T20:02:17.000Z
- Description: 总部位于上海的 Nex AGI 发布三款 Apache-2.0 智能体模型。公告主打单项基准上 0.1 分的差距，而模型卡自带的表格显示 OSWorld-2 为 30.5 比 68.3。
- Author: GlobalFeed Editor
- Tags: Nex-N2.5, Nex AGI, 开源模型, 智能体模型, x-NexEcosystem, dil-zh, elle, video

总部位于上海的 **Nex AGI** 以开源方式发布了 **Nex-N2.5** 系列。共三款模型：**mini**（350 亿参数）、**Pro**，以及 **Max**（1.6 万亿参数、纯文本的混合专家模型）。三者均采用 Apache-2.0 许可，上下文窗口为 262144 个 token。该机构自述为“由上海创新研究院发起的创新联盟”。

公告主打的数字是：Max 在 **AutomationBench v1.0.6** 上取得 50.2 分，仅落后 Claude Opus 5 的 50.3 分 0.1 分。这个数字属实。但同一张模型卡上表格的其余部分，公告并未提及。

| 基准                     | N2.5-Max | N2.5-Pro | Claude Opus 5 | Qwen3.8-Max |
| ---------------------- | -------- | -------- | ------------- | ----------- |
| AutomationBench v1.0.6 | 50.2     | 44.2     | 50.3          | 39.8        |
| OSWorld-2              | 30.5     | 56.4     | 68.3          | 46.7        |
| Terminal-Bench 2.1     | 86.1     | 82.7     | 89.1          | 86.6        |
| SWE-Bench Pro          | 65.7     | 61.2     | 79.2          | 67.7        |

## 模型卡讲的和公告不是一回事

先看 **OSWorld-2**。Max 在这里是 30.5 分，Opus 5 是 68.3 分。公告所说的“0.1 分”只属于一项基准；在衡量操作电脑能力的这项测试上，差距超过一倍。

第二行更奇怪：**更小的 Pro 在同一项基准上比更大的 Max 高出 25.9 分**，56.4 比 30.5。模型卡没有给出解释。Pro 是多模态的，Max 是纯文本的，而 OSWorld-2 衡量的是依据屏幕内容完成任务的能力，差距可能由此而来。这是我们的推断，模型卡上并无此说明。

在已公布的各行中，Nex-N2.5 没有一款模型超过 Claude Opus 5。相较 Qwen3.8-Max，Pro 在部分行领先（AutomationBench 44.2 比 39.8，OSWorld-2 56.4 比 46.7），在其他行落后（Terminal-Bench 82.7 比 86.6，SWE-Bench Pro 61.2 比 67.7，OSWorld-Verified 82.2 比 86.1）。

## 开源，但跑起来是另一回事

模型卡为 Max 推荐的配置是**两个节点、16 张 H200**，还需使用 Nex 自行修改的 SGLang 分支。Apache-2.0 许可随权重一同发布，但能搭起这套硬件的人并不多。这里的开源意味着可下载，而不是人人可运行。

模型卡列出的能力包括：持续执行动作、通过视觉反馈自我纠错、在 Blender 与 CAD 工具间工作，以及在浏览器和桌面上独立运行程序。本文所有数字均由厂商自行公布，尚无独立评测。

来源：[Nex-N2.5-Max 模型卡](https://huggingface.co/nex-agi/Nex-N2.5-Max?ref=globalfeed.ai)、[Nex-N2.5-Pro 模型卡](https://huggingface.co/nex-agi/Nex-N2.5-Pro?ref=globalfeed.ai)、[Nex AGI](https://huggingface.co/nex-agi?ref=globalfeed.ai)。