Meta 自主研究系统 AIRA3 在 NVIDIA 的 Kaggle 推理赛中于约 4000 支队伍里位列第 8
Meta 称其自主 AI 研究系统 AIRA3 于 6 月参加了 NVIDIA 在 Kaggle 举办的 Nemotron 推理挑战赛,在约 4000 支队伍中排名第 8,达到金牌水平。该系统与人类参赛者掌握同样的工具和信息,并在同一私有测试集上由外部评分。结果为 Meta 的声明,暂无独立验证。
Meta 于 9 月 5 日通过官方 X 账号发布四条推文,宣布其自主 AI 研究系统 AIRA3 在 6 月参加了 NVIDIA 举办的 Kaggle 实时比赛,任务是让 300 亿(30B)参数的 Nemotron 模型学会更好地推理。据 Meta 称,AIRA3 在约 4000 支队伍中位列第 8,达到金牌水平;参赛者工具与信息相同,并在私有测试集上由外部评分。
Meta 将此称为“一个可靠信号,表明 AIRA3 能以接近人类专家的水平提升 AI 模型的某项特定能力”。推文未给出该队伍在排行榜上的名称;结果为 Meta 的声明,暂无独立验证。
比赛与模型
据 Kaggle 页面,NVIDIA Nemotron Model Reasoning Challenge 从 3 月中旬持续到 6 月中旬。所有人从同一基础模型 Nemotron-3-Nano-30B 出发,提交 rank 不超过 32 的 LoRA 适配器;得分是在 NVIDIA Research 开发的新推理基准上的准确率。4182 支队伍参赛;第一名奖金为 25,000 美元和 5 台 DGX Spark。
据 Meta 介绍,排名第 8 的实时参赛方案由 GPT 5.5(配 OpenCode)与 Claude 4.8(配 ClaudeCode)组成。赛后在同一私有测试集上的补充测试中,Meta 自家的 Muse Spark 1.2(配 MuseCode)同样达到金牌水平;Muse Spark 1.1 与 GLM 5.2(均配 OpenCode)为银牌水平。
系统如何运作
Meta 称 AIRA3 没有中央控制器:大量长时间运行的智能体,每个都是模型与编码框架的配对,各自在隔离环境中运行,通过共享的假设与发现论坛和共享的解决方案文件系统异步协作。智能体在彼此发现之上推进;搜索策略自然形成。
泛化主张
Meta 称跨领域时只需改变任务说明:内部基准中生产 GPU 内核延迟降低 27%;在另一场把 4000 年前的阿卡德语泥板翻译成英文的 Kaggle 比赛中达到金牌水平。公司称自己“尚处早期”,并把“递归式自我改进”列为目标。上一代 AIRA2 于 3 月发表在 arXiv。
对企业读者而言
这是一个数据点,说明模型微调工作的一部分可以交给自主系统;但它也只是一场比赛、公司自己的声明,且不是生产环境。
来源
- Meta 的 X 推文串,9 月 5 日:https://x.com/AIatMeta/status/2096271545589190927、https://x.com/AIatMeta/status/2096271547229167748、https://x.com/AIatMeta/status/2096271550517575918、https://x.com/AIatMeta/status/2096271554237936107
- Kaggle 比赛页面:https://www.kaggle.com/competitions/nvidia-nemotron-model-reasoning-challenge
- AIRA2 论文,arXiv:https://arxiv.org/abs/2603.26499