人工智能只“回答”的时代可能已经结束了。 NVIDIA 推出了一种新的开放模型,该模型将作为自主代理的基础,自主代理可以制定计划、使用自己的工具并执行数百次转弯。这种快速、廉价且开放的模式将如何改变人工智能的使用方式?
NVIDIA于2026年6月4日发布了开放模型“NVIDIA Nemotron 3 Ultra”。Mixture-of-Experts模型总共有5500亿个参数,其中有550亿个活跃参数。负责组织和推断长期运行的代理。与同级别开放模型相比,吞吐量最高可达 5 倍,与 SWE-bench 等相比,可降低座席任务成本高达 30%。
采用混合 Mamba Transformer、NVFP4 准确性、LatentMoE 和多令牌预测。在MOPD接受过10多位专业老师的培训。在 10 万亿个代币的预训练基础上添加了 2120 亿个代币,在 SWEBench Verified 上得分为 65% 到 70.4%。同时发布Nemotron 3.5内容安全和Nemotron 3.5 ASR。许可证已移至 OpenMDW-1.1。
可在 Perplexity、Hugging Face、build.nvidia.com 等处获取。
从:
NVIDIA Nemotron 3 Ultra 为长时间运行的代理提供更快、更高效的推理NVIDIA 技术博客
【编辑部评论】
我首先要指出的是,这款 Nemotron 3 Ultra 是针对长时间运行的代理和复杂的推理工作流程而不是一次性聊天优化的模型这就是重点。 NVIDIA 的目标是建立一个“长期运行代理”的基础,该代理可以制定计划、调用工具并执行数百轮任务。多家媒体指出,该设计旨在即使在代币数量增长到数百万的情况下,也能保持多智能体操作运行而不崩溃,同时还具有通用推理和对话能力。
这里的关键是一个称为“专家混合(MoE)”的系统。总参数数量庞大,达到 5500 亿,但是每处理一个令牌,仅移动 550 亿分钟,差异约为稀疏性的 10 倍。它对应的是虽然它有一个很大的大脑,但每次只使用其中的一部分,降低了速度和成本。这就是“又快又便宜”的诉求内容。
另一项新技术是混合结构,结合了 Mamba 层和 Transformer 层。 Mamba 层提高了长文本工作负载的序列处理效率,少量的注意力层负责从广泛的上下文中调用准确的事实。当处理 100 万个 token 的长上下文时,这种结构就会发挥作用。
那么我们能做什么呢?当代理长时间运行时,它们会继续将历史记录和中间输出反馈回模型,从而增加成本和“目标滑移”。 Ultra是以分工为前提的,只处理组织角色中比较困难的部分,而常规处理则留给轻量级模型。它旨在用于保留编码工作中的设计决策以及整合数百个研究来源中的不一致之处。
一个很大的积极方面是开放程度。不仅权重,训练数据和配方都是在 Linux 基金会宽松的 OpenMDW-1.1 许可证下发布的,并且还允许商业使用。。在企业和主权人工智能领域,数据来源和透明度与性能同样重要,因此这是一个高利润的举措。
另一方面,不要期望太多。 NVIDIA官方声称“速度提升了5倍”,但这是一个自我测量值,根据比较目标和测量条件的不同而有所不同。独立评论网站的看法更为冷静。虽然它作为来自美国的开放模型排名第一,但其整体智能指数(人工分析智能指数约48分)落后中国的Kimi K2.6约6分。还有评价如。现实是,你在速度上获胜,在整体智慧上紧随其后。
实施过程中的障碍不容忽视。为了使用 BF16 独立运行 5500 亿个参数,需要具有 8 个 B200 的单节点或具有 8 个或更多 H100 类单元的多节点配置,而现实的起点是通过 DeepInfra 或 OpenRouter 使用 API。规模之大,不能说是“开放,任何人都可以轻松操作”。
我还将谈到法规和对未来的展望。此次同样发布的安全分类模型 Nemotron 3.5 Content Safety 是一个 4B 护栏模型,涵盖 23 个安全类别和 12 种语言,是随着智能体自主权增加而变得更加重要的领域。在人工智能代理执行自己的代码并操纵外部工具的时代,性能竞争和安全建设将齐头并进。我认为这表明独立的执行环境(例如 OpenShell)正在作为一个集合来讨论。
从长远来看,这个版本表明,而不是“智能上限”“打通供应网络”是。我正在关注来自美国的最快开放模式的出现,它完全开放了供应链,此举可能会改变创建长期运行代理的过程。这似乎是开放公司追赶封闭前线趋势的一个明显里程碑。
【术语解释】
长期代理
一种人工智能代理,可以反复计划、使用工具并维护上下文,以多次轮流完成复杂的任务。这一概念与提供一次性响应的聊天机器人相反。
混合专家(MoE)
模型内部有多个“专家”的系统,并且仅针对每个输入激活其中的一些专家。即使总参数很大,也可以通过缩小推理过程中移动的部分来降低速度和成本。
活动参数
在一次令牌处理(前向传递)中实际移动的参数数量。 Ultra 是一种设计,其中 5500 亿个总数中只有 550 亿个处于活动状态。
混合曼巴变压器
结合了状态空间模型的 Mamba 层和 Transformer 的注意力层的结构。 Mamba 层高效处理长句子,注意力层负责准确的事实回忆。
NVFP4
NVIDIA 的 4 位浮点格式。这是一种量化技术,允许相同的检查点在 Hopper、Blackwell 和 Ampere GPU 上运行。
潜在的MoE
一种 MoE 方法,将输入投射到小的潜在维度中,以简化专家路由和计算。单一模型可处理多种流程。
多令牌预测(MTP)
一种在一次前向传递中预测多个未来令牌并加速生成的方法。对于长输出和多转加工有效。
MOPD(多教师按策略蒸馏)
一种蒸馏方法,学生模型自行生成试验,并通过接收 10 多个专家教师模型的评分来学习。有效地开发每个领域的能力。
OpenMDW-1.1
Linux 基金会开发的开放式 AI 模型分发许可。权重、数据、文档等在单一框架中综合处理,并允许商业用途。
SWE-工作台 / 终端工作台 2.0
衡量人工智能软件开发和终端运营能力的标杆。它作为评价代理人实际表现的指标。
护栏模型
确定输入和输出是否安全且不违反策略的辅助模型。这是 Nemotron 3.5 内容安全。
人工智能分析智能指数
来自独立评估网站的综合智力指数,衡量推理、知识、数学和编码。 Nemotron 3 Ultra 得分约为 48 分。
[参考链接]
NVIDIA Nemotron(公式)(外部)
NVIDIA 的官方介绍页面总结了整个 Nemotron 系列、其用途以及每个模型和资源的说明。
build.nvidia.com(Nemotron 3 Ultra)(外部)
NVIDIA 开发者平台,您可以在浏览器中试用 Nemotron 3 Ultra。您还可以遵循 API 和 NIM 使用路径。
拥抱脸(Nemotron 3 Ultra 模型卡)(外部)
NVIDIA官方模型卡,描述了MoE结构、约20万亿代币的预学习、BF16运算的推荐GPU配置等。
NVIDIA NeMo(GitHub)(外部)
一个发布用于学习和微调 Nemotron 的开放库的存储库,例如 NeMo RL 和 Gym。
困惑(外部)
提供 Nemotron 3 Ultra 的交互式搜索服务。您可以通过 Pro 订阅或通过 API 尝试相同的模型。
抱脸(Nemotron 3.5内容安全)(外部)
Nemotron 3.5内容安全的官方页面,这是一个4B护栏模型,支持23个安全类别和12种语言。
Linux Foundation(OpenMDW-1.1公开)(外部)
官方宣布NVIDIA已经为Nemotron等采用OpenMDW-1.1。您可以查看许可位置。
[参考文章]
NVIDIA AI 发布 Nemotron 3 Ultra:适用于长时间运行代理的开放式 550B 专家混合 Mamba-Transformer(外部)
一篇解释性文章总结了高达 6 倍的推理吞吐量和 20 万亿代币预训练,开放 MoE 总量为 5500 亿,活跃量为 550 亿。
NVIDIA Nemotron 3 Ultra:550B 开放推理模型直播(外部)
一篇文章指出了6月4日发布的总结,大约10%的稀疏性,以及尽管Kimi在美网排名第一,但仍落后Kimi K2.6 6分的事实。
Nemotron 3 Ultra — 智能、性能和价格分析(外部)
Nemotron 3 Ultra的性能分析页面,经独立测量,其智力指数约为48分(实际值47.7),低于Kimi K2.6(约54分)。
NVIDIA Nemotron 3 Ultra 评测:基准、架构和实际性能(2026 年)(外部)
一篇评论文章,专门展示了实施的现实障碍,例如 DeepInfra 费用和使用多个 GPU 进行内部操作的要求。
Nemotron 3 Ultra:NVIDIA 的 550B Open-Weights 型号是最快的美国前沿型号 — 但仍落后于中国(外部)
本文补充了Computex 2026上公告的背景,并展示了美国公开赛排名第一但不如中国的Kimi K2.6的Kimi K2.6的竞争视角。
[相关文章]
NVIDIA NemoClaw 改变工业设计 - 来自 Cadence、西门子和其他公司的自主“AI 工程师”将几周缩短为几个小时
最新文章涉及与本文相同的 NVIDIA 代理平台。它解释了使用 NemoClaw 的自主代理如何改变现实世界的工业设计。
为 OpenClaw 带来“安全铠甲”——Nvidia 在 GTC 2026 上宣布 NemoClaw
深入探讨本文提到的 OpenShell 和 NemoClaw 的背景。这为理解自主代理的安全控制问题提供了基础。
NVIDIA Cosmos 3 改变机器人开发 |集推理、生成、行为于一体的开放平台模型
本书还讨论了 NVIDIA 的开放平台模型策略。您可以感受到该公司模型系列与 Nemotron 一起的扩展。
什么是 MiniMax M3?来自中国的开放权重AI,支持100万个代币,它的优势和盲点
它们有一个共同的特点:具有 100 万个 token 上下文的开放权重模型。我想从比较的角度来一起读一下中美之间的开放模式竞争。
微软Scout发布——“永远在线”代理改变人工智能和工作新格局
这本书与长期运行、始终在线的代理这一主题产生了共鸣。它从不同的角度补充了 Nemotron 3 Ultra 支持的工作方式的变化。
[编者后记]
在“快速、廉价”这几个字的背后,人工智能代理自主移动数百圈并自行执行代码的世界正在悄然成为现实。您想将什么托付给长时间独自工作的代理人?
我们拥有的自主权越多,我们就越需要思考我们应该在多大程度上把事情留给别人,以及我们应该在哪里阻止他们。如果我们能够继续一起探索期望和焦虑,我会很高兴。
