在智能体AI(Agentic AI)快速发展的背景下,英伟达正将下一代Vera Rubin平台的核心竞争力从降低推理成本转向提升模型训练效率,并推出“每美元智能”(intelligence per dollar)这一全新指标,试图重新定义AI算力市场的竞争规则。该公司认为,随着智能体模型对持续后训练需求的激增,算力需求将从短期项目制转向长期常态化,为GPU市场开辟新的增长空间。
英伟达在官方技术博客中详细阐述了这一战略转型的逻辑。与传统生成式AI模型不同,智能体模型需要具备自主规划、工具调用和错误修正能力,其运行环境可能每周发生变化,导致后训练从一次性流程转变为持续循环的核心工作负载。为应对这一挑战,Vera Rubin平台通过协同设计优化,宣称在训练同等规模模型时,所需GPU数量仅为上一代Blackwell平台的四分之一,同时支持更多并行环境和无限循环的后训练周期。
强化学习(RL)技术是后训练的核心驱动力。英伟达解释称,该过程通过模型生成尝试、评分反馈和权重更新的迭代循环实现能力提升,每次迭代需数千个环境并行生成“rollout”,对算力密度提出极高要求。公司强调,Vera Rubin平台通过硬件与软件的深度整合,可显著降低单次运行成本,使高频后训练在经济上可行,而Blackwell平台已为此奠定了基础。
为支撑其技术主张,英伟达首次披露了5500亿参数混合专家(MoE)模型Nemotron 3 Ultra的后训练细节。该模型在真实世界编程基准测试SWE-bench Verified中取得71.7%的得分,表明其能对开源项目中的软件缺陷生成有效修复方案的比例超过七成。英伟达表示,这一成果基于NeMo RL框架实现,且后训练方案已完全公开,可供行业验证。
头部客户的技术实践为Vera Rubin平台的优势提供了佐证。Prime Intellect透露,其已在Blackwell平台上完成前沿开放模型的后训练,并通过NVIDIA Dynamo实现推理编排。在与x86架构的对比测试中,Vera CPU在真实RL沙箱工作负载下的吞吐量提升30%,促使该公司计划扩大强化学习环境规模。Perplexity则展示了其跨数百块GPU的异步RL后训练栈,通过基于RDMA的权重传输引擎,可在两秒内完成万亿参数模型在训练与推理节点间的同步,后训练后的Qwen3 235B模型已部署于NVIDIA GB200 NVL72系统。
Together AI作为后训练服务提供商,其技术栈涵盖监督微调、强化学习和直接偏好优化,目前通过API和SDK交付服务。该公司表示,正在评估向Vera Rubin平台的迁移方案,以进一步提升服务规模和效率。英伟达指出,这些客户的迁移计划表明,市场对持续后训练的需求正从概念验证转向规模化落地,而Vera Rubin平台的架构优势恰好契合这一趋势。
在算力经济学的重构中,英伟达提出“每美元智能”应成为衡量AI基础设施效率的核心指标。该公司认为,这一指标不仅反映推理工厂的运营效率,还综合考量了模型构建与维护的投入产出比。通过降低每token成本和提升模型智能,Vera Rubin平台试图在智能体时代构建“算力-智能”的正向循环,从而巩固其在AI硬件市场的领导地位。















