想象一下职业运动员。真正让顶尖选手脱颖而出的,往往是赛场之外的功夫:他们持续打磨自己,针对新对手调整战术,并根据上一场比赛暴露出的问题来不断调整。
智能体 AI 的运作逻辑如出一辙。我们不再仅仅是向模型索要一个答案,而是给它设定一个目标,让它在环境变化、边缘情况出现以及工具更迭时,不断自我调整。与仅需对提示词做出响应的生成式模型不同,智能体模型必须学会规划、调用多种工具,并在运行过程中遇到问题时能够自我恢复。
这就是为什么后训练,即在原始数据上完成初始训练后对模型进行优化的阶段,已不再是一次性的收尾步骤,而是变成了一项持续性的工作。这是因为智能体模型所处的运行环境变化极快。智能体使用的工具可能每周都在更新;生产环境中会不断遇到测试集未曾出现过的边缘情况;而且每一次部署,都会面临各自独特的代码库、策略和环境。
随着生产环境中不断出现新问题,后训练会持续接收生产反馈,并进入新一轮循环。计算需求之所以越来越大,并不是因为单次运行的规模更大,而是因为这种训练持续不断地循环执行。智能体 AI 为后训练引入了一种全新的计算模式,使其成为智能体时代的核心工作负载,也是决定每美元智能的首要驱动力。
后训练的目标,是通过最大化持续学习循环中每一次前向传播和反向传播的收益,来实现每美元智能的最大化。其中,前向传播,即推理的效率是用每 Token 成本来衡量的。这意味着,每一次降低每 Token 成本,都将直接转化为每美元智能的提升。
智能体后训练深度解析
“智能”是在后训练阶段被真正构建出来的。在预训练阶段,模型学到的仅仅是预测下一个 Token,这赋予了它语言的流畅度,但并未赋予它真正的智能。而在后训练阶段,模型才开始学习如何编写代码、规划多步骤任务、调用搜索工具,以及在出错时进行恢复。推理则是这之后的环节:模型在实际任务中工作,其效率以每 Token 成本来计价。
因为没有可供记忆的标准答案,模型只能依靠奖励信号来学习,因此模型需要通过强化学习 (RL) 技术来进行训练。当接收到一个任务时,模型会尝试生成一次尝试,这就是前向传播,其执行的工作与它在实际任务中完全相同。随后,这次尝试会被打分,并根据反馈更新模型的权重 —— 这就是反向传播。在经历了数百万次的尝试后,模型的智能得以不断成长。
这其中的每一个步骤都会消耗大量算力,而要在大规模环境下运行这一循环,更是一项复杂的调度编排任务:需要数千个环境并行生成 rollouts,验证奖励信号,并将更新后的权重流回训练流程,同时还要确保加速器保持高利用率。NVIDIA NeMo 开源库 (例如用于构建训练环境的 NeMo Gym 和用于分布式后训练的 NeMo RL) 将后训练从定制化的研究代码,转变成了可重复使用的标准化基础设施。

为何每美元智能是对每 Token 成本的超越与延伸
如果说推理是创造收入的引擎,那么后训练就是乘数:模型的能力越强,每 Token 的价值就越高。

每 Token 成本是推理工厂的核心指标,即生成 100 万个 Token 的总体成本。而每美元智能则处于更高的维度,它回答的是一个截然不同的问题:构建一个值得被部署的模型需要花费多少成本?并且,随着环境的不断变化,如何持续保持它的价值?
这两者是相互嵌套,而非相互竞争的关系。能够降低每 Token 成本的 AI 基础设施,同样也会降低构建模型中每一次智能提升的成本。反过来,模型智能的每一次提升,又会提升推理工厂所交付的每 Token 价值。
换句话说,每 Token 成本衡量的是运营效率;而每美元智能衡量的则是:模型智能投入,是否带来了相应的回报。

最大化每美元智能:Nemotron 3 Ultra 的后训练实践
NVIDIA Nemotron 3 Ultra 是一款拥有 5500 亿参数的开放权重混合专家 (MoE) 模型,它提供了可验证的基准测试,以及在 NeMo RL 上运行的完全公开的后训练方案。在标准的现实世界的编程能力基准测试 SWE-bench verified 中,它取得了 71.7% 的成绩,这意味着针对开源项目中的真实软件缺陷,模型在约七成的案例中生成了有效的修复方案,且每个方案都通过了该项目自身的测试验证。

NVIDIA Blackwell 平台降低了每次训练的成本,使得智能体时代所要求的高频后训练在经济上变得切实可行。而这些被构建出来的智能,最终会在模型生成的每一个 Token 中转化为价值。
NVIDIA Vera Rubin 平台则将这一优势轨迹进一步延伸,仅需 Blackwell 1/4 的 GPU 数量,即可训练超大规模模型。该平台经过了端到端的极致协同设计,旨在为智能体后训练负载最大化每美元智能:支持单次运行更多的 rollout、更多的并行环境,以及持续不断的后训练循环。
后训练工作流的实际应用
Prime Intellect 的 Lab 正在 NVIDIA Blackwell 上持续对前沿开放模型进行后训练,并借助 NVIDIA Dynamo 进行推理编排。借助 Vera Rubin,Prime Intellect 计划扩大强化学习环境的规模,在单次运行中生成更多的 rollout,并加速从训练到推理的迭代循环,帮助企业最大化每美元智能。
Prime Intellect 已对其沙箱基础设施进行优化,使其与 NVIDIA Vera CPU 深度集成,从而实现低延迟、高能效的强化学习。其软件栈中还集成了 NVIDIA Nemotron 和 NVIDIA NeMo Gym 等开源工具和模型。在将真实的强化学习沙箱工作负载与传统的 x86 架构进行对比测试时,Prime Intellect 发现,Vera CPU 的平均吞吐量高出 30%。
Perplexity 的强化学习后训练技术栈可在数百块 NVIDIA GPU 上异步运行,其基于 RDMA 的权重传输引擎,能够在不到两秒的时间内,完成万亿参数模型在训练节点与推理计算节点之间的同步。经过后训练的 Qwen3 235B 模型随后被部署在 NVIDIA 机架级扩展系统上提供服务。
Together AI 则提供后训练即服务,涵盖监督微调、强化学习以及直接偏好优化。该服务通过功能丰富的应用程序接口和软件开发工具包交付,在其 AI 原生云平台上全面支持各种后训练。目前,该服务已运行于 NVIDIA 平台及经过优化的内核库上,未来计划进一步采用 Vera Rubin 平台。
NVIDIA Vera Rubin 平台帮助 AI 工厂在各类工作负载中最大化每美元智能。同时,进一步了解 NVIDIA 面向前沿模型训练的全栈平台。
