AI 工厂是一种新型基础设施,旨在制造实时运行且不间断的智能。在工业时代,发电厂将能源转化为电力;而在 AI 时代,AI 工厂则将能源转化为 Token —— 这正是推理模型、智能体以及各类智能系统的基本生产单位。
AI 工厂的经济效益由产出指标来定义:每秒生成的 Token 数量、每瓦特产出的 Token 数、单个 Token 成本,以及资源利用率和系统正常运行时间。在这种模式下,每瓦特性能直接转化为营收,而单个 Token 成本则决定了每一座 AI 工厂的经济效益。
AI 早已不再仅仅是软件,它已成为不可或缺的基础设施。

AI 工厂能够在响应数十亿次请求的同时,同步调度海量计算资源。这些工厂由软件进行编排,内部运行着不间断工作的自主多智能体系统,全天候生产智能。这些智能体系统结合性能顶尖的 AI 模型 (比如 NVIDIA Nemotron 等专有模型及开放模型) 进行推理与规划。此外,开放模型能针对企业的特定领域需求进行定制、优化并安全部署 —— 而这一切,都在 AI 工厂内一站式完成。

智能体 AI 正在改变工作负载
AI 工厂是为一种全新的工作负载而打造的:即不间断的推理,它所能做的远不止是回答提示词。自主智能体能够进行推理、规划、搜索、使用工具、检索数据、编写代码并采取行动。它们还能创建子智能体,这些子智能体会学习如何使用特定领域的工具,并发展出属于自己的 AI 技能。这种多智能体系统使得 AI 工作负载的推理链条更长、思考层次更深,且对算力的需求也大幅增加。这也从根本上改变了基础设施必须承担的使命。其性能表现取决于能否让整个工作流高效运转,从而确保智能产出能无缝衔接下一步、下一个动作以及下一次决策。

自主智能体正在重塑架构
自主智能体的运行,依赖于加速计算与高速内存的协同、用于存储上下文的存储系统、用于协调通信的网络、用于编排调度的软件,以及负责具体执行的 CPU。工作负载在整个技术栈中动态流动,且每一步往往都有极其严苛的延迟要求。AI 工厂是由全栈系统构成的,其设计初衷就是确保这些工作流能够不间断地运转,满足规模化高效产出 Token 所需的吞吐量、响应速度和资源利用率。
AI 工厂依赖于极致协同设计
硬件、网络、内存、存储和软件被作为一个整体进行架构设计,并在每一层进行持续优化,以提高资源利用率、降低单个 Token 生成成本并提高整体产出。这种设计在满足不间断、交互式 AI 工作负载所需的响应速度的同时,还能够支撑大规模生产所需的高吞吐量,实现了完美的平衡。
推理已成为一项实时编排挑战
随着 AI 工作流越来越长、交互性越来越强,整个工厂必须实现实时运转。这意味着系统需要路由调度、管理内存、协调各项服务、平衡延迟与吞吐量,并在整个技术栈中保持极高的资源利用率。在 AI 工厂中,软件层至关重要,因为工厂能否高效运转,直接决定了它能产出多少智能以及能创造多大价值。如今,推理已经演变成一项贯穿整台机器的实时编排挑战。


然而,要高效运营一家 AI 工厂,早在系统正式上线之前就需要开始准备工作。推理过程所需的全栈协同设计理念,同样也改变了 AI 工厂的规划、验证以及上线方式。
在 AI 计算领域,每瓦特性能已然成为衡量 AI 工厂竞争力的终极标准。过去,数据中心用于存储文件;如今,AI 工厂则用于生产 Token。对于 AI 提供商而言,这一产出直接决定了其营收;对于企业用户而言,单个 Token 成本则决定了他们能否实现 AI 的规模化盈利。
SemiAnalysis InferenceX 基准测试,用现实应用的指标量化了这一转变。NVIDIA Blackwell Ultra GPU 能够实现目前最低的单个 Token 成本,使得 AI 工厂能够在相同的功耗范围内,以更低的单位成本产出更多的智能。每瓦特产出更多的 Token,意味着在同等的基础设施成本、空间或功耗下,能够获得更高的吞吐量。而更低的单个 Token 成本,则显著改善了大规模推理的经济效益。

基于 NVIDIA Blackwell Ultra 构建的 AI 工厂,每兆瓦的吞吐量提升了高达 50 倍,从而将单个 Token 成本降低至 1/35 —— 在规模化应用中完美平衡了性能、响应速度和能效。NVIDIA Dynamo 框架则有助于编排长上下文推理和海量推理吞吐量,确保在工作负载日益交互化和复杂化的情况下,依然能保持极高的资源利用率。两者结合,充分展现了如今衡量 AI 工厂性能的新标准:即一座工厂能够以多高的效率实时产出智能。

NVIDIA Vera Rubin 平台进一步推高了这条性能曲线。随着推理和智能体 AI 的规模不断扩大,基于 Vera Rubin 的系统旨在通过 LPX 技术,将每瓦特性能最高提升 35 倍,并凭借更深层次的全栈优化进一步降低 Token 成本。其最终成果,就是在工厂层面实现更加高效的智能生产。


从芯片到全栈 AI 工厂
这一切始于 GPU,如今已扩展为涵盖加速计算、高速互连、液冷系统、推理软件、自主智能体、参考架构以及规模化建设和运营所需生态系统的全栈 AI 工厂。
全栈 AI 工厂是 NVIDIA 正在助力定义和构建的更广泛生态系统的重要组成部分。NVIDIA 与思科、戴尔、HPE、联想和 Supermicro 等全球系统合作伙伴紧密协作,将 AI 基础设施带入企业数据中心。同时,NVIDIA 还依托精心构建的 AI 软件合作伙伴生态系统,针对每个企业的具体用例打造 AI 解决方案。该生态系统支持企业在专有模型和开放模型之间自由选择。
这些 AI 工厂能够广泛应用于多种场景,从智能体 AI 工作负载到物理 AI 和机器人领域。各行各业的所有组织,从金融服务、生命科学到制造业和公共部门 —— 都将需要自建或租用一座 AI 工厂。
NVIDIA 自身也运营着一家企业级 AI 工厂,以加速公司的研发进程,目前有数百个自主 AI 智能体在协助工程、软件和运营团队开展工作。这是一个极具说服力的实践案例:AI 工厂能够彻底改变企业构建、设计和运营的方式。它们能够显著提升企业内部的生产力,让 AI 从一种偶尔使用的工具,转变为直接融入日常工作的核心能力。
AI 工厂可以从小规模起步,支持单一的业务部门或特定工作负载;也可以从零开始进行整体构建,以支持超大规模的高性能 AI 推理与训练。NVIDIA DSX 参考设计将设计、仿真、运营以及生态系统技术进行了统一整合,旨在以最低的每兆瓦 Token 成本来构建十亿瓦级的超大型 AI 工厂。
构建这种十亿瓦级的 AI 工厂,需要的远不止是优化后的计算能力。它还需要一个共享的数字环境,以便在动工建设之前,将设施设计、硬件系统、电力、冷却和运营等环节进行联合建模,并在部署后持续进行优化。NVIDIA Omniverse DSX Blueprint 通过连接设施、硬件和软件的数字孪生技术来支持这一工作流。它利用 Omniverse、OpenUSD 和 SimReady 资产,帮助合作伙伴验证设计方案,并在 AI 工厂的整个生命周期内优化运营。

全栈方法有助于组织从每个系统中挖掘出更多的智能,将 AI 基础设施转化为一个自主运转、全天候运行的推理、行动与洞察引擎。上一次工业革命将能源转化为动力,而这一次则将能源转化为智能。AI 工厂正是这一新时代的基石,旨在为下一波经济增长提供强劲动力。