在 9 月 11 日至 14 日在阿姆斯特丹举办的 IBC 大会上,创意、技术和商业界人士齐聚一堂,将创意转化为实际行动,并共同探讨了传媒和娱乐行业的创新。来自 170 多个国家及地区超 44,000 名与会者参观了 14 个以上展厅和室外空间中的 1,300 多个展览项目,并有超过 600 位演讲者分享前沿洞见。
阅读下文,详细了解 NVIDIA 在本次活动上的重点展示内容。
NVIDIA AI for Media 将实时智能引入广播、体育和制作工作流
传媒公司正越来越多地将 AI 集成到直播制作、体育、新闻和流媒体的工作流中,以获取更丰富的表现洞察、验证视频真实性、提升内容质量与本地化处理,而这一切都不会破坏现有可信赖的广播环境。
在阿姆斯特丹举办的 IBC 2026 上,NVIDIA 宣布对 NVIDIA AI for Media 进行重大扩展,包括一系列 GPU 加速的软件开发工具包 (SDK)、NVIDIA NIM、操作指南和蓝图,旨在为传媒和娱乐工作流增强音频、视频和增强现实效果。此次扩展将探索全新的运动理解、验证和增强视频、节目本地化方式以及构建 AI 驱动的媒体应用。
今年早些时候在 SIGGRAPH 上发布的 NVIDIA 合成视频检测器 (SVD) 的 NVIDIA NIM 可帮助企业组织评估视频素材是真实拍摄还是由 AI 生成的概率,从而为编辑、内容验证、数字取证和媒体合规团队在审核过程中提供了一个全新的分析维度。
自首次发布以来,SVD 在文生视频内容的检测准确率已达 99.3%,在图生视频内容的检测准确率已达 97.7%,尤其是在处理高难度的图生视频案例时,准确率取得了显著提升。
Dalet 正在将 SVD 集成到一个面向新闻机构的安全云托管验证工作流中。这使得编辑团队能够通过 SVD 提交视频素材,并在一个 Dalet 界面中检查和审核生成的评分和元数据。
TwelveLabs 宣布其首款基于公司视频智能平台打造的应用程序 Compliance by TwelveLabs 正式开放使用,旨在帮助媒体和广播团队根据地区和自定义合规标准快速筛查内容。该解决方案集成了 SVD,可提供逐帧真实性信号和置信度分数,使媒体团队能够在同一合规工作流程中识别潜在的合成媒体。
Wowza 的 Wowza Streaming Engine 媒体服务器技术已为全球 170 多个国家及地区超过 35,000 个视频部署提供支持。该公司将通过 Wowza Video Intelligence Framework 分发 SVD。该解决方案依托 NVIDIA 加速基础设施,将助力广播公司、流媒体服务商和其他企业组织对实时视频流进行分析,并实时提取关于检测到的物体、场景和 AI 生成痕迹的数据。该方案支持本地、边缘、云端、混合部署或完全物理隔离的环境中部署和运行,从而让企业组织能够更好地控制关键媒体工作流。
NVIDIA 3D Body Pose 可根据单个摄像头拍摄的视频,估算人体关节在 2D 和 3D 的位置和角度,无需依赖标记点的动作捕捉系统,即可将人体运动转化为结构化数据。
对于体育组织而言,这些数据可用于球员和运动员的运动追踪、生物力学和表现分析、重播增强、裁判和判罚工作流、运动员安全相关的应用以及虚拟交互和沉浸式体验。
该技术还可以为内容创作工作流提供结构化的人体运动数据。当这些数据映射到兼容的角色绑定上后,关节和运动数据可作为动画分镜、数字替身、角色重定向和虚拟制作体验的输入。
Vizrt 正在将 Body Pose 技术应用于实时虚拟演播室环境中,通过追踪人体运动来驱动反射、阴影和环境渲染等实时 3D 光影效果。
Video Frame Generation (VFG) 通过生成式 AI 在视频原始帧之间创建新帧,使视频画面运动看起来更流畅。该技术能够在保持视觉质量和时间一致性的同时,将帧率提高 2 倍或 4 倍,从而为体育赛事、慢动作回放、媒体直播和其他高动态视频内容带来更加流畅的观看体验。此外,VFG 还支持针对生成式 AI 视频工作流的帧速率转换和帧提升。
Ross Video 正将 VFG 技术集成到其 Rio Replay 平台中,为体育制作生成 AI 辅助的慢动作视频。
目前,该技术已支持生成 6 倍慢动作用于体育赛事回放。正在进一步开发 8 倍插值技术。这意味着,生成的中间帧可以使回放画面更流畅,而无需依赖超高帧率的源摄像机来捕捉每一帧画面。
NVIDIA Video Super Resolution (VSR) 使用 AI 来提升视频分辨率,同时降低噪点、减少模糊和压缩伪影。全新的流媒体模式让开发者能够在实时性能和更高画质之间进行选择,可调节的控制选项有助于实现所需的增强效果。VSR 还新增了对 10-bit 视频的支持,并进一步提升了整体性能和画质。VSR 可通过 NVIDIA Video Effects SDK 和 NIM 获得,用于流媒体、广播、会议、视频回放和内容创建等应用。
该技术可以通过统一的接口,为视频播放器、会议应用、创作者工具、流媒体服务、转码器和广播系统提供支持。
NVIDIA TrueHDR 能够实时将标准动态范围 (SDR) 视频转换为高动态范围 (HDR) 输出,最高可达约 2,000 nit,同时保留局部对比度并根据内容自适应调节亮度。
VSR、VFG 和 TrueHDR 可在单一视频特效管线中结合使用,帮助媒体公司优化现有内容库,以满足流媒体、转码、游戏和创作者工作流的需求。
NVIDIA LipSync 和 Active Speaker Detection NIM 可帮助开发者为采访、新闻、体育、娱乐和其他可能出现多人出镜的节目构建本地化系统。
LipSync 可调整输入视频中的嘴部动作,使其与目标音轨相匹配,同时保留自然的头部朝向、眨眼和身体动作。新版本改善了对面部遮挡的处理,并更好地保留牙齿、嘴唇和面部纹理。
全新的 Active Speaker Detection NIM 不再需要对多条音轨进行说话人分离,并添加了语音活动检测功能,通过 gRPC 接口和更广泛的 GPU 兼容性扩展 NIM 的部署支持。
NDI 正在使用 NVIDIA AI for Media,包括 NVIDIA LipSync NIM,在现有广播工作流中实现实时翻译、唇形同步配音和多语种适配。通过从通用媒体流生成多语言版本的体验,该方法有助于广播公司触达全球受众,同时降低传统多语言发行所需的带宽、基础设施和制作复杂度。
Studio Voice 包含基于 NVIDIA Studio Voice NIM 构建的全新麦克风配置文件,使用户能够更好地控制增强语音的音色特征。
该功能旨在抑制背景噪音、降低室内混响并提高语音清晰度,然后将经过增强的输出音频转化为所选的麦克风配置,以实现更出色的实时通讯、流媒体、播客和内容创作。
试用 NVIDIA AI for Media NIM。并在 IBC 2026 大会上了解 NVIDIA 与其合作伙伴的最新工作流。
NVIDIA Holoscan for Media 提供开放媒体交换层,助力构建与连接直播媒体应用

随着广播公司、流媒体服务和体育组织纷纷采用软件和 AI,直播内容背后的基础设施正变得更加灵活、互联,并且越来越多地基于共享加速计算构建。
媒体交换层 (MXL) 与 NVIDIA Holoscan for Media 的集成可加速这一转型 —— 它提供了一个通用交换层,帮助媒体应用实现互联和协同运行。
Holoscan for Media 是一款开放参考架构和开发者工具套件,专为软件定义的直播制作构建由 AI 驱动的媒体功能和应用。MXL 为这些基于软件的媒体功能增加了一条开放途径,以便在分布式环境中交换实时视频、音频和数据。
随着制作功能走向软件化,开发者可以构建共享加速基础设施、动态连接并独立迭代的应用。这有助于媒体公司更高效地利用基础设施、更快速地引入新功能,并减少应用之间的定制化集成工作量。
该集成还为 AI 在直播媒体中的应用奠定了更坚实的基础。AI 处理、视频应用和传统媒体功能可以越来越多地在同一个加速基础设施和软件定义环境中运行。
对于技术供应商而言,这为其构建可跨更广泛、多供应商生态系统运行的应用拓展了机会。对于媒体公司而言,这为其打造能够适应格式、应用和 AI 能力不断变化的基础设施开辟了道路。
了解更多关于 Holoscan for Media 的信息。
NVIDIA Sports Intelligence Playbooks 勾勒出迈向体育领域的多模态 AI 路径

体育正成为 AI 更广泛转型的试验场:从通用模型向基于专有数据构建的、经过微调的开放模型转变。
NVIDIA Sports Intelligence Playbooks 旨在加速这一转型。它为联盟、传媒公司和技术提供商提供结构化框架,使其能够基于自身的体育赛事视频素材和注释对 NVIDIA 开放模型进行微调,从而打造出能够理解规则、运动员、计分、战术策略和场景上下文的多模态 AI。
体育机构拥有大量的专有视频、元数据和表现信息,这些都是竞争对手难以复制的信息。Sports Intelligence Playbooks 提供了将这些资产转化为 AI 能力的实用蓝图,从而为打造新的分析产品、媒体体验、自动化工具和收入来源提供支持。
该操作指南贯穿了 AI 的全生命周期,包括数据准备、微调、推理、评估、优化与部署,并整合了多项 NVIDIA 技术,包括 Nemotron、NeMo AutoModel、Megatron Bridge、NIM 和 NVIDIA 加速计算。
通过提供从模型定制到生产的集成路径,Sports Intelligence Playbooks 能够降低构建专业体育 AI 的成本和复杂度,同时增加其对计算、软件和推理栈的需求。
早期测试展现了领域专业化的潜力。在使用与训练阶段类似的提问形式对此前从未见过的视频素材进行评估时,多项选择题的准确率从约 53% 提高至 94%,开放式评估的准确率从约 5.7% 提高至 66%。
Machina Sports 正在将 Sports Intelligence Playbooks 与其体育原生数据、评估和智能体基础设施相集成,帮助版权方能够将专有媒体和专业知识转化为可私有化部署的智能,应用于直播制作、内容创作和粉丝观赛体验。
随着智能体 AI 的应用日益普及,机遇也在不断扩大。借助 NVIDIA AI-Q Blueprint,各组织可以将自身特定领域的体育模型用作智能体内的专家级智能,使智能体能够跨视频、企业数据和软件系统进行推理,从而将操作指南的应用范围从体育理解进一步延伸至决策制定和自动化。
Wowza 正在将包括 NVIDIA Cosmos 3 和 Nemotron 在内的视觉语言模型 (VLM) 集成到 Wowza Video Intelligence Framework 中,并通过 NVIDIA Sports Intelligence Playbooks 进行微调,以检测直播流媒体中的特定体育场景,从而缩短响应时间。
探索 NVIDIA Sports Intelligence Playbooks。
NVIDIA 将多语言内容本地化技术引入现场直播
面向全球受众的现场直播节目,需要的不仅仅是文字翻译。语言的细微差别、声音、时间节奏、面部表情、字幕和屏幕图形必须实时协同配合,同时保持原始节目的编辑初衷和制作质量。
为帮助广播公司、体育联盟、版权方和流媒体服务商将这些要素整合到统一的、软件定义的实时本地化工作流中,NVIDIA 正在将其内容本地化技术引入 NVIDIA Holoscan for Media 开发者工具套件。该参考工作流专为广播和流媒体开发者设计,支持字幕、音频翻译、配音、音视频同步和图形本地化。
Holoscan for Media 的内容本地化技术,为在软件定义的广播应用中各项本地化技术的协同工作提供了参考。开发者可以根据每个节目、市场或发行渠道,选择所需的功能,而无需为了每个本地化版本分别部署基础设施。
Holoscan for Media 的内容本地化技术整合了 NVIDIA AI for Media 的最新技术成果,包括面部部分被遮挡时改进的 LipSync (唇形同步) 功能,以及增强的 Active Speaker Detection (主动说话人检测) 功能,以帮助应用在多人场景中识别当前正在说话的人。
拓展直播节目的触达范围
本地化可以拓展直播节目的触达范围并改变经济效益。一套共享的、可组合的工作流,能够帮助传媒公司更快地推出区域化内容、服务更多受众,并为各个市场定制专属体验,同时确保直播制作所需的时效性、视觉语境和编辑控制。
AI-Media、CAMB.AI、Chyron 和 Panjaya 的技术,分别通过 Holoscan for Media 解决了内容本地化中的特定环节,从语音适配和屏幕呈现,到多语言字幕生成和音频翻译、图形本地化,以及在直播和点播内容中保留人物的神态和身份特征。
内容本地化技术还支持基于文件、流媒体和后期制作类应用。开发者在点播工作流中,可通过应用程序编程接口 (API) 调用相关能力;而在需要将本地化集成到直播场景时,则可以使用 Holoscan for Media 参考工作流程。这两种技术共同为构建覆盖制作和发行环节的多语言媒体服务奠定了一致的基础。
了解更多关于 NVIDIA Holoscan for Media 和 AI for Media 的信息。
