NVIDIA 与本地 AI 社区共同推动开源模型和智能体发展

作者

固定导语:开源生态系统正帮助 AI 发烧友和开发者更轻松地在本地构建、定制和拥有强大运行能力的智能体。

整个 8 月,NVIDIA 将聚焦推动本地 AI 发展的合作伙伴和开源社区,以及整个生态中不断涌现的模型、应用和工具。其中包括 NVIDIA 最新推出的开放模型、软件和开发者工具,以及帮助用户快速入门的加速计算、软件库和教育资源。

这将成为智能体领域的重要月份。敬请关注本期 NVIDIA 本地 AI 特别博客系列,了解最新进展;未来几周还将有更多内容。

请关注 NVIDIA 微博抖音哔哩哔哩官方账号, 获取 NVIDIA RTX Spark 以及 NVIDIA RTX AI PC 的最新信息。


北京时间 2026 年 8 月 11 日 21:00🔗

NVIDIA 推出 Nemotron 3.5 Lightning,助力打造快速且专用的智能体任务

8 月 11 日,NVIDIA 推出 Nemotron 3.5 Lightning,扩展 Nemotron 3 模型系列。这是一款面向始终在线智能体、可定制的开放式 300 亿参数混合专家模型 (MoE)

与同类开放模型相比,Nemotron 3.5 Lightning 的 Token 生成速度提升高达 4 倍,任务完成速度提升 30%。

此外,Nemotron 3.5 Lightning 采用开放权重,AI 发烧友和开发者可使用自己的示例对其进行微调,使其更好地匹配特定任务、兴趣和工作流。例如,用户可训练该模型以实现:

  • 指定风格写作:在撰写电子邮件、报告或其他文档时,遵循既定语气、格式和术语。
  • 掌握专业技能:更深入地理解摄影、游戏或 3D 设计等领域的语言和常见任务。
  • 遵循特定编程方式:在编写、审查或重构代码时,遵循首选的编码规范、框架和测试方法。

结合对应用、文件及其他工具的访问能力,这些经过微调的模型可支持更加个性化的本地代理式 AI 体验,例如帮助管理电子邮件和日历的助手、处理日常事务的智能家居智能体,以及在本地代码库中与开发者协同工作的编程伙伴。

NVIDIA 与 vLLM、Ollama、llama.cpp 以及 LM Studio 合作,为 Nemotron 3.5 Lightning 模型提供出色的本地部署体验,并为开发者提供 NVFP4 和 GGUF 格式的模型选择。Unsloth 同时也提供首日支持,可通过 Unsloth Studio 使用经过优化和量化的模型,以实现高效的本地部署。

Nemotron 3.5 Lightning 可在 NVIDIA RTX PCNVIDIA DGX SparkOEM GB10 产品NVIDIA Jetson 上本地运行,并可扩展至 RTX PRO 工作站、数据中心和云端环境。宏碁、华硕、戴尔、Exxact、技嘉、惠普、联想、微星和超微电脑均提供 NVIDIA Blackwell 系统,用户可从丰富的设备和外形规格中选择适合自身需求的产品。

随着生成式 AI 应用加速普及,企业正寻求在不牺牲前沿智能能力的前提下,有效控制不断上涨的 Token 成本。NVIDIA NeMo Switchyard 是一个开源路由库,可根据准确性、速度和成本,将智能体工作流中的每个步骤自动路由至最合适的模型。该库还为开发者提供跨模型和提供方处理不同任务的灵活性。

内部基准测试显示,NeMo Switchyard 通过在模型系统中路由每个步骤,帮助保持前沿级任务完成能力,同时将基准测试的完成成本降至单独使用 Opus 4.8 时的约三分之一。NeMo Switchyard 已在 GitHub 上提供。

查看 Nemotron 3.5 LightningNeMo Switchyard 技术博客开始体验。如需在边缘端进行构建,可从 Jetson AI Lab 教程入手,并探索现实世界的 Jetson 项目。Nemotron 3.5 Lightning 还可通过 OpenRouter、 NVIDIA NIM,以及 NVIDIA 云合作伙伴、后训练平台、推理平台和云服务提供商组成的广泛生态系统获取。NeMo Switchyard 已在 GitHub 上提供。


北京时间 2026 年 8 月 11 日 23:00🔗

NVIDIA Sync Cluster Assistant 让 DGX Spark 性能倍增

GLM 5.2DeepSeek V4 Flash 等全新开放模型正将云端级智能带到本地系统,使编程智能体和研究智能体等高级工作负载在本地运行成为可能。但运行这些更大规模的模型可能需要多个 GPU 或多台 DGX Spark 协同工作。

NVIDIA Sync 应用更新让多台 DGX Spark 组建为集群,提供运行更大模型所需的内存容量、推理性能和训练吞吐量,并实现更快的运行速度。

NVIDIA Sync 支持 Windows 和 macOS,可自动检测已连接的系统,通过 Tailscale 提供私密且安全的远程访问,并让开发者无需手动配置网络或复制终端命令,即可在一台或多台 DGX Spark 上启动应用。

NVIDIA Sync 中的 Cluster Assistant 可自动将两台或更多台 DGX Spark 配置为高速集群。开发者通过 NVIDIA ConnectX-7 端口连接这些系统后,NVIDIA Sync 便会完成网络配置、在各节点间调度工作负载,并监控系统运行状况。

如需开始在 DGX Spark 上使用代理式 AI,请查看 NemoClawOpenClawHermes AgentOpenShell Playbook。

软件产品信息请查看声明


北京时间 2026 年 8 月 11 日 23:00🔗

更多 DGX Spark 更新

8 月下旬,两项面向开发者的精彩新功能将推出。

DGX Spark 将迎来原生 ARM64 Linux 版本的 Chrome,用户可通过 DGX Dashboard 一键安装。这意味着用户可在DGX Spark上体验账号同步、完整扩展生态系统、跨设备连续性,以及其他平台标配的功能。只需登录一次,浏览器环境即可从笔记本电脑无缝延续至 DGX Spark 。

全新 NVIDIA Sync 资源监视器提供单台 DGX Spark 或整个集群中 CPU 和 GPU 使用情况的实时与历史视图,无需额外安装监控软件和复杂配置。一目了然的可视化内容可帮助用户跟踪工作负载进度、在添加作业或模型前确认可用资源容量,并快速发现瓶颈或异常行为。框选缩放功能支持用户从全局视图深入到工作负载中的特定时段,从而更快排查问题,并充分发挥系统性能。


北京时间 2026 年 8 月 12 日 00:00🔗

LTX 推出 LTX-2.5

LTX-2.5 是 LTX 领先研究团队推出的最新开放世界视频生成模型,为媒体与娱乐、机器人、实时生成等领域的使用场景奠定基础。该模型可生成更高质量的视频,更准确地遵循提示词,并在多次生成中保持角色、场景和声音的一致性。

全新多镜头支持让创作者可生成跨越多个剪辑镜头的连续片段,且保持内容连贯性;升级后的扩散视频解码器可提升画质保真度并减少伪影。创作者还可通过生成式编辑优化现有素材,无需从头开始制作,便可更轻松地修正细节并保持精致统一的视觉效果。 

全新提示词增强器采用 Gemma4 E2B 和定制的 Gemma4 12B 文本编码器,可显著提升提示词遵循能力,让创作者更精准地控制导出结果。

全新扩散视频解码器与变分自动编码器视频解码器相辅相成,通过提供第二条解码路径提升最终渲染视频的质量。

LTX-2.5 针对 NVIDIA RTX GPU、DGX Spark 进行优化,性能提升 2 倍,内存占用降低 40%。创作者可通过开箱即用的 ComfyUI 工作流,在本地使用 NVFP4、FastVideo 和 ComfyUI 优化,进行文生视频、图生视频和视频到视频生成。

查看页面了解有关 LTX-2.5 的更多详情,查看如何在 NVIDIA 硬件上进行高质量本地视频生成。


北京时间 2026 年 8 月 12 日 01:00🔗

NVIDIA GPU 加速的全新开放模型

NVIDIA 近期发布 Cosmos 3 Edge,这是一款面向机器人、智能汽车和视觉 AI 领域的 40 亿参数开放世界模型。其规模仅为 Cosmos 3 Nano 的四分之一,可在 NVIDIA DGX Spark 和 NVIDIA Jetson 设备端运行。

MiniMax-H3 是一款拥有 330 亿参数的开放权重模型,可通过文本、图像、视频、音频或四者组合生成视频和原生同步的立体声音频。创作者可通过 ComfyUI 使用该模型,并借助针对 NVIDIA GPU 优化的 checkpoints 在本地运行。

Poolside AI 推出 Laguna S 2.1,这是一款 1180 亿参数开放权重智能体编程模型,可处理持续数小时的长时任务。借助 NVFP4 checkpoint,开发者可在单台 NVIDIA DGX Spark 上以更低的计算和内存需求在本地运行该模型,同时不牺牲准确性。 

DeepSeek 近期更新 DeepSeek-V4-Flash,这是一款拥有 130 亿激活参数和 100 万 Token 上下文窗口的 2840 亿参数混合专家模型(MoE)。

Thinking Machines Lab 的 Inkling-Small 是一款前沿级的开放权重多模态模型,具备跨文本、图像和音频的原生推理能力,并支持可调节推理强度。该模型可在两台 DGX Spark 上运行。针对 NVIDIA Blackwell 优化的 NVFP4 checkpoint 已在 Hugging Face 上提供。

Unsloth 将于周一推出 Unsloth Desktop。该产品将本地模型推理、图像和视频生成、微调、智能体集成、网络研究和代码执行整合到一款完全开源的桌面应用中。发布资料称,这是首款可在本地训练并运行 AI 模型的桌面应用。

Unsloth Desktop 将本地 AI 训练与本地推理整合到一款完全开源的桌面应用中。

这是首款可在本地训练并运行 AI 模型的桌面应用。

阿里巴巴近期发布 Wan-Animate-2,这是一款 140 亿参数的开放权重模型,可将驱动视频中的动作和面部表情迁移到静态角色图像上,适用于真人、卡通人物、机器人或动物。凭借 ComfyUI 首日支持,该模型在 NVIDIA RTX PRO 5000 Blackwell (48GB) 上的生成速度最高可达  Apple M3 Ultra 的 16 倍。

请根据您所在区域适用的法律要求浏览、选择和使用资源。