黄仁勋“站台开源”后首款模型落地英伟达正式推出 Nemotron 3.5 Lightning单张 GPU 即可运行当地时间 8 月 11 日英伟达正式宣布推出开源 AI 模型Nemotron 3.5 Lightning。这是英伟达 CEO 黄仁勋上月底在 X 平台首次发声、公开表态支持开源模型后英伟达发布的首款开源模型。一个月前黄仁勋联合 25 家科技巨头签署公开信力挺开源 AI。一个月后他用一款实实在在的产品兑现了“开源”的承诺。现在看来整个事件都是一场商业的布局的精准落子步步为营英伟达以一种全新的方式加入了AI战局。一、专为“执行”而生300 亿参数单次只激活 30 亿Nemotron 3.5 Lightning 是一款300 亿参数的混合专家Mixture-of-Experts, MoE模型。MoE 架构的核心优势在于虽然总参数达 300 亿但每次推理只激活约 30 亿参数。这意味着它用“小模型的计算成本”实现了“大模型的容量”。英伟达对这款模型的定位非常清晰——它不是用来取代前沿推理模型的而是成为多智能体系统里的“执行型”模型。在一个复杂的企业 AI 系统里大模型负责任务规划和复杂推理Nemotron 3.5 Lightning 则承担大量代码审查、安全监控、数据处理、告警分析这类专业化工作。用英伟达的话说“前沿推理模型可以规划和协调工作流而像 Lightning 这样的小型专用模型可以执行目标任务。”二、性能炸裂输出速度提升 4 倍任务提速 30%作为一款主打“效率”的模型Nemotron 3.5 Lightning 的性能数据相当亮眼速度层面相比同类模型输出速度最高可提升4 倍智能体任务整体完成速度加快 **30%**。在预发布测试中其输出速度接近每秒 670 个 token。精度层面在衡量智能体实际工作效率的PinchBench基准测试中它达到了86% 的准确率同时在完成 10000 个任务的速度上比同等准确率的 Qwen3.6 35B 快了约 **30%**。第三方评测在 Artificial Analysis 的 Intelligence Index 中Nemotron 3.5 Lightning 得分24与 OpenAI 的 gpt-oss-120b 持平。在代理任务相关的GDPval-AA v2评测上其 Elo 达到824超越了 Nemotron 3 Super 和 gpt-oss-120b。推理优化模型支持推测解码和多令牌预测技术并配备 DFlash 和 DSpark 两个辅助模型可在多种服务场景下实现更全面的推理优化。三、真正“平民化”单张 GPU 可跑随时随地部署Nemotron 3.5 Lightning 最令人惊喜的特点是它的轻量化。据 CNBC 报道这款模型“轻量高效”可在普通笔记本电脑或台式机的单块 GPU 上流畅运行。具体支持的平台包括NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station 以及 NVIDIA Jetson 系列。同时它也可无缝扩展至边缘 AI 设备、RTX PRO 工作站、数据中心及云端环境。部署生态方面模型已获得广泛支持包括Ollama、LM Studio、Amazon SageMaker JumpStart、Google Cloud、Microsoft Foundry 和 Oracle Cloud Infrastructure等主流平台。四、开源诚意权重、数据、配方全开放Nemotron 3.5 Lightning 的开源程度超越了多数“开源”模型——不只是模型权重训练数据和训练配方也一并开放。模型采用OpenMDW-1.1 开源协议发布。开发者可以使用NeMo Automodel和NeMo Megatron Bridge进行 LoRA 或全量微调使用NeMo RL和NeMo Gym运行强化学习和基于环境的评估将英伟达的后训练数据与企业自有数据混合定制专属模型英伟达生成式 AI 副总裁 Kari Briski 用了一个形象的比喻“这正在把后训练和微调变成把碗放进洗碗机、然后按下启动键。”低成本定制的案例已经出现CodeRabbit 用英伟达的标准模型配方训练了一个 epoch约两小时、花费 85 美元就产出了一个路由智能体。另一个合作伙伴用单张 H100 卡就完成了训练。五、配套发布NeMo Switchyard——解决“模型太多谁来调度”与 Nemotron 3.5 Lightning 同步发布的还有一款开源模型路由库 ——NeMo Switchyard。它的作用是在智能体工作流的每一步把请求路由到最适合该任务的模型。复杂请求交给强大的推理模型常规执行任务交给 Nemotron 3.5 Lightning。这一发布揭示了一个关键趋势当模型足够多之后“路由”正在成为新的软件层。企业选模型的标准正在从“哪个最强”转向“哪个够用、哪个快、哪个划算”。六、行业落地 CrowdStrike、Harvey、CodeRabbit 已率先采用Nemotron 3.5 Lightning 并非停留在实验室阶段多个行业头部玩家已在定制和使用CrowdStrike用于网络安全领域Harvey with Trajectory用于法律服务CodeRabbit with Baseten用于代码审查Lila Sciences利用它提高物理和生命科学领域智能体任务的推理能力Fastino Labs在软件开发、金融和医疗工作负载方面取得了领先的准确性写给开发者1. 别再拿“大模型”干“小活”了Nemotron 3.5 Lightning 传递的信号非常明确未来的 AI 系统是多模型系统而不是单模型通吃。大模型负责规划和推理小模型负责高频执行。开发者在设计 AI 应用时应该从“选一个最强的模型”转向“为每个任务选最合适的模型”。2. 开源模型正在“平民化”推理成本单张 GPU 可跑、85 美元微调出一个智能体——这意味着中小团队也能拥有定制化 AI 的能力不再需要为每次推理支付高昂的 API 费用。对于创业公司和个人开发者这是一个值得认真评估的机会。3. 英伟达的战略从“卖芯片”到“卖整个 AI 工作流”Nemotron 3.5 Lightning NeMo Switchyard 的组合本质上是在构建一个完整的 AI 工作流生态。开源模型用得越多GPU 需求越大——英伟达正在用软件生态巩固自己的硬件护城河。4. 模型已上线现在就可以下载Nemotron 3.5 Lightning 已在Hugging Face和ModelScope平台同步上线全球开发者可免费下载、使用和修改无需向英伟达付费或申请额外许可。写在最后从黄仁勋在 X 平台发布第一条推文力挺开源到 Nemotron 3.5 Lightning 正式上线刚好过去三周。这款模型的意义不只是“又一个大模型开源了”——它标志着英伟达正在从“AI 算力的卖水人”走向“AI 工作流的定义者”。当芯片巨头亲自下场定义“什么样的模型该跑在什么样的硬件上”整个 AI 开发范式的底层逻辑正在被重新书写。正如黄仁勋上月底所说“优秀的开源 AI 大模型对整个行业大有裨益。”现在他用一款产品证明了这句话不只是说说而已。关键词标签#英伟达 #Nemotron3.5Lightning #开源模型 #AI智能体 #MoE #黄仁勋 #NeMoSwitchyard #大模型 #AI开发者 #HuggingFace