NVIDIA 开源 Nemotron 3.5 Lightning:30B MoE 模型专攻长时智能体执行层
NVIDIA 发布开源的 Nemotron 3.5 Lightning,这是一个 30B 参数、3B 激活参数的 MoE 模型,面向常驻 AI 智能体的高频低延迟执行场景。借助投机解码、面向智能体框架的优化训练和量化版本,其输出速度可达同规模模型的 4 倍,权重、数据和训练配方以宽松许可开放。
NVIDIA 在技术博客中介绍了 Nemotron 3.5 Lightning,这是 Nemotron 3 家族中最小的成员:一个 30B 参数的开放 MoE 模型,每次仅激活 3B 参数,专为常驻 AI 智能体和智能体工作流中的高吞吐、低延迟执行层设计。
官方指出,长时运行的智能体大部分时间花在高频执行上——工具调用、结果校验和子智能体委派,若每一步都用前沿推理模型会带来过高成本和延迟。Lightning 定位就是承担这一执行层,与负责编排和复杂规划的前沿模型(如 Nemotron 3 Ultra)分工协作。
模型引入多项优化:训练阶段包含多 token 预测以支持投机解码,并附带 DFlash 和 DSpark 推理优化;针对 OpenClaw、Hermes Agent 等流行智能体框架做了优化训练,可提升调用准确性并降低延迟。官方称其输出速度最高可达同规模模型的 4 倍,部署范围从 NVIDIA DGX Spark 一直到数据中心。
开放性方面,权重、训练数据和配方以 OpenMDW-1.1 宽松许可发布,支持用 NeMo Automodel 和 NeMo Megatron Bridge 做 LoRA 或全量 SFT 微调,也可用 NeMo RL 和 NeMo Gym 做强化学习与环境评估。本次发布还包含用于训练部分编码智能体能力的开放智能体强化学习数据集 Nemotron-RL Agentic Terminal Pivot。
模型还可作为 NVIDIA NeMo Switchyard 模型路由的目标,与开源和闭源模型协同部署:规划类请求路由到前沿模型,执行类请求下放到 Lightning,以更高效地消耗 token。
为什么值得关注
为智能体执行层提供高效开源选择,配合模型路由可显著降低智能体运行成本,对构建生产级智能体的开发者有实际价值。