NVIDIA 推出 Nemotron 3.5 Lightning 与开源路由库 NeMo Switchyard
NVIDIA 在 Nemotron 3 系列中新增 Nemotron 3.5 Lightning,一款 300 亿参数的 mixture-of-experts 模型,面向长时间运行的 agentic AI 工作负载。NVIDIA 还开源 NeMo Switchyard,一款用于在多模型系统内智能路由请求的库,可将请求定向到最合适的模型而无需重写应用。两者合用旨在提升模型部署控制、运行效率和针对专用任务的性能。
NVIDIA 宣布扩展 Nemotron 3 模型家族,发布 Nemotron 3.5 Lightning。官方将其定位为面向长时间运行的 agentic AI 工作负载的高效模型。Nemotron 3.5 Lightning 是一个 300 亿参数的 mixture-of-experts 模型,设计用于在多模型系统中承担专门任务,例如代码审查、工具调用、安全告警监控和账单问答等。NVIDIA 表示该模型可实现最高 4 倍更快的输出速度,并比同类模型在 agentic 任务上平均缩短 30% 的完成时间。模型可通过 NVIDIA NeMo 在特定领域数据上进行后训练以提高专用任务的准确性,并随发布提供了用于训练或审计的部分数据和技术细节以及一个用于编码能力后训练的强化学习数据集 Nemotron-RL-Agentic-Terminal-Pivot。
同时,NVIDIA 发布了开源库 NeMo Switchyard,用于在流行的 agent 工具内部实现智能路由。Switchyard 能根据具体需求把每个请求路由到最合适和最高效的模型,支持开发者调优或替换路由算法以匹配质量、延迟和成本等优先级。NVIDIA 的内部基准显示,Switchyard 在保持前沿级准确度的同时,可将任务完成成本降至单独使用 Opus 4.8 的近三分之一。NVIDIA 还列举了与生态合作伙伴的评估结果,例如 Boomi 在五项路由能力评估中实现 100% 域路由准确率,将 59% 流量发送给 5 倍更快的微调模型并将后续回合延迟降低 21%。
NVIDIA 表示,Nemotron 3.5 Lightning 和 NeMo Switchyard 可在本地设备、工作站、数据中心和云端部署。厂商和机构已在定制该模型以应对各自工作负载,包括网络安全、法律服务和代码审查等领域的应用案例。整体目标是为长期运行的 agent 系统提供更高的部署控制、效率和针对专用任务的准确性。
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。