Nvidia|开源Nemotron 3.5 Lightning与NeMo Switchyard

PromptTree|阅读 2
2026/08/12 21:47
NvidiaNemotronSwitchyard开源模型Agent路由
8月11日,英伟达发布约300亿参数开源模型Nemotron 3.5 Lightning,并开源NeMo Switchyard按步路由库;自测称与路由组合可将任务成本压至单跑某前沿模型约三分之一量级,早期伙伴披露显著降本。

智能体账单贵,往往不是「不会选模型」,而是每一步都还在用最贵的那一档——英伟达把模型与路由器一起开源了。

英伟达除GPU外,持续用Nemotron开源模型线与NeMo软件栈切入企业Agent基础设施。企业常开Agent面临同一权衡:全程打前沿模型则账单爆炸;手写路由则成另一套要维护的工程。所谓模型路由,白话就是按步骤难度、状态与成本,把请求派给更合适的模型,而不是设计时写死一个默认大脑。

8月11日,英伟达发布约300亿参数的开源混合专家模型Nemotron 3.5 Lightning,并同步推出开源库NeMo Switchyard。公司口径称,Lightning在同类中输出速度最高约快4倍,在匹配精度下完成智能体任务约比Qwen3.6-35B快约30%;与Switchyard组合时,在自测中可把任务成本压到单独跑某前沿模型约三分之一量级,同时尽量保持任务完成水平。Lightning走混合Mamba-Transformer与潜在MoE路线,面向高吞吐专用Agent步骤;综合智商榜上并非同尺寸第一,强调的是速度—精度权衡与可定制性。

Switchyard机制与生态要点:

  1. 动态路由:随工具返回、错误或步骤变简单,可基于Agent状态、分类器乃至对冗长度的预估选模型。
  2. 网关集成:与Kong、LiteLLM、OpenRouter等对接,尽量嵌进现有调用链。
  3. 框架伙伴:LangChain、Cognition、Nous等可直接调用;早期测试公开口径包括LangChain在多轮任务上称成本下降约74%(仅约7%调用打到前沿模型),Ramp称成本降约58%、耗时降约33%。

把「开源模型+开源路由」绑在一起,是在和「只卖更便宜权重」或「只卖路由器」的对手同时开战。下一观察点是生产环境路由策略的稳定性,以及Lightning在真实工具链中的复现曲线——Agent降本,最终拼的是系统,不是单模型海报。