智能体账单贵,往往不是「不会选模型」,而是每一步都还在用最贵的那一档——英伟达把模型与路由器一起开源了。
英伟达除GPU外,持续用Nemotron开源模型线与NeMo软件栈切入企业Agent基础设施。企业常开Agent面临同一权衡:全程打前沿模型则账单爆炸;手写路由则成另一套要维护的工程。所谓模型路由,白话就是按步骤难度、状态与成本,把请求派给更合适的模型,而不是设计时写死一个默认大脑。
8月11日,英伟达发布约300亿参数的开源混合专家模型Nemotron 3.5 Lightning,并同步推出开源库NeMo Switchyard。公司口径称,Lightning在同类中输出速度最高约快4倍,在匹配精度下完成智能体任务约比Qwen3.6-35B快约30%;与Switchyard组合时,在自测中可把任务成本压到单独跑某前沿模型约三分之一量级,同时尽量保持任务完成水平。Lightning走混合Mamba-Transformer与潜在MoE路线,面向高吞吐专用Agent步骤;综合智商榜上并非同尺寸第一,强调的是速度—精度权衡与可定制性。
Switchyard机制与生态要点:
把「开源模型+开源路由」绑在一起,是在和「只卖更便宜权重」或「只卖路由器」的对手同时开战。下一观察点是生产环境路由策略的稳定性,以及Lightning在真实工具链中的复现曲线——Agent降本,最终拼的是系统,不是单模型海报。