
让每一步都调用最强模型,正在成为长时AI智能体最昂贵的习惯。NVIDIA 8月11日发布30B参数混合专家模型Nemotron 3.5 Lightning,并同步推出开源路由库NeMo Switchyard:前者负责高频、边界清晰的专业任务,后者判断一轮请求该交给轻量模型还是前沿大模型。真正的新意不是又多了一张榜单,而是把“一个模型包办所有步骤”改造成可配置的模型组合。
Lightning并不试图用更小体量覆盖所有推理难题。它更像智能体系统里的执行层:整理工具返回、修改局部代码、反复检查状态、完成格式明确的步骤,把真正困难或风险较高的判断留给更强模型。NVIDIA称,在同级模型对比中,它的输出速度最高可达4倍,端到端智能体任务完成时间可缩短30%。公司还公开了用于强化学习的代码数据集,允许开发者按自己的任务继续训练或调整模型。
部署范围从RTX个人设备、DGX和Jetson延伸到数据中心与云端,这意味着同一套智能体可以把敏感或低延迟步骤留在本地,再把复杂请求交给远端模型。不过,“30B参数”和“轻量”是相对于前沿超大模型而言;显存、并发、量化方式和上下文长度仍会直接决定实际吞吐,官方速度数字不能自动外推到每一种硬件。
NeMo Switchyard是一个Rust代理与库。应用可以继续使用OpenAI Chat、OpenAI Responses或Anthropic Messages等接口形式,由中间层完成协议转换,再依据内容分类、对话阶段、升级判断或固定流量比例选择后端。它还记录请求、错误、延迟、令牌量和路由开销,便于团队观察“省钱”是否换来了质量下降。
这项设计对长时智能体尤其重要。一项任务可能包含几十到数百轮模型调用,若只有少数转折点需要前沿推理,其余步骤都使用同一高价模型,成本会随轮数快速放大。NVIDIA内部基准称,组合方案可在接近前沿准确度的同时把成本压到约三分之一;在LangChain的145个多轮任务实验中,仅7%的调用进入前沿模型,成本下降74%,代价是准确率下降6%。这组结果说明路由并非免费午餐,而是一条可以量化的质量—成本曲线。
官方列出的合作测试覆盖多种场景:Boomi报告域路由准确率达到100%,59%的流量转向速度快5倍的微调模型,后续轮次延迟下降21%;Cadence称准确率提高9.9%,Classmethod与Cognition分别报告27%和平均28%的成本下降。数字展示了小模型分工的潜力,但样本、基线、请求难度和计费方式并不统一,不能横向拼成一个通用结论。
更需要注意的是,Switchyard仓库明确把当前版本标记为pre-alpha和实验性软件,API与算法在1.0前可能大幅变化,并不建议直接用于生产。路由器本身还会增加分类延迟、故障面和观测复杂度;若它把安全审查、财务操作或高权限代码修改错误分给弱模型,节省的成本可能抵不过一次失败。
ATYUN认为,这次发布最值得关注的不是4倍速度,而是模型路由被做成了可替换、可观测的公共层。企业不再只能在“全部使用大模型”和“整体降级到小模型”之间二选一,而是可以给每类步骤设置预算、延迟和质量边界。短期内,Nemotron 3.5 Lightning需要更多独立评测,Switchyard也需要走过接口稳定、权限隔离和生产故障演练;长期看,能否把正确任务交给正确模型,可能与模型本身的能力同样决定智能体的真实成本和可靠性。
