关注开发工具70 分
NVIDIA NeMo Switchyard:让 AI 智能体在多模型间智能路由
NVIDIA 发布 NeMo Switchyard,一个供应商无关的模型路由 SDK,让 AI 智能体根据模型能力、成本和基础设施信号,为每个任务动态选择最合适的模型。官方称与 LangChain、Cognition 的测试显示,路由可在保持高准确率的同时显著降低成本。
NVIDIA 技术博客介绍了 NeMo Switchyard,其核心是模型路由:在运行时由路由器评估每个请求及其上下文,把任务发给最符合要求的模型,从而在准确率与成本之间取得比'全部用最强模型'更优的平衡。
博客解释了路由决策依赖三类信号:模型能力(哪些模型能正确解决任务)、模型成本画像(延迟与费用)以及基础设施信号(负载、错误等,用于可靠交接)。路由器可以从请求本身(分类、嵌入特征)、模型状态(logprobs、智能体轨迹等)和系统层面(定价、延迟、负载)获取信息。
官方举例称,在 Terminal-Bench Hard 基准的计算机使用任务中,DeepSeek V4 整体准确率最高,但 Kimi K2.6 更适合 ML 和 RL 任务组,Qwen3.5 397B A17B 在数学与科学上更优,其余任务组则应使用 DeepSeek V4,路由可以按任务组甚至单任务阶段进行。
NeMo Switchyard 提供厂商无关的 SDK,同时支持免调优和可调优的路由算法,开发者也可自带路由算法和定制数据,路由逻辑与具体模型供应商解耦,便于随部署变化灵活调整。官方称与 LangChain 和 Cognition 的基准与真实测试显示,该方案可在维持高准确率的同时显著降低成本。
为什么值得关注
模型路由正成为智能体生产部署的关键工程层,该工具让'多模型系统'更易落地,帮助开发者控制成本与延迟。