NVIDIA NeMo Switchyard

面向 LLM 流量的开源路由代理

NVIDIA NeMo Switchyard 是 Rust 编写的 LLM 流量代理与库,可跨多个模型提供方路由请求,并在 OpenAI Chat、Anthropic Messages、OpenAI Responses 协议间转换,让 Claude Code、Codex 等编程智能体调用 vLLM、NVIDIA NIM、Ollama 等端点。支持随机路由、LLM 分类器路由、信号驱动阶段路由或自定义算法,可分派流量做 A/B 基准对比,并用 Prometheus 指标记录延迟与路由开销

可观测性追踪性能基准模型路由
访问官网
收录动态

2

最近更新

2026-09-22

评价样本

未收录

GitHub Stars

3,225

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

NVIDIA NeMo Switchyard 是 Rust 编写的 LLM 流量代理与库,可跨多个模型提供方路由请求,并在 OpenAI Chat、Anthropic Messages、OpenAI Responses 协议间转换,让 Claude Code、Codex 等编程智能体调用 vLLM、NVIDIA NIM、Ollama 等端点。支持随机路由、LLM 分类器路由、信号驱动阶段路由或自定义算法,可分派流量做 A/B 基准对比,并用 Prometheus 指标记录延迟与路由开销

核心功能

3 项已整理
可观测性追踪
性能基准
模型路由

价格信息

暂无可验证价格信息

暂无足够准确的价格信息。

基础信息

更新频率
近 7 天 1 条收录动态
最近更新
2026-09-22
覆盖行业
程序员

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-09-22版本发布

    NVIDIA NeMo Switchyard 发布 v0.3.0:新增 Advisor Gate,让执行模型把审查、批准、重做交给更强顾问模型,并带会话审查预算与停滞检查点;新增 Composite 复合路由(LLM 分类器 + Stage Router)、Auto presets、switchyard-runner crate(TOML 部署、进程内路由),NeMo Relay 与 LiteLLM 接入原生路径;支持子代理路由、按目标设置 system prompt 与推理强度、按客户端请求截止时间。路由结果经 Rust/Python/日志/OpenTelemetry 返回有序模型 ID、决策元数据与证据,决策端点可只路由不执行。Python 升至 3.10+,移除旧 server 与 coding-agent 启动器,属破坏性升级,多模型流量与编程智能体部署需按迁移说明改造。

  2. 2026-08-11开源

    NVIDIA NeMo Switchyard 作为开源模型路由库与 Nemotron 3.5 Lightning 同步发布,能把智能体工作流的每一步路由到最合适且最高效的模型,内置免调优路由器,包括带会话亲和性的 LLM 分类器与阶段路由;对工作流的影响是将工具调用、结果校验、子代理委派等高频执行步骤从前沿推理模型分流到轻量模型,降低成本与延迟。

NVIDIA NeMo Switchyard 常见问题

关于 NVIDIA NeMo Switchyard 的定位、核心功能、价格与最近更新。

NVIDIA NeMo Switchyard 是什么?

NVIDIA NeMo Switchyard 是 Rust 编写的 LLM 流量代理与库,可跨多个模型提供方路由请求,并在 OpenAI Chat、Anthropic Messages、OpenAI Responses 协议间转换,让 Claude Code、Codex 等编程智能体调用 vLLM、NVIDIA NIM、Ollama 等端点。支持随机路由、LLM 分类器路由、信号驱动阶段路由或自定义算法,可分派流量做 A/B 基准对比,并用 Prometheus 指标记录延迟与路由开销。

NVIDIA NeMo Switchyard 有哪些核心功能?

NVIDIA NeMo Switchyard 当前已核验的核心功能包括:可观测性追踪、性能基准、模型路由。

NVIDIA NeMo Switchyard 如何收费?

AI Equal 当前没有收录 NVIDIA NeMo Switchyard 的可验证价格信息。

NVIDIA NeMo Switchyard 最近有什么更新?

2026-09-22:NVIDIA NeMo Switchyard 发布 v0.3.0:新增 Advisor Gate,让执行模型把审查、批准、重做交给更强顾问模型,并带会话审查预算与停滞检查点;新增 Composite 复合路由(LLM 分类器 + Stage Router)、Auto presets、switchyard-runner crate(TOML 部署、进程内路由),NeMo Relay 与 LiteLLM 接入原生路径;支持子代理路由、按目标设置 system prompt 与推理强度、按客户端请求截止时间。路由结果经 Rust/Python/日志/OpenTelemetry 返回有序模型 ID、决策元数据与证据,决策端点可只路由不执行。Python 升至 3.10+,移除旧 server 与 coding-agent 启动器,属破坏性升级,多模型流量与编程智能体部署需按迁移说明改造。