NVIDIA 开源 LLM 流量代理,统一多模型路由
推荐指数 77.0 NO. 003 · 2026.08.13
Stars732
为什么值得看
Switchyard 是 NVIDIA 用 Rust 写的 LLM 流量代理,能自动翻译 OpenAI、Anthropic、OpenAI Responses 三种 API 格式,并把请求路由到 vLLM、NIM、Ollama 等后端。对同时用多个模型和编码 Agent 的团队,这意味着不用再为每个后端写适配层,A/B 测试和灰度发布也能直接走配置。
媒体预览
编辑判断
目前做模型路由的团队大多自己用 nginx/OpenResty 或 LiteLLM 搭,但 LiteLLM 是 Python 写的,高并发下延迟和稳定性是硬伤,而且它的协议翻译覆盖不全,Anthropic Messages 到 OpenAI 的 tool use 格式经常要手动补。Switchyard 用 Rust 重写,单节点吞吐能高一个数量级,且内置了信号驱动的 stage routing(比如先走小模型过滤,再走大模型生成),这个模式在成本敏感的场景很值钱。
已经在用 Claude Code 或 Codex 但想切到自托管模型的团队,这是最省事的迁移路径,不用改任何客户端代码。如果你现在的 LLM 网关是 Python 写的且开始遇到性能瓶颈,建议直接对比压测。
Star History
生态分析
Beta
NVIDIA 官方 LLM 网关代理,填补多后端统一接入层空白
独特价值:Rust 高性能 + NVIDIA 生态原生集成,自动翻译三大主流 API 格式