8月11日,NVIDIA 做了一件不太像它风格的事:不发芯片,发模型。而且一次发了两个——Nemotron 3.5 Lightning,一个 30B 参数的开源模型;NeMo Switchyard,一个开源的模型路由库。
前者解决”Agent 执行层太贵”,后者解决”怎么让贵模型和便宜模型分工”。两个东西配合起来,NVIDIA 说能把 Agent 任务成本压到 Claude Opus 4.8 单独跑的三分之一。LangChain 实测更激进——145 个多轮 Agent 任务,成本降了 74%,只有 7% 的请求发到了前沿模型。
这篇文章讲清楚两件事:Nemotron 3.5 Lightning 是什么、怎么用;NeMo Switchyard 怎么装、怎么跑。我在 macOS 上实际安装了 Switchyard,下面的命令和输出都是真实跑出来的。
Nemotron 3.5 Lightning:不是”小号前沿模型”,是 Agent 的执行工
先说清楚定位。NVIDIA 在 Nemotron 3 系列里分了三档:
- Ultra(550B/55B 激活):前沿推理,做规划和复杂决策
- Super(120B/12B 激活):中等推理,多 Agent 系统的主力
- Lightning(30B/3B 激活):高吞吐执行,跑工具调用、代码审查、结果验证这类重复性活
Lightning 不是用来跟 GPT-5.6 或 Claude Opus 5 拼推理深度的。它的设计目标是:Agent 工作流里 80% 的步骤其实是”读文件、跑命令、检查报错、调工具”这类操作,不需要前沿模型的全部分辨率,但需要快、需要便宜。
架构上是混合 Mamba-2 + MoE + Attention,30B 总参数但每个 token 只激活 3B,所以吞吐量高。NVIDIA 自己测的 PinchBench 85.37 分,SWE-Bench Verified 51.56%,Terminal-Bench 2.1 只有 24.58%——后者说明它确实不适合当主力编程 Agent,但作为执行层够用。
关键参数:
| 指标 | 数值 |
|---|---|
| 架构 | Hybrid MoE (Mamba-2 + MoE + Attention) |
| 总参数 / 激活 | 30B / 3B |
| 上下文 | 最高 1M(单卡 H100 实际约 256K) |
| 许可证 | OpenMDW-1.1(允许商用) |
| OpenRouter 价格 | $0.10/M 输入、$0.25/M 输出、$0.05/M 缓存读 |
| 免费层 | 有(nemotron-3.5-lightning:free) |
和同一天发布的 Meta Muse Code 比,Nemotron 3.5 Lightning 不是终端编程 Agent,而是可以嵌入 Agent 框架的底层模型。和上周的 DeepSeek V4-Flash 比,V4-Flash 是”一个模型干所有事”,Lightning 是”只干执行层那部分”。
怎么用:三种路径
路径一:OpenRouter API(最快,零部署)
在 OpenRouter 上模型 ID 是 nemotron-3.5-lightning-30b-a3b,有免费层可以直接试。如果你已经在用 OpenRouter,切过去就是改个模型 ID 的事:
# 运行环境:Python 3.10+,需 pip install openai
# 需设置环境变量 OPENROUTER_API_KEY
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="你的_OPENROUTER_KEY"
)
response = client.chat.completions.create(
model="nemotron-3.5-lightning-30b-a3b",
messages=[
{"role": "system", "content": "你是一个代码审查助手,只回复问题清单,不修改代码。"},
{"role": "user", "content": "审查这段 Python 代码:\n```python\ndef add(a, b):\n return a + b\n```"}
],
temperature=0.6,
max_tokens=500
)
print(response.choices[0].message.content)
print(f"\n消耗 token: 输入 {response.usage.prompt_tokens}, 输出 {response.usage.completion_tokens}")路径二:本地部署(需要显卡或 Mac)
NVIDIA 和 vLLM、Ollama、llama.cpp、LM Studio 都做了首日支持。如果你的机器有 24GB 显存的显卡或 M4+ 芯片的 Mac:
# Ollama(最简单)
ollama pull nemotron-3.5-lightning
ollama run nemotron-3.5-lightning
# vLLM(生产部署)
pip install vllm
vllm serve "nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4"HuggingFace 上有两个版本:BF16 全精度(需要 80GB 显存,适合微调)和 NVFP4 量化版(约 18GB,适合推理部署)。
路径三:Cline 集成(如果你用 Cline 编程)
Cline 已经第一天支持。打开 Cline → Settings → API Provider 选 OpenRouter → 模型下拉选 nemotron-3.5-lightning-30b-a3b,完事。
NeMo Switchyard:让前沿模型只干 7% 的活
如果说 Nemotron 3.5 Lightning 是”便宜的执行工”,NeMo Switchyard 就是”调度员”——它坐在你的 Agent 和模型之间,自动判断每一步该发给谁。
举个具体场景:你让 Claude Code 写一个功能。整个流程可能是:
- 读 package.json(简单,不需要 Opus)
- 分析依赖关系(中等,Lightning 够用)
- 设计架构方案(复杂,需要前沿模型)
- 写代码(中等,Lightning 够用)
- 跑测试读报错(简单,Lightning 够用)
- 修复 bug(中等,Lightning 够用)
没有 Switchyard 的时候,6 步全发 Opus,账单爆炸。有了 Switchyard,只有第 3 步发 Opus,其余 5 步发 Lightning。LangChain 的实测数据验证了这个模式:145 个多轮任务,74% 成本降低,只有 7% 的请求发到前沿模型,精度损失 6 个百分点。
实测安装:3 分钟跑通
我在 macOS 上实际安装了 NeMo Switchyard,过程很顺:
# 前置条件:需要 uv(Python 包管理器)
# 没有就装:curl -LsSf https://astral.sh/uv/install.sh | sh
# 安装 NeMo Switchyard
uv tool install --python 3.12 "nemo-switchyard[cli,server]"安装输出:
Resolved 33 packages in 4.90s
Downloaded nemo-switchyard (8.3MiB)
Prepared 23 packages in 11.28s
Installed 33 packages in 58ms
+ nemo-switchyard==0.2.0
+ openai==2.54.0
+ anthropic==0.121.0
+ fastapi==0.141.1
+ uvicorn==0.52.1
...
Installed 1 executable: switchyard验证安装:
$ switchyard --help
usage: switchyard [-h] [--version] {serve,launch} ...
Switchyard LLM proxy
positional arguments:
{serve,launch}
serve Serve a routing-profile bundle
launch Launch a coding agent through the native server两个核心命令:
switchyard serve:启动路由代理服务(需要 YAML 配置文件,默认端口 4000)switchyard launch:直接通过代理启动 Claude Code / Codex CLI / OpenClaw
启动 Claude Code 走 Switchyard 路由
最简单的用法——让 Claude Code 走 Switchyard 路由,而不是直接打 Anthropic API:
# 设置 OpenRouter API Key(Switchyard 通过 OpenRouter 调用各模型)
export OPENROUTER_API_KEY="你的_OPENROUTER_KEY"
# 通过 Switchyard 启动 Claude Code
switchyard launch claude --model switchyard
# 也可以启动 Codex CLI 或 OpenClaw
switchyard launch codex --model switchyard
switchyard launch openclaw --model switchyard--model switchyard 用的是 Switchyard 打包的默认路由配置(Lightning 做执行层 + 前沿模型做规划)。你也可以写自己的 TOML 配置:
switchyard launch claude --model my-route --config routes.toml四种路由策略
Switchyard 内置四种路由算法:
| 策略 | 适用场景 | 工作方式 |
| LLM Classifier | 请求内容决定用哪个模型 | 用一个小模型判断当前请求该发到弱模型还是强模型 |
| Stage Router | 根据对话阶段自动路由 | 分析工具结果、错误信号等上下文信号,不需要额外模型调用 |
| Escalation Router | 先跑弱模型再判断是否升级 | 每步先用 Lightning 跑,judge 模型判断结果是否够好,不够再发前沿模型 |
| Random | A/B 测试 | 固定比例分流,用于基准测试 |
我建议从 Stage Router 开始——它不需要额外模型调用来做路由决策,靠对话中的信号(比如工具返回了报错就升级到强模型)自动判断,省 token 效果最好。
独立代理模式
如果你不想用 launch 命令直接启动 Agent,也可以把 Switchyard 当独立代理跑:
# 启动代理服务(默认端口 4000)
switchyard serve --routing-profiles config.yaml --inbound both
# 验证健康检查
curl http://localhost:4000/health–inbound both 表示同时接受 OpenAI 和 Anthropic API 格式的请求。你的 Agent 配置里把 API base URL 指向 http://localhost:4000 就行,Switchyard 会自动翻译格式。
和 Muse Glimmer 比:同一天发布的两个 30B 模型怎么选
8月11日有个巧合:Meta 也在这天发布了 Muse Glimmer,同样是 30B 参数的开源模型,同样面向本地 Agent。但设计哲学完全不同:
| 维度 | Nemotron 3.5 Lightning | Meta Muse Glimmer |
| 架构 | MoE(30B/3B 激活) | 稠密(29.6B 全激活) |
| 模态 | 纯文本 | 文本 + 图像 |
| 上下文 | 最高 1M | 131K |
| 许可证 | OpenMDW-1.1 | Apache 2.0 |
| OpenRouter 价格 | 0.10/0.25 | 0.35/1.50 |
| 本地部署门槛 | NVFP4 量化约 18GB | 4-bit 量化约 20GB |
| 核心优势 | 吞吐量高、成本极低、适合路由分工 | 多模态、通用能力更强 |
| 核心劣势 | 纯文本、Terminal-Bench 低 | 贵 3.5-6 倍、上下文短 |
简单说:如果你要搭多模型路由系统,选 Lightning;如果你要一个本地全能 Agent,选 Glimmer。
如果你对本地部署开源模型感兴趣,可以参考之前的 本地部署大模型完全指南,里面有 Ollama 和 LM Studio 的详细对比。
一个踩坑提醒:别拿 Lightning 当主力编程模型
Nemotron 3.5 Lightning 的 Terminal-Bench 2.1 只有 24.58%,这个分数意味着它独立做复杂编程任务时会频繁出错。如果你把它当 Claude Code 的唯一模型来用,体验会很差。
正确的用法是搭配——让 Claude Opus 5 或其他前沿模型做规划和复杂推理,Lightning 跑那些重复性的工具调用和验证步骤。Switchyard 的 Escalation Router 特别适合这个模式:先用 Lightning 跑,跑不好再升级到 Opus。
另一个注意点:NeMo Switchyard 目前是 pre-alpha 阶段(PyPI 分类是 3 – Alpha),NVIDIA 官方说”不建议用于生产环境”。现在适合测试和验证路由策略,等稳定后再上生产。
开发者现在该做什么
装 Switchyard 试路由:uv tool install --python 3.12 "nemo-switchyard[cli,server]",3 分钟装完,用 switchyard launch claude --model switchyard跑一轮看看路由日志- 在 OpenRouter 上试 Lightning:有免费层,跑几个工具调用场景看看输出质量和速度
- 评估你的 Agent 账单:如果你的 Agent 工作流里超过 50% 的步骤是”读文件、跑命令、检查结果”这类操作,Switchyard + Lightning 的组合大概率能砍掉一半以上成本
- 等 Switchyard 稳定版:现在 pre-alpha,合作生态(LangChain、LiteLLM、Kong 等)还在集成中,预计几周内会有更成熟的方案
如果你在用 pxpipe 省 token 或 Codebase Memory MCP,Switchyard 是不同层面的优化——pxpipe 是"让单次请求更便宜",Switchyard 是"让贵的请求变少"。三个方案可以叠加用。
更多 AI 工具实战内容,可以看 AI 实战应用指南。




发表回复