NVIDIA 终于下场做模型了:Nemotron 3.5 Lightning + NeMo Switchyard,Agent 账单砍掉七成怎么做到的

8月11日,NVIDIA 做了一件不太像它风格的事:不发芯片,发模型。而且一次发了两个——Nemotron 3.5 Lightning,一个 30B 参数的开源模型;NeMo Switchyard,一个开源的模型路由库。

前者解决”Agent 执行层太贵”,后者解决”怎么让贵模型和便宜模型分工”。两个东西配合起来,NVIDIA 说能把 Agent 任务成本压到 Claude Opus 4.8 单独跑的三分之一。LangChain 实测更激进——145 个多轮 Agent 任务,成本降了 74%,只有 7% 的请求发到了前沿模型。

这篇文章讲清楚两件事:Nemotron 3.5 Lightning 是什么、怎么用;NeMo Switchyard 怎么装、怎么跑。我在 macOS 上实际安装了 Switchyard,下面的命令和输出都是真实跑出来的。

Nemotron 3.5 Lightning:不是”小号前沿模型”,是 Agent 的执行工

先说清楚定位。NVIDIA 在 Nemotron 3 系列里分了三档:

  • Ultra(550B/55B 激活):前沿推理,做规划和复杂决策
  • Super(120B/12B 激活):中等推理,多 Agent 系统的主力
  • Lightning(30B/3B 激活):高吞吐执行,跑工具调用、代码审查、结果验证这类重复性活

Lightning 不是用来跟 GPT-5.6 或 Claude Opus 5 拼推理深度的。它的设计目标是:Agent 工作流里 80% 的步骤其实是”读文件、跑命令、检查报错、调工具”这类操作,不需要前沿模型的全部分辨率,但需要快、需要便宜。

架构上是混合 Mamba-2 + MoE + Attention,30B 总参数但每个 token 只激活 3B,所以吞吐量高。NVIDIA 自己测的 PinchBench 85.37 分,SWE-Bench Verified 51.56%,Terminal-Bench 2.1 只有 24.58%——后者说明它确实不适合当主力编程 Agent,但作为执行层够用。

关键参数:

指标数值
架构Hybrid MoE (Mamba-2 + MoE + Attention)
总参数 / 激活30B / 3B
上下文最高 1M(单卡 H100 实际约 256K)
许可证OpenMDW-1.1(允许商用)
OpenRouter 价格$0.10/M 输入、$0.25/M 输出、$0.05/M 缓存读
免费层有(nemotron-3.5-lightning:free

和同一天发布的 Meta Muse Code 比,Nemotron 3.5 Lightning 不是终端编程 Agent,而是可以嵌入 Agent 框架的底层模型。和上周的 DeepSeek V4-Flash 比,V4-Flash 是”一个模型干所有事”,Lightning 是”只干执行层那部分”。

怎么用:三种路径

路径一:OpenRouter API(最快,零部署)

在 OpenRouter 上模型 ID 是 nemotron-3.5-lightning-30b-a3b,有免费层可以直接试。如果你已经在用 OpenRouter,切过去就是改个模型 ID 的事:

Python
# 运行环境:Python 3.10+,需 pip install openai
# 需设置环境变量 OPENROUTER_API_KEY
from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="你的_OPENROUTER_KEY"
)

response = client.chat.completions.create(
    model="nemotron-3.5-lightning-30b-a3b",
    messages=[
        {"role": "system", "content": "你是一个代码审查助手,只回复问题清单,不修改代码。"},
        {"role": "user", "content": "审查这段 Python 代码:\n```python\ndef add(a, b):\n    return a + b\n```"}
    ],
    temperature=0.6,
    max_tokens=500
)

print(response.choices[0].message.content)
print(f"\n消耗 token: 输入 {response.usage.prompt_tokens}, 输出 {response.usage.completion_tokens}")

路径二:本地部署(需要显卡或 Mac)

NVIDIA 和 vLLM、Ollama、llama.cpp、LM Studio 都做了首日支持。如果你的机器有 24GB 显存的显卡或 M4+ 芯片的 Mac:

Bash
# Ollama(最简单)
ollama pull nemotron-3.5-lightning
ollama run nemotron-3.5-lightning

# vLLM(生产部署)
pip install vllm
vllm serve "nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4"

HuggingFace 上有两个版本:BF16 全精度(需要 80GB 显存,适合微调)和 NVFP4 量化版(约 18GB,适合推理部署)。

路径三:Cline 集成(如果你用 Cline 编程)

Cline 已经第一天支持。打开 Cline → Settings → API Provider 选 OpenRouter → 模型下拉选 nemotron-3.5-lightning-30b-a3b,完事。

NeMo Switchyard:让前沿模型只干 7% 的活

如果说 Nemotron 3.5 Lightning 是”便宜的执行工”,NeMo Switchyard 就是”调度员”——它坐在你的 Agent 和模型之间,自动判断每一步该发给谁。

举个具体场景:你让 Claude Code 写一个功能。整个流程可能是:

  1. 读 package.json(简单,不需要 Opus)
  2. 分析依赖关系(中等,Lightning 够用)
  3. 设计架构方案(复杂,需要前沿模型)
  4. 写代码(中等,Lightning 够用)
  5. 跑测试读报错(简单,Lightning 够用)
  6. 修复 bug(中等,Lightning 够用)

没有 Switchyard 的时候,6 步全发 Opus,账单爆炸。有了 Switchyard,只有第 3 步发 Opus,其余 5 步发 Lightning。LangChain 的实测数据验证了这个模式:145 个多轮任务,74% 成本降低,只有 7% 的请求发到前沿模型,精度损失 6 个百分点。

实测安装:3 分钟跑通

我在 macOS 上实际安装了 NeMo Switchyard,过程很顺:

Bash
# 前置条件:需要 uv(Python 包管理器)
# 没有就装:curl -LsSf https://astral.sh/uv/install.sh | sh

# 安装 NeMo Switchyard
uv tool install --python 3.12 "nemo-switchyard[cli,server]"

安装输出:

Plaintext
Resolved 33 packages in 4.90s
Downloaded nemo-switchyard (8.3MiB)
Prepared 23 packages in 11.28s
Installed 33 packages in 58ms
 + nemo-switchyard==0.2.0
 + openai==2.54.0
 + anthropic==0.121.0
 + fastapi==0.141.1
 + uvicorn==0.52.1
 ...
Installed 1 executable: switchyard

验证安装:

Bash
$ switchyard --help
usage: switchyard [-h] [--version] {serve,launch} ...

Switchyard LLM proxy

positional arguments:
  {serve,launch}
    serve         Serve a routing-profile bundle
    launch        Launch a coding agent through the native server

两个核心命令:

  • switchyard serve:启动路由代理服务(需要 YAML 配置文件,默认端口 4000)
  • switchyard launch:直接通过代理启动 Claude Code / Codex CLI / OpenClaw

启动 Claude Code 走 Switchyard 路由

最简单的用法——让 Claude Code 走 Switchyard 路由,而不是直接打 Anthropic API:

Bash
# 设置 OpenRouter API Key(Switchyard 通过 OpenRouter 调用各模型)
export OPENROUTER_API_KEY="你的_OPENROUTER_KEY"

# 通过 Switchyard 启动 Claude Code
switchyard launch claude --model switchyard

# 也可以启动 Codex CLI 或 OpenClaw
switchyard launch codex --model switchyard
switchyard launch openclaw --model switchyard

--model switchyard 用的是 Switchyard 打包的默认路由配置(Lightning 做执行层 + 前沿模型做规划)。你也可以写自己的 TOML 配置:

Bash
switchyard launch claude --model my-route --config routes.toml

四种路由策略

Switchyard 内置四种路由算法:

策略适用场景工作方式
LLM Classifier请求内容决定用哪个模型用一个小模型判断当前请求该发到弱模型还是强模型
Stage Router根据对话阶段自动路由分析工具结果、错误信号等上下文信号,不需要额外模型调用
Escalation Router先跑弱模型再判断是否升级每步先用 Lightning 跑,judge 模型判断结果是否够好,不够再发前沿模型
RandomA/B 测试固定比例分流,用于基准测试

我建议从 Stage Router 开始——它不需要额外模型调用来做路由决策,靠对话中的信号(比如工具返回了报错就升级到强模型)自动判断,省 token 效果最好。

独立代理模式

如果你不想用 launch 命令直接启动 Agent,也可以把 Switchyard 当独立代理跑:

Bash
# 启动代理服务(默认端口 4000)
switchyard serve --routing-profiles config.yaml --inbound both

# 验证健康检查
curl http://localhost:4000/health

–inbound both 表示同时接受 OpenAI 和 Anthropic API 格式的请求。你的 Agent 配置里把 API base URL 指向 http://localhost:4000 就行,Switchyard 会自动翻译格式。

和 Muse Glimmer 比:同一天发布的两个 30B 模型怎么选

8月11日有个巧合:Meta 也在这天发布了 Muse Glimmer,同样是 30B 参数的开源模型,同样面向本地 Agent。但设计哲学完全不同:

维度Nemotron 3.5 LightningMeta Muse Glimmer
架构MoE(30B/3B 激活)稠密(29.6B 全激活)
模态纯文本文本 + 图像
上下文最高 1M131K
许可证OpenMDW-1.1Apache 2.0
OpenRouter 价格0.10/0.250.35/1.50
本地部署门槛NVFP4 量化约 18GB4-bit 量化约 20GB
核心优势吞吐量高、成本极低、适合路由分工多模态、通用能力更强
核心劣势纯文本、Terminal-Bench 低贵 3.5-6 倍、上下文短

简单说:如果你要搭多模型路由系统,选 Lightning;如果你要一个本地全能 Agent,选 Glimmer。

如果你对本地部署开源模型感兴趣,可以参考之前的 本地部署大模型完全指南,里面有 Ollama 和 LM Studio 的详细对比。

一个踩坑提醒:别拿 Lightning 当主力编程模型

Nemotron 3.5 Lightning 的 Terminal-Bench 2.1 只有 24.58%,这个分数意味着它独立做复杂编程任务时会频繁出错。如果你把它当 Claude Code 的唯一模型来用,体验会很差。

正确的用法是搭配——让 Claude Opus 5 或其他前沿模型做规划和复杂推理,Lightning 跑那些重复性的工具调用和验证步骤。Switchyard 的 Escalation Router 特别适合这个模式:先用 Lightning 跑,跑不好再升级到 Opus。

另一个注意点:NeMo Switchyard 目前是 pre-alpha 阶段(PyPI 分类是 3 – Alpha),NVIDIA 官方说”不建议用于生产环境”。现在适合测试和验证路由策略,等稳定后再上生产。

开发者现在该做什么

  1. 装 Switchyard 试路由:uv tool install --python 3.12 "nemo-switchyard[cli,server]",3 分钟装完,用 switchyard launch claude --model switchyard 跑一轮看看路由日志
  2. 在 OpenRouter 上试 Lightning:有免费层,跑几个工具调用场景看看输出质量和速度
  3. 评估你的 Agent 账单:如果你的 Agent 工作流里超过 50% 的步骤是”读文件、跑命令、检查结果”这类操作,Switchyard + Lightning 的组合大概率能砍掉一半以上成本
  4. 等 Switchyard 稳定版:现在 pre-alpha,合作生态(LangChain、LiteLLM、Kong 等)还在集成中,预计几周内会有更成熟的方案

如果你在用 pxpipe 省 tokenCodebase Memory MCP,Switchyard 是不同层面的优化——pxpipe 是"让单次请求更便宜",Switchyard 是"让贵的请求变少"。三个方案可以叠加用。

更多 AI 工具实战内容,可以看 AI 实战应用指南

外部参考

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

推荐阅读

  • NVIDIA 终于下场做模型了:Nemotron 3.5 Lightning + NeMo Switchyard,Agent 账单砍掉七成怎么做到的

    NVIDIA 发布开源 Agent 模型 Nemotron 3.5 Lightning(30B MoE,3B 激活,OpenRouter 有免费层)和模型路由库 NeMo Switchyard(Apa…

  • Claude Code 的多个终端终于能互相发消息了:跨会话消息上手指南

    Claude Code v2.1.224 在 macOS 与 Linux 上新增跨会话消息:多个独立终端里的 Agent 可以互相发现、发送文本。本文带你升级 CLI、用 /list-agents 查…

  • 蚂蚁百灵 Ling-3.0-flash 开源了:124B/5.1B MoE,单台 DGX Spark 能跑,开发者怎么接?

    如果你最近已经被国产大模型的“八周五连发”轰炸得有点麻木,那蚂蚁集团 8 月 7 日这条消息还是值得单独拎出来说:旗下百灵大模型团队把新一代原生混合推理模型 Ling-3.0-flash 的权重正式放…

  • 扎克伯格终于对 AI 编程下手了:Muse Code 测试版上手,一条命令让 Agent 替你改代码

    8 月 5 日,Meta 正式发布了自己的第一款终端 AI 编程智能体——Muse Code。不是模型 API,不是网页聊天,而是直接钻进你终端、能读你代码库、能自己规划任务并执行的那类工具。 在这之…