「牛来」身份揭晓:智谱 GLM-5.3-Flash 开源上手——从 API 调用到 Claude Code 替换实战

五天前,我在 Ox Alpha 那篇文章 里写了一个匿名模型在 OpenRouter 上霸榜的故事。当时谁也不知道它背后是谁。现在答案出来了——智谱(Zhipu AI / Z.ai)在 8 月 26 日晚正式”认领”了 Ox Alpha,给它取了个正式名字:GLM-5.3-Flash

更有意思的是,智谱不仅公布了身份,还把模型权重以 MIT 协议开源到了 HuggingFace,同时开放了 API 调用和 GLM Coding Plan 订阅。这意味着你不用再靠 OpenRouter 的免费额度蹭着用——直接拿 API Key 就能跑。

我花了半天时间验证了 API 端点、Anthropic 兼容接口和 Claude Code 替换配置。下面是完整记录。

先说结论:这模型值得试吗?

GLM-5.3-Flash 的核心卖家用一句话概括:用 Claude Opus 4.8 大约 1/40 的价格,拿到接近它的编程能力。

具体数字:

维度GLM-5.3-FlashClaude Opus 4.8
AA 综合智能指数5757
输入价格(每百万 Token)~$0.075~$5
输出价格(每百万 Token)~$0.250~$25
上下文窗口1M200K
开源MIT 协议
多模态原生(图片/视频/文件)原生

当然,”1/40″是智谱自己算的”完成同一任务的成本”,不是 Token 单价的直接比价。实际使用中,GLM-5.3-Flash 的思考模式无法关闭(thinking.type 仅支持 enabled),意味着每次调用都会先跑一段推理链再输出答案,Token 消耗比你想的多。我稍后会展开讲这个坑。

架构:为什么它又便宜又快

GLM-5.3-Flash 是个 MoE(混合专家)模型,总参数 320B,但每次推理只激活 18B。这个比例(5.6%)在同级模型里算激进的——作为对比,蚂蚁百灵 Ling-3.0-flash 是 124B/5.1B(4.1%),阿里 Qwen 3.8 Max 是更大的参数量级。

但它真正有意思的不是 MoE 本身,而是注意力机制的设计。智谱在 GLM-5.3-Flash 里首次引入了稀疏注意力 + 线性注意力混合架构——线性注意力负责局部依赖建模(类似 Mamba 的状态递归),稀疏注意力通过轻量索引器召回全局上下文。为了进一步压缩长上下文的内存开销,还搞了个叫 IndexPool 的池化方案,把索引器的 4 个缓存向量压成 1 个。

效果是什么?相比旗舰 GLM-5.3,注意力计算量降低 3 倍,KV 缓存大小降低 4.4 倍。这就是它能用 1M 上下文窗口还不破产的原因。

还有一个不能忽略的点:全部线上流量跑在 10 万张国产芯片上(昇腾/海光/摩尔线程)。智谱在 SGLang 基础上自建了推理引擎,用 EPD 分离式架构(编码-预填充-解码分离调度),端到端性能比初始基线提升了 3 倍,单 Token 成本已经”达到与主流英伟达 GPU 相当的水平”。这个说法如果站得住脚,对国产芯片生态是个标志性事件——但我建议读者保持审慎:目前所有数据都来自智谱自测,没有第三方独立验证。

怎么用:三条路径

路径一:直接调 API(最简单)

智谱的 BigModel 开放平台和 Z.ai 都提供 API。模型 ID 是 glm-5.3-flash,接口走标准 Chat Completion 格式。

我实际验证了 BigModel 的 API 端点:

Bash
# 验证 API 端点是否在线(不需要 API Key 也能看到 401 认证错误)
curl -s https://open.bigmodel.cn/api/paas/v4/chat/completions \
  -X POST \
  -H "Content-Type: application/json" \
  -d '{"model":"glm-5.3-flash","messages":[{"role":"user","content":"hello"}]}'

# 返回:{"error":{"code":"1001","message":"Header中未收到Authorization参数,无法进行身份验证。"}}

端点确认在线,返回 401 认证错误——说明服务已就绪,只差 API Key。注册 BigModel 账号后在控制台创建 API Key,加到 Header 里就能用:

Python
# Python 调用示例(运行环境:Python 3.10+,pip install openai)
from openai import OpenAI

client = OpenAI(
    api_key="你的智谱API_KEY",  # 在 https://bigmodel.cn 控制台获取
    base_url="https://open.bigmodel.cn/api/paas/v4"
)

response = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[{"role": "user", "content": "用 Python 写一个快排"}],
    temperature=1.0,
    top_p=0.95,
    # thinking.type 仅支持 enabled,无法关闭
    # 建议设置 thinking.clear_thinking: false
    extra_body={
        "thinking": {"type": "enabled", "clear_thinking": False}
    }
)

print(response.choices[0].message.content)

如果要传图片,在 messagescontent 里加 image_url 类型的内容块就行——和 OpenAI Vision 的格式一模一样:

Python
response = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "这张截图里的按钮文案是什么?"},
            {"type": "image_url", "image_url": {"url": "https://example.com/screenshot.png"}}
        ]
    }]
)

路径二:Claude Code 替换(开发者最关心的)

这是我觉得最有价值的功能。智谱提供了一个 Anthropic 兼容端点,你可以把 Claude Code 的后端直接换成 GLM-5.3-Flash,零代码改动。

我验证了这个端点确实在线:

Bash
# 验证 Anthropic 兼容端点
curl -s https://open.bigmodel.cn/api/anthropic/v1/messages \
  -X POST \
  -H "Content-Type: application/json" \
  -H "x-api-key: test" \
  -H "anthropic-version: 2023-06-01" \
  -d '{"model":"glm-5.3-flash","max_tokens":100,"messages":[{"role":"user","content":"hello"}]}'

# 返回:{"error":{"message":"令牌已过期或验证不正确","type":"401"}}

端点在线,返回 401——和标准 Anthropic API 的错误格式一致。配置 Claude Code 只需要改两个环境变量:

Bash
# 方式一:环境变量(写入 ~/.zshrc 或 ~/.bashrc)
export ANTHROPIC_BASE_URL="https://open.bigmodel.cn/api/anthropic"
export ANTHROPIC_AUTH_TOKEN="你的智谱API_KEY"  # 注意用 AUTH_TOKEN 不是 API_KEY

# 可选:指定模型映射
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-5.3-flash"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-5.3-flash"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="glm-5.3-flash"

或者写到 ~/.claude/settings.json 里:

JSON
{
  "env": {
    "ANTHROPIC_BASE_URL": "https://open.bigmodel.cn/api/anthropic",
    "ANTHROPIC_AUTH_TOKEN": "你的智谱API_KEY",
    "API_TIMEOUT_MS": "3000000"
  }
}

智谱还提供了一个一键配置脚本:

Bash
curl -O "https://cdn.bigmodel.cn/install/claude_code_env.sh" && bash ./claude_code_env.sh

配好之后,claude 命令打出来的请求就会走 GLM-5.3-Flash 而不是 Claude。对习惯用 Claude Code 做日常编程的开发者来说,这意味着账单可能直接砍掉一个数量级。

路径三:GLM Coding Plan(订阅制)

如果你不想按 Token 付费,智谱还有 GLM Coding Plan 订阅——每天限量发放 10,000 张体验卡,GLM-5.3-Flash 的配额是 GLM-5.3 的 3 倍。非高峰时段(包括周末全天)调用只消耗标准积分的 50%。可以在 bigmodel.cn/glm-coding 订阅,也可以在 Z.ai 的 ZCode 工具里直接用。

踩坑提醒

坑一:思考模式关不掉。 GLM-5.3-Flash 的 thinking.type 只支持 enabled,不能像 Qwen3.8 那样用 enable_thinking: False 关掉。简单任务也会先跑推理链再输出。好处是回答质量稳定,坏处是 Token 消耗比你想的多——看 Token 单价便宜就以为总成本一定低,容易翻车。

坑二:本地部署别想了(除非你有机房)。 320B 总参数,MIT 协议开源,权重在 HuggingFace 上确实能下。但即使每次只激活 18B,FP8 量化也要至少 ~180GB 显存。这不是消费级显卡能跑的——它的”开源”更多意味着”你有权自己部署”,而不是”你能部署”。和 DeepSeek V4-Flash 的 284B 类似,开源但个人跑不动。务实的选择是走 API。

坑三:国产芯片的账要分开算。 智谱说”单 Token 成本与主流英伟达 GPU 相当”——这话可能是真的,但数据来自智谱自测。OpenCode 披露 Ox Alpha 六天处理了 42 万亿 Token,这个数字本身就说明服务确实扛住了大规模流量。但”国产芯片效率追平英伟达”这种结论,我建议等第三方基准测试出来再下判断。

坑四:API Key 里的隐藏字符。 这不是 GLM 特有的坑,但在配置 Claude Code 时特别容易踩——复制 API Key 时末尾可能多一个不可见的 Unicode 零宽空格(U+200B),导致 401 认证失败但报错信息看起来像是模型配置问题。如果你配完环境变量跑 claude 一直 401,先把 Key 重新手打一遍试试。

和谁比、怎么选

放到当前国产开源模型的格局里看,GLM-5.3-Flash 的定位很清晰:编程和 Agent 场景的性价比之选。

和 DeepSeek V4-Flash 比,GLM-5.3-Flash 在 Terminal Bench 2.1 上 84.3 vs 83.9,基本持平;DeepSWE v1.1 上 63.4 vs 59.3,GLM 略胜。但 DeepSeek 在推理和数学上的传统优势仍然存在。

和阿里 Qwen3.8-Flash-Next 比,后者架构更新(Qwen4 预览)、激活比更低(6B/125B),但 API 还没上线,目前只能看不能跑。GLM-5.3-Flash 的优势是现在就能用

如果你已经在用 Claude Code 做日常开发,我的建议是:先在 GLM Coding Plan 领张体验卡,把 ANTHROPIC_BASE_URL 指过去,跑一两天看体感。不满意再切回来,成本就是零。

附加信息

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

推荐阅读

  • 「牛来」身份揭晓:智谱 GLM-5.3-Flash 开源上手——从 API 调用到 Claude Code 替换实战

    智谱正式认领匿名模型 Ox Alpha,GLM-5.3-Flash 以 MIT 协议开源。320B/18B MoE 原生多模态模型,AA 智能指数 57 分追平 Claude Opus 4.8,价格仅…

  • Perplexity × NVIDIA Portable Computer 上手指南:本地跑 AI Agent 的「零 Token 成本」到底是真省还是宣传话术(含 Ollama 复刻教程)

    Perplexity 联合 NVIDIA 推出 Portable Computer,把 AI Agent 整套 harness 搬到本地运行,本地任务不消耗云端 Credits。本文拆解「零 Toke…

  • OpenAI 把 Codex 的”大脑”开源了:Codex Harness 上手指南,三层接口从 CI 到产品全打通

    OpenAI 开源 Codex Harness 底层执行框架,不是模型而是模型的’外骨骼’。同一 GPT-5.6 Sol 仅靠 Harness 优化,ARC-AGI-3 得分从 13.3% 涨到 38…

  • OpenRouter 上冒出一个不署名的前沿模型:Ox Alpha 免费试,三步跑通 API 调用

    OpenRouter 上出现了一个匿名模型 Ox Alpha,1M 上下文、支持图文视频多模态输入、编程跑分超过 GPT-5.6。本文教你用 curl 和 Python 三步跑通 API 调用,附隐私…