7 月 24 日,Anthropic 把 Claude Opus 5 放出来了。不是小修小补的迭代,而是一次挺关键的定位调整——它几乎做到了 Fable 5 的水平,但价格保持在 Opus 的老价位,只有 Fable 5 的一半。
这意味着什么?对大多数做复杂开发、做 Agent 编排、做长文档研究的人来说,以前那套”先用 Sonnet,不行再换 Fable”的决策逻辑,可能要重新写了。
我梳理了发布当天的所有公开资料,包括 Anthropic 的系统卡、API 文档和几家第三方评测机构的实测,把 Opus 5 真正变了什么、该怎么接、有哪些坑,一次说清楚。
一、Opus 5 是什么定位
Anthropic 现在的模型梯队是这样的:
| 模型 | 输入价格 | 输出价格 | 定位 |
|---|---|---|---|
| Haiku 4.5 | $1/MTok | $5/MTok | 简单任务、低延迟 |
| Sonnet 5 | $2/MTok(9 月后 $3) | $10/MTok(9 月后 $15) | 日常主力 |
| Opus 5 | $5/MTok | $25/MTok | 复杂工程、Agent、科研 |
| Fable 5 | $10/MTok | $50/MTok | 极端前沿任务 |
| Mythos 5 | $10/MTok | $50/MTok | 限量供应的研究向模型 |
Opus 5 的定价和 Opus 4.8 完全一致,没变。但 Anthropic 的官方说法是,它在 Frontier-Bench(专门测 Agent 能力的评测)上的得分比 Opus 4.8 翻了一倍多,在 CursorBench 3.2 上距离 Fable 5 的峰值只差 0.5%,而完成同样任务的花费大概只有 Fable 5 的一半。
简单说:以前你要花 Fable 的钱才能干的事,现在 Opus 5 这个价位就能干个八九成。
二、哪儿能用上
Opus 5 上线当天就铺开了,不需要排队申请:
- Claude.ai 网页版:Pro 用户可以直接选,Max 用户默认就是 Opus 5
- Claude Code:命令行里直接切模型
- Claude Cowork:桌面端 Agent 场景
- API:`claude-opus-5`,Anthropic 官方 API、Amazon Bedrock、Google Vertex AI、Microsoft Foundry 都支持
如果你是 API 用户,模型 ID 就是 `claude-opus-5`,没有日期后缀,是一个固定快照。Batch API 也同步支持,价格是标准 API 的一半:$2.5 输入 / $12.5 输出。
三、相比 Opus 4.8,到底强在哪
1. 自己会检查了
Opus 5 最大的行为变化是”验证自己的输出”。它会在浏览器里以桌面端和移动端两种视口打开页面,对照实际渲染结果来验证自己写的代码对不对,不对就改,改完再给到你。
这对前端开发特别有用。以前用 Claude 写页面,经常是它给了一段看起来没问题的代码,一跑发现布局崩了,你得把报错贴回去让它修。Opus 5 现在能自己提前发现一部分这类问题。
2. 回合数少了,账单也少了
Anthropic 的内部测试数据显示,Opus 5 在同等任务上的平均回合数比 Opus 4.8 少了约三分之一,工具调用次数也少了,墙钟时间快了 60%。
回合数少了不是面子工程——每次回合都要算 token,token 就是钱。回合数压下来,实际账单可能比模型升级前还便宜。
3. 五级力度调节
Opus 5 引入了五级 effort 设置:low、medium、high、xhigh、max。
这和之前 Anthropic CMA 平台更新的”思考力度五档调速”是同一套机制。不同之处在于,Opus 5 的 low 和 medium 档位比以前的 Opus 模型强很多——现在 low 不是”将就着用”,而是真的可以作为日常快速响应的选项。
实际怎么用:
- low/medium:日常问答、代码审查、快速草稿
- high:默认档位,大多数开发任务用这个就够了
- xhigh/max:复杂重构、多文件架构设计、深度调试
关键技巧:不是每次都要拉满。xhigh 和 max 的 token 消耗会明显增加,但准确率提升的边际效应在递减。建议从 high 开始,发现搞不定了再往上加。
四、两个 API 迁移的坑
如果你是直接把 API 里的模型字符串从 `claude-opus-4-8` 换成 `claude-opus-5`,有两处行为变化可能会让你踩坑。
坑一:thinking 默认开启,会吃掉你的 max_tokens
Opus 5 默认开启 thinking(也就是你在 claude.ai 上看到的”正在思考…”)。这个思考过程会消耗输出 token 配额。如果你给请求设置了比较紧的 `max_tokens`,答案可能在 thinking 阶段就把额度用完了,返回的内容被截断。
解决办法:
- 要么把 `max_tokens` 留足(thinking 通常占几百到几千 token)
- 要么在请求里显式关闭 thinking(但注意下面的坑二)
坑二:xhigh/max 档位不能关 thinking
如果你在 effort 设为 xhigh 或 max 时,尝试用 `thinking: {“type”: “disabled”}` 关闭思考,API 会直接返回 400 错误。这两个档位强制要求 thinking 开启。
解决办法:需要关 thinking 的场景,把 effort 降到 high 或以下。
最小可迁移检查清单
# 旧代码(Opus 4.8)
response = client.messages.create(
model="claude-opus-4-8",
max_tokens=4000,
messages=[...]
)
# 新代码(Opus 5)—— 需要调整的参数
response = client.messages.create(
model="claude-opus-5",
max_tokens=8000, # 留一倍余量给 thinking
thinking={"type": "enabled", "budget_tokens": 2000}, # 显式控制 thinking 预算
messages=[...]
)如果你用 Claude Code,更新到最新版本后它会自动识别 Opus 5,不需要手动改配置。
五、几个值得看的 benchmark 数字
先声明:以下都是 Anthropic 官方发布的 vendor-run 数据,第三方独立复测的结果还要等一两周。但参考意义是有的。
| 评测项目 | Opus 5 | Opus 4.8 | Fable 5 |
|---|---|---|---|
| SWE-bench Pro | 79.2% | — | — |
| Frontier-Bench v0.1 (xhigh) | 44.4 | ~20 | 33.7 |
| CursorBench 3.2 | 距峰值 0.5% | — | 峰值 |
| OSWorld 2.0 | 70.6 | — | 低于此分数 |
Frontier-Bench 是 Anthropic 新推的评测,专门测模型在真实软件工程任务上的 Agent 能力。Opus 5 在这个评测上得分比 Fable 5 还高,这个信号挺强的——说明它在长程工具调用、多步骤任务规划上确实有了实质性提升。
不过 Fable 5 在部分纯代码生成场景上仍然领先,而且 Mythos 5 在网络安全漏洞识别上比 Opus 5 强一截。所以不是说 Fable 5 没价值了,而是”需要上 Fable”的阈值被大幅抬高了。
六、什么时候用 Opus 5,什么时候还选别的
这是我整理的决策框架:
直接用 Opus 5:
- 多文件代码重构(涉及 5 个以上文件的联动修改)
- 需要浏览器/计算机操作的 Agent 任务
- 长文档研究分析(几十万字级别的材料梳理)
- 复杂数学推导或科研辅助
- 需要反复验证和迭代的调试任务
继续用 Sonnet 5:
- 日常代码补全、单文件修改
- 高并发、低延迟的在线服务
- 预算敏感且任务复杂度中等以下的场景
才考虑 Fable 5:
- 已经用 Opus 5 试过,确实搞不定的极端复杂任务
- 需要最高级别安全审计或红队测试的场景
- Mythos 5 级别的研究向工作(如果搞得到权限)
用 Haiku 4.5:
- 分类、摘要、简单提取这类低复杂度任务
- 对延迟极其敏感的场景(如实时推荐)
七、省钱的几个实操技巧
Opus 5 本身定价没涨,但用不好照样烧光预算。几个从实际使用里总结出来的省钱方法:
1. 从 low/medium 开始试
Opus 5 的 low 和 medium 档位比 Opus 4.8 时代强太多了。很多以前必须开 high 的任务,现在 medium 就能搞定。先低后高,比每次都拉满省不少。
2. 用 prompt cache
Anthropic 的 prompt cache 对长上下文场景特别划算。5 分钟缓存写入 $6.25/MTok,命中只收 $0.50/MTok。如果你在做代码库级别的分析,把项目结构、依赖关系、核心文件先写进缓存,后续多次查询的成本能降一个数量级。
3. 批量任务走 Batch API
价格直接砍半($2.5/$12.5),适合不需要实时响应的后台任务,比如批量文档分析、代码审查、测试用例生成。
4. 搭配 pxpipe 进一步压 token
如果你在 Claude Code 里用 Opus 5 做大型项目,pxpipe 这类把文字渲染成 PNG 的代理工具 仍然有效。Opus 5 的 vision 能力和 Opus 4.8 一样强,图片输入的定价机制也没有变化,所以文字转图片省 token 的策略继续适用。
八、国内用户怎么接
Opus 5 和之前一样,国内直接访问 Anthropic API 需要解决网络问题。几个可行路径:
1. Amazon Bedrock / Google Vertex AI / Microsoft Foundry:通过国内企业的云账号接入,走合规渠道
2. Claude Code + 代理:命令行工具走代理配置相对灵活
3. Claude.ai 网页版:需要对应地区的账号和访问环境
如果你暂时接不上 Opus 5,Sonnet 5 仍然是性价比最高的日常选择,而且 9 月之前还是老价格($2/$10)。
另外,本地部署开源模型 的路线也在快速追赶。比如 Kimi K3 7 月 27 日就要开放权重,自托管成本能做到 $3/MTok 的水平,和 Opus 5 的 API 价已经是一个量级了。
九、今天就可以做的三件事
如果你看完觉得 Opus 5 值得试试,下面三件事今天就能动手:
1. 在 Claude.ai 上切到 Opus 5:Pro/Max 用户直接在下拉菜单里选,不需要额外付费。找几个以前 Sonnet 没搞定的复杂任务重新试一遍,感受一下差距。
2. 检查你的 API 调用代码:如果你有基于 Opus 4.8 的自动化脚本,重点检查 `max_tokens` 设置和 thinking 参数。建议先在一个非生产环境里跑一遍回归测试。
3. 重新评估你的模型路由策略:如果你之前在代码里写了”复杂任务自动切 Fable 5″的逻辑,现在可以把阈值调高一截,让 Opus 5 承担更多,Fable 5 只留给真正的极端场景。
写在最后
Opus 5 这次发布, Anthropic 传递的信号挺明确的:他们不再想让 Fable 5 成为”必须买的顶配”,而是想让 Opus 5 成为”绝大多数复杂工作的默认选择”。
对开发者来说,这其实是件好事——以前 frontier 级别的能力被锁在 $10/$50 的价位上,现在 $5/$25 就能摸到。虽然还不是开源权重,不能本地跑,但对于需要即插即用的团队,Opus 5 的性价比在当下的闭源模型里已经很难被忽视了。
你试过了吗?欢迎在评论区聊聊 Opus 5 在你具体场景里的表现,尤其是和 Sonnet 5、Fable 5 的对比感受。




发表回复