Claude Opus 5 来了:性能逼近 Fable 5,价格只要一半,你的默认模型该升级了

7 月 24 日,Anthropic 把 Claude Opus 5 放出来了。不是小修小补的迭代,而是一次挺关键的定位调整——它几乎做到了 Fable 5 的水平,但价格保持在 Opus 的老价位,只有 Fable 5 的一半。

这意味着什么?对大多数做复杂开发、做 Agent 编排、做长文档研究的人来说,以前那套”先用 Sonnet,不行再换 Fable”的决策逻辑,可能要重新写了。

我梳理了发布当天的所有公开资料,包括 Anthropic 的系统卡、API 文档和几家第三方评测机构的实测,把 Opus 5 真正变了什么、该怎么接、有哪些坑,一次说清楚。


一、Opus 5 是什么定位

Anthropic 现在的模型梯队是这样的:

模型输入价格输出价格定位
Haiku 4.5$1/MTok$5/MTok简单任务、低延迟
Sonnet 5$2/MTok(9 月后 $3)$10/MTok(9 月后 $15)日常主力
Opus 5$5/MTok$25/MTok复杂工程、Agent、科研
Fable 5$10/MTok$50/MTok极端前沿任务
Mythos 5$10/MTok$50/MTok限量供应的研究向模型

Opus 5 的定价和 Opus 4.8 完全一致,没变。但 Anthropic 的官方说法是,它在 Frontier-Bench(专门测 Agent 能力的评测)上的得分比 Opus 4.8 翻了一倍多,在 CursorBench 3.2 上距离 Fable 5 的峰值只差 0.5%,而完成同样任务的花费大概只有 Fable 5 的一半。

简单说:以前你要花 Fable 的钱才能干的事,现在 Opus 5 这个价位就能干个八九成。


二、哪儿能用上

Opus 5 上线当天就铺开了,不需要排队申请:

  • Claude.ai 网页版:Pro 用户可以直接选,Max 用户默认就是 Opus 5
  • Claude Code:命令行里直接切模型
  • Claude Cowork:桌面端 Agent 场景
  • API:`claude-opus-5`,Anthropic 官方 API、Amazon Bedrock、Google Vertex AI、Microsoft Foundry 都支持

如果你是 API 用户,模型 ID 就是 `claude-opus-5`,没有日期后缀,是一个固定快照。Batch API 也同步支持,价格是标准 API 的一半:$2.5 输入 / $12.5 输出。


三、相比 Opus 4.8,到底强在哪

1. 自己会检查了

Opus 5 最大的行为变化是”验证自己的输出”。它会在浏览器里以桌面端和移动端两种视口打开页面,对照实际渲染结果来验证自己写的代码对不对,不对就改,改完再给到你。

这对前端开发特别有用。以前用 Claude 写页面,经常是它给了一段看起来没问题的代码,一跑发现布局崩了,你得把报错贴回去让它修。Opus 5 现在能自己提前发现一部分这类问题。

2. 回合数少了,账单也少了

Anthropic 的内部测试数据显示,Opus 5 在同等任务上的平均回合数比 Opus 4.8 少了约三分之一,工具调用次数也少了,墙钟时间快了 60%。

回合数少了不是面子工程——每次回合都要算 token,token 就是钱。回合数压下来,实际账单可能比模型升级前还便宜。

3. 五级力度调节

Opus 5 引入了五级 effort 设置:low、medium、high、xhigh、max。

这和之前 Anthropic CMA 平台更新的”思考力度五档调速”是同一套机制。不同之处在于,Opus 5 的 low 和 medium 档位比以前的 Opus 模型强很多——现在 low 不是”将就着用”,而是真的可以作为日常快速响应的选项。

实际怎么用:

  • low/medium:日常问答、代码审查、快速草稿
  • high:默认档位,大多数开发任务用这个就够了
  • xhigh/max:复杂重构、多文件架构设计、深度调试

关键技巧:不是每次都要拉满。xhigh 和 max 的 token 消耗会明显增加,但准确率提升的边际效应在递减。建议从 high 开始,发现搞不定了再往上加。


四、两个 API 迁移的坑

如果你是直接把 API 里的模型字符串从 `claude-opus-4-8` 换成 `claude-opus-5`,有两处行为变化可能会让你踩坑。

坑一:thinking 默认开启,会吃掉你的 max_tokens

Opus 5 默认开启 thinking(也就是你在 claude.ai 上看到的”正在思考…”)。这个思考过程会消耗输出 token 配额。如果你给请求设置了比较紧的 `max_tokens`,答案可能在 thinking 阶段就把额度用完了,返回的内容被截断。

解决办法

  • 要么把 `max_tokens` 留足(thinking 通常占几百到几千 token)
  • 要么在请求里显式关闭 thinking(但注意下面的坑二)

坑二:xhigh/max 档位不能关 thinking

如果你在 effort 设为 xhigh 或 max 时,尝试用 `thinking: {“type”: “disabled”}` 关闭思考,API 会直接返回 400 错误。这两个档位强制要求 thinking 开启。

解决办法:需要关 thinking 的场景,把 effort 降到 high 或以下。

最小可迁移检查清单

Python
# 旧代码(Opus 4.8)
response = client.messages.create(
    model="claude-opus-4-8",
    max_tokens=4000,
    messages=[...]
)

# 新代码(Opus 5)—— 需要调整的参数
response = client.messages.create(
    model="claude-opus-5",
    max_tokens=8000,  # 留一倍余量给 thinking
    thinking={"type": "enabled", "budget_tokens": 2000},  # 显式控制 thinking 预算
    messages=[...]
)

如果你用 Claude Code,更新到最新版本后它会自动识别 Opus 5,不需要手动改配置。


五、几个值得看的 benchmark 数字

先声明:以下都是 Anthropic 官方发布的 vendor-run 数据,第三方独立复测的结果还要等一两周。但参考意义是有的。

评测项目Opus 5Opus 4.8Fable 5
SWE-bench Pro79.2%
Frontier-Bench v0.1 (xhigh)44.4~2033.7
CursorBench 3.2距峰值 0.5%峰值
OSWorld 2.070.6低于此分数

Frontier-Bench 是 Anthropic 新推的评测,专门测模型在真实软件工程任务上的 Agent 能力。Opus 5 在这个评测上得分比 Fable 5 还高,这个信号挺强的——说明它在长程工具调用、多步骤任务规划上确实有了实质性提升。

不过 Fable 5 在部分纯代码生成场景上仍然领先,而且 Mythos 5 在网络安全漏洞识别上比 Opus 5 强一截。所以不是说 Fable 5 没价值了,而是”需要上 Fable”的阈值被大幅抬高了。


六、什么时候用 Opus 5,什么时候还选别的

这是我整理的决策框架:

直接用 Opus 5

  • 多文件代码重构(涉及 5 个以上文件的联动修改)
  • 需要浏览器/计算机操作的 Agent 任务
  • 长文档研究分析(几十万字级别的材料梳理)
  • 复杂数学推导或科研辅助
  • 需要反复验证和迭代的调试任务

继续用 Sonnet 5

  • 日常代码补全、单文件修改
  • 高并发、低延迟的在线服务
  • 预算敏感且任务复杂度中等以下的场景

才考虑 Fable 5

  • 已经用 Opus 5 试过,确实搞不定的极端复杂任务
  • 需要最高级别安全审计或红队测试的场景
  • Mythos 5 级别的研究向工作(如果搞得到权限)

用 Haiku 4.5

  • 分类、摘要、简单提取这类低复杂度任务
  • 对延迟极其敏感的场景(如实时推荐)

七、省钱的几个实操技巧

Opus 5 本身定价没涨,但用不好照样烧光预算。几个从实际使用里总结出来的省钱方法:

1. 从 low/medium 开始试

Opus 5 的 low 和 medium 档位比 Opus 4.8 时代强太多了。很多以前必须开 high 的任务,现在 medium 就能搞定。先低后高,比每次都拉满省不少。

2. 用 prompt cache

Anthropic 的 prompt cache 对长上下文场景特别划算。5 分钟缓存写入 $6.25/MTok,命中只收 $0.50/MTok。如果你在做代码库级别的分析,把项目结构、依赖关系、核心文件先写进缓存,后续多次查询的成本能降一个数量级。

3. 批量任务走 Batch API

价格直接砍半($2.5/$12.5),适合不需要实时响应的后台任务,比如批量文档分析、代码审查、测试用例生成。

4. 搭配 pxpipe 进一步压 token

如果你在 Claude Code 里用 Opus 5 做大型项目,pxpipe 这类把文字渲染成 PNG 的代理工具 仍然有效。Opus 5 的 vision 能力和 Opus 4.8 一样强,图片输入的定价机制也没有变化,所以文字转图片省 token 的策略继续适用。


八、国内用户怎么接

Opus 5 和之前一样,国内直接访问 Anthropic API 需要解决网络问题。几个可行路径:

1. Amazon Bedrock / Google Vertex AI / Microsoft Foundry:通过国内企业的云账号接入,走合规渠道

2. Claude Code + 代理:命令行工具走代理配置相对灵活

3. Claude.ai 网页版:需要对应地区的账号和访问环境

如果你暂时接不上 Opus 5,Sonnet 5 仍然是性价比最高的日常选择,而且 9 月之前还是老价格($2/$10)。

另外,本地部署开源模型 的路线也在快速追赶。比如 Kimi K3 7 月 27 日就要开放权重,自托管成本能做到 $3/MTok 的水平,和 Opus 5 的 API 价已经是一个量级了。


九、今天就可以做的三件事

如果你看完觉得 Opus 5 值得试试,下面三件事今天就能动手:

1. 在 Claude.ai 上切到 Opus 5:Pro/Max 用户直接在下拉菜单里选,不需要额外付费。找几个以前 Sonnet 没搞定的复杂任务重新试一遍,感受一下差距。

2. 检查你的 API 调用代码:如果你有基于 Opus 4.8 的自动化脚本,重点检查 `max_tokens` 设置和 thinking 参数。建议先在一个非生产环境里跑一遍回归测试。

3. 重新评估你的模型路由策略:如果你之前在代码里写了”复杂任务自动切 Fable 5″的逻辑,现在可以把阈值调高一截,让 Opus 5 承担更多,Fable 5 只留给真正的极端场景。


写在最后

Opus 5 这次发布, Anthropic 传递的信号挺明确的:他们不再想让 Fable 5 成为”必须买的顶配”,而是想让 Opus 5 成为”绝大多数复杂工作的默认选择”。

对开发者来说,这其实是件好事——以前 frontier 级别的能力被锁在 $10/$50 的价位上,现在 $5/$25 就能摸到。虽然还不是开源权重,不能本地跑,但对于需要即插即用的团队,Opus 5 的性价比在当下的闭源模型里已经很难被忽视了。

你试过了吗?欢迎在评论区聊聊 Opus 5 在你具体场景里的表现,尤其是和 Sonnet 5、Fable 5 的对比感受。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

推荐阅读

  • Claude Opus 5 来了:性能逼近 Fable 5,价格只要一半,你的默认模型该升级了

    7 月 24 日,Anthropic 把 Claude Opus 5 放出来了。不是小修小补的迭代,而是一次挺关键的定位调整——它几乎做到了 Fable 5 的水平,但价格保持在 Opus 的老价位,…

  • Claude Agent 一夜塞进 500 个技能:Anthropic CMA 六大更新实操指南

    如果你过去一个半月没怎么关注 Anthropic 的动静,我来帮你补补课:Fable 5 和 Mythos 5 落了地,Sonnet 5 降了价,Claude Code 每天都有新版本。7 月 22 …

  • Gemini 3.6 Flash 来了:输出 token 直降 17%,还能操控电脑,开发者现在该怎么接?

    Google 在 7 月 21 日连发三款 Gemini 新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及面向网络安全的 Gemini 3.5 Flash C…

  • 阿里通义千问终于出了个能干正事的 AI 画图工具:Qwen-Image-3.0 上手指南

    这几个月 AI 画图工具一个接一个地出——ChatGPT Images 2.0 学会了推理构图,Meta Muse Image 直接塞进了 Instagram,Seedance 2.5 一次能生成 3…

暗夜独行