如果你过去一个半月没怎么关注 Anthropic 的动静,我来帮你补补课:Fable 5 和 Mythos 5 落了地,Sonnet 5 降了价,Claude Code 每天都有新版本。7 月 22 日 Cowork 桌面端刚迭代完,第二天 Anthropic 又在它的托管智能体平台 CMA(Claude Managed Agent)上甩了六项更新。
这次更新的核心就一句话:Anthropic 在给 AI Agent 装操作系统。
之前 CMA 更像一个「API 产品」——能调,但你要自己拼很多东西。这六项更新加完,CMA 变成了一个可以独立运维、自主调度、事件驱动的 Agent 运行平台。企业不需要再自己搭基础设施,直接把业务逻辑拆成 Skill 塞进去就行。
下面一项一项说,每项我都尽量解释清楚「你能用它干什么」。
一、技能上限:从 20 个直接拉到 500 个
先解释下 CMA 里的「技能(Skill)」是什么。它是一组注入给 Agent 的专业指令包,类似一份 SOP 手册:告诉模型「遇到这个场景,你该按这套流程走」。
之前的限制是——一个会话最多挂 20 个 Skill。
听起来不少,但你算一下就知道了。一个金融客服 Agent,光覆盖这些场景就得七八个 Skill:开户、KYC、反洗钱、投诉处理、合规免责、多语言切换。再加上不同地区监管差异的变体、AB 测试版本,20 个配额根本不够用。
现在这个数字直接拉到了 500 个。
500 个是什么概念?一个完整的业务部门的知识体系,全塞进一个会话。这 500 个 Skill 位由协调器统一调度,Agent 之间共享内存和环境变量,跑在同一个托管沙盒里。
说人话就是:你可以把整本代码规范、CI 流水线配置、部署策略一股脑扔进去,让 Agent 从写代码到上线全流程心里有数。
更关键的是背后的加载机制。Anthropic 用了一套叫「渐进式披露(progressive disclosure)」的三级按需加载系统——50 个 Skill 的上下文占用从 150,000 tokens 压缩到了约 2,000 tokens。不是全量预加载,而是用到什么加载什么。容量涨了 25 倍,上下文消耗反而降了两个数量级。
这解决的不只是「能装更多」的问题,而是「装得进、跑得动」的问题。
你能用它干什么:
- 把公司所有部门的 SOP 全部技能化,放进一个 CMA 会话
- 让 Agent 同时掌握客服、合规、数据分析、报告生成等跨职能能力
- 给同一套业务逻辑建多个 Skill 变体(不同地区、不同产品线),Agent 按场景自动切换
二、思考力度:五档调速,简单问题不烧满血
思考力度(effort)这个参数在 Anthropic API 里早就有了,但在 CMA 里,之前所有 Agent 只能共用一套默认档位。
后果就是:问「今天几号」和「审计这份 500 页财报」用同样的推理深度。简单问题过度推理,烧的 token 全是冤枉钱。
现在每个 Agent 可以单独设思考力度,五个档位:
| 档位 | 适合场景 | 成本 |
|---|---|---|
| `low` | 简单路由、意图识别、分流 | 最低 |
| `medium` | 常规问答、信息检索 | 中等 |
| `high` | 复杂问题分析、投诉处理 | 较高 |
| `xhigh` | 深度推理、代码审查 | 高 |
| `max` | 法律合规审查、金融风控 | 最高 |
怎么用?举个多 Agent 客服系统的例子:
- 分流协调器(coordinator) 用 `low`——它只需要判断用户意图、分发给对应 Agent,不需要深度思考
- 产品答疑 Agent 用 `medium`——��知识库、匹配常见问题,够了
- 投诉升级 Agent 用 `high`——需要分析上下文、判断严重程度、调取历史记录
- 法律合规 Agent 用 `max`——一个字都不能错,必须仔细推敲
同一个会话里,不同 Agent 按任务难度跑在不同深度上。成本和质量之间多了一个连续的调节旋钮,不再是「要么全开、要么全关」。
你能用它干什么:
- 按任务难度分级分配算力,高频简单任务大幅省 token
- 在成本敏感的场景里(比如日均万次以上的客服会话),`low`/`medium` 档位能帮你把单次成本压到原来的几分之一
- 关键场景保留 `max` 深度,不牺牲质量
三、种子会话:一步创建,冷启动归零
以前创建 CMA 会话得分两步走:先 POST 一个空壳 session,再逐条往里塞初始事件。高并发场景下,来来回回的延迟一层层叠上去,冷启动慢得让人烦。
现在一步到位。 直接 `POST /v1/sessions`,带上 `initial_events` 参数,最多 50 条初始事件。会话一出生就知道自己该干什么。
同批更新里,Agent 更新接口的 `version` 字段也变成了可选。之前每次更新都得传版本号做乐观锁并发控制,版本对不上直接甩 409 错误。如果你的场景是单流程的(没有并发更新冲突的风险),这一步可以直接跳过,省掉版本管理的开销。
你能用它干什么:
- 把用户身份、历史上下文、当前任务描述直接注入初始事件,Agent 秒级就位
- 批量创建 Agent 会话时不再有冷启动延迟累积
- 单流程场景简化调用链路,少写一堆版本管理代码
四、子 Agent 可观测性:下探到线程级,不再是个黑盒
6 月底 CMA 刚上线了会话级的 `event_deltas`,能实时看到主 Agent 的文本输出。但子 Agent 的内部状态仍然是个黑盒——它跑偏了还是卡死了,你只能等超时才知道。
这次直接把可观测性下探到了线程级。 你可以订阅每个子 Agent 的独立线程流,实时看到它现在在想什么、在写什么、进度到哪里了。
对开发者来说,这意味着:
- 子 Agent 出了问题不用再靠超时猜
- 可以实时监控多 Agent 协作的每一步
- 排查 Bug 时能回放子 Agent 的完整思考过程
你能用它干什么:
- 在生产环境监控多 Agent 协作链路,哪个子 Agent 掉链子立刻知道
- 调试复杂 Agent 编排时不用再盲人摸象
- 做成本分析时可以精确定位哪个 Agent 在哪个环节烧了最多的 token
五、7 种新 Webhook:轮询时代的终结
CMA 在 6 月底已经支持了 Agent 和部署生命周期的 webhook。这次补上了剩下的两块拼图:
4 种环境事件:
- 环境创建
- 环境暂停/恢复
- 环境销毁
3 种记忆存储事件:
- 记忆写入
- 记忆更新
- 记忆删除
至此,CMA 的整个生命周期——环境搭建、Agent 部署、运行状态、记忆管理——全部可以通过事件驱动的方式跟外部系统打通。你不需要再写轮询代码隔几秒问一次「好了没」,事情发生了自然会推给你。
你能用它干什么:
- 环境暂停时自动触发告警或通知
- 记忆更新时同步到自己的数据库
- 新环境创建时自动挂监控、打标签
- 把 CMA 接入你现有的运维体系(Prometheus、PagerDuty、Slack 通知等)
六、版本字段可选 + 附赠彩蛋:录个屏就能生成 Skill
上面说了更新接口的 `version` 字段变成可选,单流程少一道屏障。
但这次更新还有个容易被忽略的「附赠品」——就在 CMA 六大更新前一天的 7 月 22 日,Claude Cowork 桌面端上线了 「录制 Skill(Record a Skill)」 功能。
以前创建一个 Skill,你得手写 SKILL.md 文件,把每个步骤、判断条件、格式要求一条条填进去。写一份详细的技能文档,少说半小时起步。
现在你只需要打开屏幕录制,一边操作一边口述,Claude 自动把整个过程转成一个可复用的 Skill。
它会捕捉的不只是你在屏幕上点了什么,更关键的是你口述里的隐性判断逻辑——哪种情况跳过、哪条格式规则是硬要求、哪个数值异常需要人工复核。这些东西写在文档里很难穷举,但录屏的时候你自然会说。
目前这个功能开放给 Pro、Max、Team 用户。
七、三条路线,三种赌注
走到 2026 年 7 月下旬,AI Agent 基础设施的竞争已经按天计了。三大玩家走了完全不同的路:
- OpenAI 赌入口。 把聊天、编程、自主工作全塞进一个 ChatGPT 超级应用(ChatGPT Work 智能体 就是例子),用最大用户基数锁住开发者。前两天还发布了 Presence 企业级 Agent 运营平台,也是走「一站式」路线。
- Google 赌基础设施。 GCP 算力 + TPU 芯片 + 协议标准(比如 DESIGN.md 这种设计系统标准),在底层建护城河。Gemini Spark 上 Mac 也是这条线。
- Anthropic 赌 OS 级深度。 托管沙盒 + 全栈 Agent 控制 + 思考力度调速 + 500 Skill 容量。不做超级应用,不做底层芯片,而是把单个 Agent 的能力密度做到极致。
三条路没有对错,只是选择不同。从 20 到 500,Anthropic 想证明一件事:Agent 不该是个调 API 的工具,应该是和操作系统一样基础的东西。
八、现在要不要上 CMA?
如果你是个人开发者或小团队,CMA 目前的定位还是偏企业级。它的核心场景是:业务复杂到需要多个 Agent 协作、需要统一调度 Skill 库、需要事件驱动的运维体系。
但即使你现在用不上 CMA,这六项更新里有几个思维方式值得你马上用起来:
1. 给你的 AI 编程助手分档设思考力度。 Muse Spark 1.1、Claude Code、Codex 这些工具如果支持 effort 参数,简单任务用低档,别烧冤枉 token。之前我们聊过 pxpipe 怎么省 token,思考力度调速是另一条省钱路径。
2. 把重复工作录成 Skill。 即使不用 CMA 的 Record a Skill,你也可以在 OpenClaw 或 WorkBuddy 里手动建 Skill。把自己日常的重复操作封装成指令包,是 AI Agent 时代最划算的投资——建一次,用一百次。
3. 关注子 Agent 的可观测性。 不管是 CMA 的线程级流,还是你在本地跑的多 Agent 编排,能看到子 Agent 的每一步在想什么,比它最终输出什么更重要。这是一个可运维 Agent 系统和「祈祷它能跑对」之间的分界线。
Anthropic 这 45 天的节奏说明了一件事:AI Agent 的基础设施竞赛正在从「有没有」转向「好不好用」。CMA 这次更新填上的坑——技能容量、成本控制、冷启动、可观测性、事件驱动——正是过去半年所有在生产环境跑 Agent 的团队都在踩的坑。
接下来的问题是:500 个 Skill 装得进,企业能填得满吗?




发表回复