DeepSeek V4-Flash 正式版来了:Agent 能力暴涨 6 倍,价格只要 Claude 的 1/90
7 月 31 日下午,DeepSeek 悄悄干了一件大事——V4-Flash 正式版 API 上线了。
没有发布会,没有预热海报,就是一条 API 文档更新日志。但开发者社区直接炸了锅。
为什么?因为一个 2840 亿参数的 MoE 模型,激活参数只有 130 亿,价格拉到 0.2 元/百万 tokens(缓存命中),却在 9 项 Agent 基准测试中,把三个月前的 V4-Pro 预览版摁在地上摩擦。最离谱的是——模型结构一点没变,纯靠重做一遍后训练。
今天这篇,不讲虚的,就讲三件事:这模型到底有多能打、你该怎么用上它、以及它跟 GPT-5.6 Luna 和 Claude Opus 5 到底谁更值。
先看硬指标:9 项基准测试全面碾压
V4-Flash 正式版(代号 V4-Flash-0731)采用了预览版完全相同的 MoE 架构:总参数 2840 亿,激活参数 130 亿,100 万 token 上下文窗口,支持思考/非思考双模式切换。
但重新训练后,数据完全不一样了。
最炸裂的是 DeepSWE。这个基准专门测试 AI Agent 在真实、长周期、多步骤编程任务中的自主解决能力——V4-Flash 从预览版的 7.3 分直接飙到 54.4 分,涨了 6 倍多。另一个重头戏是 Terminal Bench 2.1(Linux 终端里的自主规划和错误恢复能力),Flash 拿到 82.7 分,不仅碾压 V4-Pro 预览版的 72.1,还比智谱 GLM-5.2 的 81.0 高出不少,距离 Claude Opus 4.8 的 85.0 也就差两分多。
国际独立评测机构 Artificial Analysis 在 8 月 1 日同步更新了跑分:V4-Flash 最高推理档位拿下 智能指数 50 分,比 4 月发的预览版高出 10 分,只比 GPT-5.6 Luna 的 51 分低 1 分。而同类可比模型的中位数才 17 分。
另外几个值得关注的成绩:
- NL2Repo:54.2(从代码描述自动生成完整仓库)
- CyberGym:76.7(网络安全攻防演练)
- Toolathlon verified:70.3(多工具链编排)
- Agent Last Exam:25.2(综合 Agent 能力考试)
一句话总结:一个 Flash(轻量版)模型,在 Agent 干活能力上,把自家的 Pro 旗舰预览版给超了。
模型骨架一点没变,只重做了后训练——这件事比跑分更值得关注
DeepSeek 官方明说了:V4-Flash-0731 的模型结构和尺寸跟预览版一模一样,唯一的变量是后训练策略。
换句话说,同一副骨架、同一套参数,只是训练得更精细了,Agent 能力就翻了好几倍。
这事的意义不亚于跑分本身。之前行业里默认的路子是「要更强就得堆更多参数」,但 V4-Flash 证明了一件事:后训练优化的天花板,可能远比我们以为的高。DeepSeek 的这套后训练方案里还配套了一个自研的 Agent 测试框架 DeepSeek Harness,专门用来评估模型在真实 Agent 场景下的表现,这次也一并公开了。
如果你对推理加速也感兴趣,之前 DeepSeek 还联合北大开源了投机解码框架 DSpark,能把单用户生成速度提 85%,跟这次的 V4-Flash 搭配使用效果翻倍。
四种接入方式:从零开始用上 V4-Flash
好了,说人话:你现在怎么用?
方式一:直接调 API(最直接)
去 DeepSeek 开放平台 注册账号,获取 API Key,然后用 OpenAI 兼容的 SDK 就能调——对,直接改 base_url 就行。
from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com/v1"
)
response = client.chat.completions.create(
model="deepseek-chat", # V4-Flash 正式版
messages=[
{"role": "user", "content": "帮我写一个 Python 脚本,批量压缩 images 文件夹下的所有 PNG 图片"}
]
)
print(response.choices[0].message.content)
输入价格:缓存命中 0.02 元/百万 tokens,未命中 1 元。输出 2 元/百万 tokens。
有人晒了账单:「蹬了一小时才不到一块钱」。另一位开发者用 4 小时跑了接近 1 亿 token,缓存命中率 99%,实际花销不到 2 美元。
如果你不想手动搞 API Key,也可以走 阿里千问 AI 平台 的 Token Plan——一个 Key 聚合了 DeepSeek、Qwen、Kimi 等百余个模型,个人版 39 元/月起,潮汐时段还有折扣,适合想在一个地方同时对比多个模型的人。
方式二:接入 Claude Code(最实用)
这是目前开发者实测中最香的用法。Claude Code 本身是个很能打的 AI 编程助手(详见之前的 Claude Sonnet 5 上手评测),但按 Anthropic 官价跑大项目,账单确实有点疼。
V4-Flash 正式版原生支持 OpenAI 的 Responses API 格式,可以在 Claude Code 里通过第三方 provider 接入,把「干活」的任务交给 V4-Flash,把「审代码」的任务留给 Claude。有开发者实测反馈:「一遍写完,测试一遍完美通过,顺手还修了十几个 bug,opencode 花了 0.1 美元。」
如果你在 Claude Code 上的花销已经上了三位数,之前我们聊过 pxpipe 能把 token 消耗砍掉七成,现在再加上 V4-Flash 替代 Claude 执行代码生成环节,两边叠加的效果相当可观。
方式三:接入 Codex 生态
V4-Flash 正式版针对性适配了 Codex。你可以在 Codex CLI、ChatGPT 桌面端和 VS Code 的 Codex 插件中直接调用 DeepSeek 模型,不需要换工具链。
配置步骤:
- 确保你用的是 Codex CLI 最新版
- 在 Codex 设置中将模型 provider 切换为 DeepSeek
- 填入 DeepSeek API Key
- 选择模型为
deepseek-chat
Responses API 目前只支持 V4-Flash,V4-Pro 预计 8 月初接入。
方式四:等网页端和 App(普通人最省心)
目前 V4-Flash 正式版仅限 API 公测,DeepSeek 官网网页版和 App 还没有更新。这是目前最大的槽点——普通用户暂时没法直接用。
不过以 DeepSeek 的节奏,网页端跟进应该不会等太久。你可以先把 DeepSeek 官网加到收藏夹,或者关注他们的 API 文档页面。
98% 缓存命中率是怎么来的?这篇把机制讲清楚
V4-Flash 最让人上头的不只是便宜,而是 缓存命中率极高。DeepSeek 自有 API 提供了约 98% 的缓存命中折扣,远超业内普遍的 90%。
什么意思?简单说,DeepSeek 会在服务端缓存你最近用过的 prompt 前缀。如果你反复调用相似的请求——比如连续让 AI 改同一个代码文件、或者在同一个对话上下文中追加新指令——大部分输入 token 都会被识别为「已缓存」,只需要付 0.02 元/百万 token 而非 1 元。差值 50 倍。
这就是为什么有人跑了 1 亿 token 才花不到 2 美元。实际上用的 token 是「毛 token」,但计费时大部分都被缓存命中抵扣了。
实操建议:如果你在用 V4-Flash 做 Agent 任务,尽量保持上下文的连续性——不要每次都新建一个会话从头开始,而是在同一个会话里追加新任务。缓存命中率能上去,账单就能下来。
如果你被各种 API 的计费逻辑整懵过,之前我整理过一份 GitHub Copilot 按量计费的省钱实操指南,里面总结的 token 管理方法论对 DeepSeek API 同样适用。
价格差有多大?一个表看清四家主力模型
| 模型 | 输入价格($/百万token) | 输出价格($/百万token) | Agent 能力 |
|---|---|---|---|
| DeepSeek V4-Flash | 0.02(缓存命中)/ 0.14(未命中) | 0.28 | Terminal Bench 82.7 |
| GPT-5.6 Luna(降价后) | 0.3 | 1.2 | AII 智能指数 51 |
| Claude Opus 5 | 5 | 25 | Terminal Bench 85.0(Opus 4.8) |
| Kimi K3 | 0.5 | 2.0 | SWE-bench Verified 领先 |
这个表一目了然:V4-Flash 的价格大约是 Claude Opus 5 的 1/90,但在 Agent 终端操作能力上只差了两分多。跟 GPT-5.6 Luna 比——Luna 刚在 7 月 31 日降价 80%(关于 GPT-5.6 三档模型的详细对比可以看 这篇选型指南),即便如此,V4-Flash 在缓存命中的情况下输入成本也只有 Luna 的 1/15。
如果不是对 Claude 的代码审美有执念,或者非得用 Opus 5 级别的极限推理(之前聊过 Opus 5 怎么用最划算),大部分日常 Agent 任务交给 V4-Flash 完全够用。
这几个坑,用之前心里要有数
写了这么多好话,也得说说不足。我从开发者社区的反馈里整理了四个实际使用中可能遇到的问题:
1. 指令遵循偏「莽」。 有好几个开发者提了同一个槽点:V4-Flash 太喜欢「框框干」了。如果你给的任务边界不够清晰,它容易自作主张跑偏。解决方案很简单——把 prompt 写得越具体越好,别给它留发挥空间。适合交给他的是「有明确输入、明确输出、明确边界」的任务,不适合「帮我看看这个项目有什么可以优化的」这种开放式指令。
2. Agent 模式下推理语言被锁定为英文。 系统提示词在 Agent 模式下完全无效,模型会用英文思考。如果你需要它输出中文内容,需要在用户消息里明确指定。GitHub 上已经有人提了 issue 希望开放语言控制参数。
3. 嵌入式开发还有瑕疵。 有做 STM32 嵌入式的开发者反馈,虽然比上半年很多模型表现好不少,但还是偶尔出现端口识别不清、写出连编译都通不过的代码。做嵌入式的朋友建议先在简单任务上验证,别一上来就丢复杂项目。
4. 普通用户暂时用不了。 再强调一遍——当前仅限 API,网页版和 App 还没更新。如果你不想折腾 API Key,只能等。
所以,你应该换吗?
最后来个实在的判断:
- 已经在用 Claude Code 做日常开发的:值得切。把你项目中代码生成、bug 修复、测试编写这些重复度高的任务交给 V4-Flash,用 Claude 做代码审查和架构设计。双模型组合拳,成本降下来,质量不一定降。
- 在用 Kimi K3 的:K3 在长周期软件工程上有独特优势(详见 Kimi K3 上手指南),但价格是 V4-Flash 的好几倍。如果任务对价格敏感,可以试试迁移。
- 小团队 / 个人开发者 / 学生:V4-Flash 是目前性价比最高的 Agent 模型,没有之一。如果你之前在本地跑 Ollama 部署的开源模型 凑合着用,现在可以考虑 API + 本地的混合方案——简单任务调 V4-Flash,涉及隐私数据的调本地模型。
- 只是想用 DeepSeek 聊天:等网页端更新吧,不用折腾。
- 做嵌入式或对代码正确率要求极高的:可以先观望,或者用 V4-Flash 做第一轮生成,再用更强模型做第二轮校验。
说到底是这么个理:半年前大家还在讨论「哪个模型更强」,现在的问题已经变成了「哪个模型在性价比上更划算」。V4-Flash 用只重做后训练的方式,把 Agent 能力拉到了跟旗舰模型同一档,价格却是后者的零头。这事对整个行业最大的启示可能不是「DeepSeek 又发新模型了」,而是——大模型竞赛的上半场是拼参数,下半场可能拼的是谁更会训练。




发表回复