DeepSeek V4-Flash 正式版来了:Agent 能力暴涨 6 倍,价格只要 Claude 的 1/90

DeepSeek V4-Flash 正式版来了:Agent 能力暴涨 6 倍,价格只要 Claude 的 1/90

7 月 31 日下午,DeepSeek 悄悄干了一件大事——V4-Flash 正式版 API 上线了。

没有发布会,没有预热海报,就是一条 API 文档更新日志。但开发者社区直接炸了锅。

为什么?因为一个 2840 亿参数的 MoE 模型,激活参数只有 130 亿,价格拉到 0.2 元/百万 tokens(缓存命中),却在 9 项 Agent 基准测试中,把三个月前的 V4-Pro 预览版摁在地上摩擦。最离谱的是——模型结构一点没变,纯靠重做一遍后训练

今天这篇,不讲虚的,就讲三件事:这模型到底有多能打、你该怎么用上它、以及它跟 GPT-5.6 Luna 和 Claude Opus 5 到底谁更值。


先看硬指标:9 项基准测试全面碾压

V4-Flash 正式版(代号 V4-Flash-0731)采用了预览版完全相同的 MoE 架构:总参数 2840 亿,激活参数 130 亿,100 万 token 上下文窗口,支持思考/非思考双模式切换。

但重新训练后,数据完全不一样了。

最炸裂的是 DeepSWE。这个基准专门测试 AI Agent 在真实、长周期、多步骤编程任务中的自主解决能力——V4-Flash 从预览版的 7.3 分直接飙到 54.4 分,涨了 6 倍多。另一个重头戏是 Terminal Bench 2.1(Linux 终端里的自主规划和错误恢复能力),Flash 拿到 82.7 分,不仅碾压 V4-Pro 预览版的 72.1,还比智谱 GLM-5.2 的 81.0 高出不少,距离 Claude Opus 4.8 的 85.0 也就差两分多。

国际独立评测机构 Artificial Analysis 在 8 月 1 日同步更新了跑分:V4-Flash 最高推理档位拿下 智能指数 50 分,比 4 月发的预览版高出 10 分,只比 GPT-5.6 Luna 的 51 分低 1 分。而同类可比模型的中位数才 17 分。

另外几个值得关注的成绩:

  • NL2Repo:54.2(从代码描述自动生成完整仓库)
  • CyberGym:76.7(网络安全攻防演练)
  • Toolathlon verified:70.3(多工具链编排)
  • Agent Last Exam:25.2(综合 Agent 能力考试)

一句话总结:一个 Flash(轻量版)模型,在 Agent 干活能力上,把自家的 Pro 旗舰预览版给超了。


模型骨架一点没变,只重做了后训练——这件事比跑分更值得关注

DeepSeek 官方明说了:V4-Flash-0731 的模型结构和尺寸跟预览版一模一样,唯一的变量是后训练策略。

换句话说,同一副骨架、同一套参数,只是训练得更精细了,Agent 能力就翻了好几倍。

这事的意义不亚于跑分本身。之前行业里默认的路子是「要更强就得堆更多参数」,但 V4-Flash 证明了一件事:后训练优化的天花板,可能远比我们以为的高。DeepSeek 的这套后训练方案里还配套了一个自研的 Agent 测试框架 DeepSeek Harness,专门用来评估模型在真实 Agent 场景下的表现,这次也一并公开了。

如果你对推理加速也感兴趣,之前 DeepSeek 还联合北大开源了投机解码框架 DSpark,能把单用户生成速度提 85%,跟这次的 V4-Flash 搭配使用效果翻倍。


四种接入方式:从零开始用上 V4-Flash

好了,说人话:你现在怎么用?

方式一:直接调 API(最直接)

DeepSeek 开放平台 注册账号,获取 API Key,然后用 OpenAI 兼容的 SDK 就能调——对,直接改 base_url 就行。

Python
from openai import OpenAI

client = OpenAI(

    api_key="your-deepseek-api-key",

    base_url="https://api.deepseek.com/v1"

)

response = client.chat.completions.create(

    model="deepseek-chat",  # V4-Flash 正式版

    messages=[

        {"role": "user", "content": "帮我写一个 Python 脚本,批量压缩 images 文件夹下的所有 PNG 图片"}

    ]

)

print(response.choices[0].message.content)

输入价格:缓存命中 0.02 元/百万 tokens,未命中 1 元。输出 2 元/百万 tokens。

有人晒了账单:「蹬了一小时才不到一块钱」。另一位开发者用 4 小时跑了接近 1 亿 token,缓存命中率 99%,实际花销不到 2 美元。

如果你不想手动搞 API Key,也可以走 阿里千问 AI 平台 的 Token Plan——一个 Key 聚合了 DeepSeek、Qwen、Kimi 等百余个模型,个人版 39 元/月起,潮汐时段还有折扣,适合想在一个地方同时对比多个模型的人。

方式二:接入 Claude Code(最实用)

这是目前开发者实测中最香的用法。Claude Code 本身是个很能打的 AI 编程助手(详见之前的 Claude Sonnet 5 上手评测),但按 Anthropic 官价跑大项目,账单确实有点疼。

V4-Flash 正式版原生支持 OpenAI 的 Responses API 格式,可以在 Claude Code 里通过第三方 provider 接入,把「干活」的任务交给 V4-Flash,把「审代码」的任务留给 Claude。有开发者实测反馈:「一遍写完,测试一遍完美通过,顺手还修了十几个 bug,opencode 花了 0.1 美元。」

如果你在 Claude Code 上的花销已经上了三位数,之前我们聊过 pxpipe 能把 token 消耗砍掉七成,现在再加上 V4-Flash 替代 Claude 执行代码生成环节,两边叠加的效果相当可观。

方式三:接入 Codex 生态

V4-Flash 正式版针对性适配了 Codex。你可以在 Codex CLI、ChatGPT 桌面端和 VS Code 的 Codex 插件中直接调用 DeepSeek 模型,不需要换工具链。

配置步骤:

  1. 确保你用的是 Codex CLI 最新版
  2. 在 Codex 设置中将模型 provider 切换为 DeepSeek
  3. 填入 DeepSeek API Key
  4. 选择模型为 deepseek-chat

Responses API 目前只支持 V4-Flash,V4-Pro 预计 8 月初接入。

方式四:等网页端和 App(普通人最省心)

目前 V4-Flash 正式版仅限 API 公测,DeepSeek 官网网页版和 App 还没有更新。这是目前最大的槽点——普通用户暂时没法直接用。

不过以 DeepSeek 的节奏,网页端跟进应该不会等太久。你可以先把 DeepSeek 官网加到收藏夹,或者关注他们的 API 文档页面。


98% 缓存命中率是怎么来的?这篇把机制讲清楚

V4-Flash 最让人上头的不只是便宜,而是 缓存命中率极高。DeepSeek 自有 API 提供了约 98% 的缓存命中折扣,远超业内普遍的 90%。

什么意思?简单说,DeepSeek 会在服务端缓存你最近用过的 prompt 前缀。如果你反复调用相似的请求——比如连续让 AI 改同一个代码文件、或者在同一个对话上下文中追加新指令——大部分输入 token 都会被识别为「已缓存」,只需要付 0.02 元/百万 token 而非 1 元。差值 50 倍。

这就是为什么有人跑了 1 亿 token 才花不到 2 美元。实际上用的 token 是「毛 token」,但计费时大部分都被缓存命中抵扣了。

实操建议:如果你在用 V4-Flash 做 Agent 任务,尽量保持上下文的连续性——不要每次都新建一个会话从头开始,而是在同一个会话里追加新任务。缓存命中率能上去,账单就能下来。

如果你被各种 API 的计费逻辑整懵过,之前我整理过一份 GitHub Copilot 按量计费的省钱实操指南,里面总结的 token 管理方法论对 DeepSeek API 同样适用。


价格差有多大?一个表看清四家主力模型

模型输入价格($/百万token)输出价格($/百万token)Agent 能力
DeepSeek V4-Flash0.02(缓存命中)/ 0.14(未命中)0.28Terminal Bench 82.7
GPT-5.6 Luna(降价后)0.31.2AII 智能指数 51
Claude Opus 5525Terminal Bench 85.0(Opus 4.8)
Kimi K30.52.0SWE-bench Verified 领先

这个表一目了然:V4-Flash 的价格大约是 Claude Opus 5 的 1/90,但在 Agent 终端操作能力上只差了两分多。跟 GPT-5.6 Luna 比——Luna 刚在 7 月 31 日降价 80%(关于 GPT-5.6 三档模型的详细对比可以看 这篇选型指南),即便如此,V4-Flash 在缓存命中的情况下输入成本也只有 Luna 的 1/15。

如果不是对 Claude 的代码审美有执念,或者非得用 Opus 5 级别的极限推理(之前聊过 Opus 5 怎么用最划算),大部分日常 Agent 任务交给 V4-Flash 完全够用。


这几个坑,用之前心里要有数

写了这么多好话,也得说说不足。我从开发者社区的反馈里整理了四个实际使用中可能遇到的问题:

1. 指令遵循偏「莽」。 有好几个开发者提了同一个槽点:V4-Flash 太喜欢「框框干」了。如果你给的任务边界不够清晰,它容易自作主张跑偏。解决方案很简单——把 prompt 写得越具体越好,别给它留发挥空间。适合交给他的是「有明确输入、明确输出、明确边界」的任务,不适合「帮我看看这个项目有什么可以优化的」这种开放式指令。

2. Agent 模式下推理语言被锁定为英文。 系统提示词在 Agent 模式下完全无效,模型会用英文思考。如果你需要它输出中文内容,需要在用户消息里明确指定。GitHub 上已经有人提了 issue 希望开放语言控制参数。

3. 嵌入式开发还有瑕疵。 有做 STM32 嵌入式的开发者反馈,虽然比上半年很多模型表现好不少,但还是偶尔出现端口识别不清、写出连编译都通不过的代码。做嵌入式的朋友建议先在简单任务上验证,别一上来就丢复杂项目。

4. 普通用户暂时用不了。 再强调一遍——当前仅限 API,网页版和 App 还没更新。如果你不想折腾 API Key,只能等。


所以,你应该换吗?

最后来个实在的判断:

  • 已经在用 Claude Code 做日常开发的:值得切。把你项目中代码生成、bug 修复、测试编写这些重复度高的任务交给 V4-Flash,用 Claude 做代码审查和架构设计。双模型组合拳,成本降下来,质量不一定降。
  • 在用 Kimi K3 的:K3 在长周期软件工程上有独特优势(详见 Kimi K3 上手指南),但价格是 V4-Flash 的好几倍。如果任务对价格敏感,可以试试迁移。
  • 小团队 / 个人开发者 / 学生:V4-Flash 是目前性价比最高的 Agent 模型,没有之一。如果你之前在本地跑 Ollama 部署的开源模型 凑合着用,现在可以考虑 API + 本地的混合方案——简单任务调 V4-Flash,涉及隐私数据的调本地模型。
  • 只是想用 DeepSeek 聊天:等网页端更新吧,不用折腾。
  • 做嵌入式或对代码正确率要求极高的:可以先观望,或者用 V4-Flash 做第一轮生成,再用更强模型做第二轮校验。

说到底是这么个理:半年前大家还在讨论「哪个模型更强」,现在的问题已经变成了「哪个模型在性价比上更划算」。V4-Flash 用只重做后训练的方式,把 Agent 能力拉到了跟旗舰模型同一档,价格却是后者的零头。这事对整个行业最大的启示可能不是「DeepSeek 又发新模型了」,而是——大模型竞赛的上半场是拼参数,下半场可能拼的是谁更会训练

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

推荐阅读

  • DeepSeek V4-Flash 正式版来了:Agent 能力暴涨 6 倍,价格只要 Claude 的 1/90

    DeepSeek V4-Flash 正式版来了:Agent 能力暴涨 6 倍,价格只要 Claude 的 1/90 7 月 31 日下午,DeepSeek 悄悄干了一件大事——V4-Flash 正式版…

  • 国产开源视频模型终于能用了:MiniMax H3 上手指南,8 月 3 日开源,2K 直出 0.8 元/秒

    如果你最近刷到任何关于 AI 视频的新闻,八成会看到”价格又创新低”或者”开源阵营又添一员”这两条主线。7 月 31 日,这两条主线同时被一款叫 Min…

  • 把大模型推理速度翻倍:腾讯混元开源 AngelSpec,教你部署投机解码

    大模型推理贵、慢、卡,这件事困扰整个行业太久了。 7 月 30 日,腾讯混元团队甩出一个新开源项目:AngelSpec。这是一个端到端的投机解码(Speculative Decoding)训练与部署框…

  • OpenAI 也终于开源了:gpt-oss-120b 和 gpt-oss-20b 上手指南,从下载到本地部署一篇讲清楚

    7 月 29 日凌晨,OpenAI 把两枚模型权重扔到了 Hugging Face 上:gpt-oss-120b 和 gpt-oss-20b。Apache 2.0 协议,可商用、可改、可再分发。这是 …

暗夜独行