本文基于 DeepSeek 官方模型卡
deepseek-ai/DeepSeek-V4.1-Flash、官方 API 文档api-docs.deepseek.com/quick_start/pricing、Hugging Face 量化列表及 Reuters、Flowtivity.ai 等公开来源整理。benchmark 与定价数据取自官方模型卡与第三方评测,尚未经独立第三方复测;部署命令为官方文档整理的推荐路径,实际表现会随硬件、量化精度与提示词质量变化。
一、为什么要现在关注这个模型
9 月 10 日,DeepSeek 把 V4.1-Flash 推上了 GA——不是小迭代,是把 V4 家族的架构推倒重来了一版。最关键的两件事:
- MIT 协议 + Hugging Face 权重公开——商用、可改、可分发。552B 主干量级的旗舰用这个许可证开放,在国产生态里是头一回。
- V4 Pro 计划于北京时间 9 月 14 日 12:00 自动路由到 V4.1 Flash,按 Flash 价格计费(来源:DeepSeek API 文档注 (2))。也就是说,V4 Pro 这条产品线在四天后正式退场——这不是普通升级,是旗舰让位给新一代。
回到本月早期,9 月 9 日我们刚写过面壁智能 MiniCPM5-2B 的端侧部署——1.2GB 量化版跑在旧笔记本上。V4.1-Flash 是完全相反的方向:552B 主干 + 196B Engram 条件记忆,prefill 时激活 8B 参数,decode 时激活 16B 参数。这两个数字才是你看新闻时应该记住的——不是 552,而是 8。
写到这里要先做个澄清:站内 8/2 的 V4-Flash 文章 当时的核心叙事是”V4-Flash 架构一点没变,纯靠重做后训练把 Agent 能力涨 6 倍”。V4.1-Flash 和 V4-Flash 不是同一篇文章能装得下的——架构、上下文、模态、价格档全部变了。读完这篇你会明白具体变了什么、怎么用上它、以及 14 号之前你需要把哪些脚本改掉。
二、CED 架构改了哪些东西(通俗版)
V4.1-Flash 的核心技术点是 Causal Encoder-Decoder (CED)——一个 40 层 Transformer,被切成 20 层因果编码器 + 20 层解码器。区别在哪?
传统 decoder-only 模型(比如 V4-Flash、GPT 系列、Claude Fable 系列)的全局 KV cache 是每层重建的。V4.1-Flash 把解码器那一半的全局 KV cache 直接从编码器的最终隐藏状态投影出来,不再层层重建。配合 Compressed Sparse Attention 2 (CSA2) 的 Full / Reindex / Reuse 三种静态共享模式,以及 FP4 的主 KV 缓存,官方公布的 KV cache 占用是 每 token 890 字节。
换成人话:这是一个 552B 主干的模型,缓存开销比 V4-Flash 小 4 倍、比最早的 V1 小 437 倍。1M token 上下文在工程上第一次能撑得起来。
另一个值得看的组件:Engram 条件记忆——一个 196B 参数的稀疏访问记忆表。模型主体跑标准 MoE 推理时,Engram 通过 token-based lookup 介入,根据当前输入决定要不要”召回”一段记忆。可以理解为模型内置了一个有 196B 参数量的”长期记忆区”,但不是每次都用。
最后是推理档位的控制:API 暴露 max / high / low 三档(连续 1-100 的 dial),max 档跑下面这些 bench 时表现最好(来源:模型卡):
- DeepSWE v1.1 编程 Agent:74.2(Opus 5 是 74.0、GPT-5.6 Sol 是 73.0、V4-Flash 是 54.4)
- Terminal-Bench 2.1:90.6(Opus 5 官方数字 89.1 左右)
- Terminal-Bench 4.0:31.2(Opus 5 是 51.8,这一项落后——说明 V4.1 在极复杂的多步环境里还不如 Opus 5 强)
- GPQA Diamond:90.9
- Codeforces rating:3471
- Humanity’s Last Exam(带工具,纯文本):63.9
简单说:在最常见的 Agent 编程任务上它打平或微超 Opus 5;在极复杂的多步环境上仍有差距。这是后面「不建议场景」的依据之一。
三、立刻能用的三种 API 接入方式
你需要先做三件事:(1) 去 platform.deepseek.com 注册并获取 API Key;(2) 余额充值(off-peak 时段 1M 输出 token 约 ¥4.3,按 1 USD ≈ 7.1 CNY 折算);(3) 决定用哪种调用风格。
3.1 OpenAI 兼容端点(最经典)
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_KEY",
base_url="https://api.deepseek.com"
)
resp = client.chat.completions.create(
model="deepseek-flash", # 9/10 起新名,旧的 deepseek-v4-flash 仍可用但已停服
messages=[
{"role": "system", "content": "你是一名 Python 教学助手。"},
{"role": "user", "content": "用 Python 写一个去重的 dict 子类"},
],
max_tokens=1024,
temperature=1.0, # thinking 默认开启;想要更确定的输出可降到 0.3
)
print(resp.choices[0].message.content)
print("usage:", resp.usage)deepseek-flash 这个名字在 9/14 之后会一直生效,V4 Pro 用户改这一个字符串就完成迁移。
3.2 Anthropic 兼容端点(如果你已经在用 Claude Code 或 Anthropic SDK)
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DEEPSEEK_KEY",
base_url="https://api.deepseek.com/anthropic", # 走 Anthropic 协议
)
msg = client.messages.create(
model="deepseek-flash",
max_tokens=1024,
messages=[{"role": "user", "content": "用一句话解释 BP 算法"}],
)
print(msg.content[0].text)Anthropic 兼容路径支持 tools 和 vision,调法与 Claude 完全一致。如果你在用 Claude Code + 第三方 provider 路由 的工作流,可以把轻量任务切到 V4.1 Flash 跑 agent 编码、把 Claude 留给代码评审。
3.3 原生 HTTP / curl(最直接,便于抄到任何环境)
curl -X POST "https://api.deepseek.com/v1/chat/completions" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-flash",
"messages": [{"role":"user","content":"用 Python 写 quicksort"}],
"max_tokens": 512,
"stream": false
}'返回 JSON 里能看到 usage.prompt_tokens / completion_tokens / total_tokens 三个字段。对账最方便的就是这个直 curl 的版本。
四、9 月 14 日前你必须做的三件事
来源是 DeepSeek API 文档底部注 (1)(2):
(1) Use
deepseek-flashas the model name. The legacy namesdeepseek-v4-flashanddeepseek-v4-flash-vision-expare still accepted, but the corresponding models have been retired.
(2) From 12:00 Beijing Time on September 14, 2026, and until V4.1 Pro is released in the future, requests todeepseek-v4-prowill all be routed to V4.1 Flash and billed at the V4.1 Flash price.
具体的三个动作:
- 把硬编码
deepseek-v4-flash的字符串换成deepseek-flash——V4-Flash 在 9/10 已经停服,新名字才会路由到 V4.1-Flash - 检查所有用
deepseek-v4-pro的地方——9/14 12:00(北京时间)之后仍能返回结果,但价格会按 Flash 计价。如果你的脚本里写死了”用 Pro 任务”且对成本敏感,建议改成deepseek-flash+ 显式设reasoning_effort=max - 重跑预算估算:V4 Pro 的旧定价是 peak $1.32/M input,V4.1 Flash 是 $0.30/M input——9/14 之后账单应该明显下降,但成本结构变了,压力测试值得重跑一遍
五、量化版与本地部署路径
权重在 Hugging Face 是公开的(MIT)。官方模型卡里有「Browse Quantizations」区,收录了社区做的 GGUF、AWQ、GPTQ 等 23 个量化版本。但有一个现状要直接告诉你:截至发稿(9/11),Ollama 官方库的 deepseek-flash 页面返回 404——和上周 MiniCPM5 的情况一样,新模型 Day0 不在 Ollama 上架,要等社区提交。
想本地跑有三条路:
A. Modelfile 导入 GGUF(推荐消费级显卡):
# 1. 从 HuggingFace 拉一份 Q4_K_M 或 Q5_K_M 量化版
# 路径示例:bartowski/DeepSeek-V4.1-Flash-GGUF
# 2. 写 Modelfile
cat > Modelfile << 'EOF'
FROM ./deepseek-v4.1-flash-Q5_K_M.gguf
TEMPLATE """{{ .System }}
{{ .Prompt }}"""
SYSTEM "你是 DeepSeek V4.1-Flash,由深度求索训练的 AI 助手。"
PARAMETER stop "<|im_end|>"
PARAMETER num_ctx 131072
EOF
# 3. 导入并运行
ollama create v41f -f Modelfile
ollama run v41fB. vLLM 跑 FP8 原生权重(推荐有 H100/H200 集群的团队,按 vLLM v0.28 的 DeepSeek V4 优化路径):
vllm serve deepseek-ai/DeepSeek-V4.1-Flash \
--tensor-parallel-size 4 \
--max-model-len 32768 \
--gpu-memory-utilization 0.9 \
--enable-prefix-cachingC. SGLang:
python -m sglang.launch_server \
--model-path deepseek-ai/DeepSeek-V4.1-Flash \
--host 0.0.0.0 --port 30000完整路径建议参考本站之前的 Ollama + LM Studio 本地部署指南 和 OpenAI gpt-oss 部署指南——那两篇里的命令改个模型名就能跑 V4.1-Flash。要提醒的是:552B 主干即使量化到 4-bit 也是百 GB 级,24GB 消费级显卡上是跑不动的,这条路实际上只对多卡集群有意义;单卡设备请直接走 API。
六、和正在跑 V4-Flash 的脚本对比成本
下面的数字来自 DeepSeek API 文档当前价目表。Off-peak 指除周一至周五 01:00-04:00 和 06:00-10:00 UTC 之外的所有时段;对中国大陆来说大部分时间是 off-peak。
| 场景 | V4-Flash(已停服)峰值 | V4.1-Flash 峰值 | V4.1-Flash off-peak | 备注 |
|---|---|---|---|---|
| 1M input tokens(cache miss) | ~$0.55 | $0.30 | $0.15 | 比 V4-Flash 便宜约 1.8 倍 |
| 1M input tokens(cache hit) | ~$0.011 | $0.006 | $0.003 | 缓存机制继承 |
| 1M output tokens | ~$1.65 | $1.20 | $0.60 | 同样降 1.4-2.7 倍 |
| 并发上限 | 较低 | 2500 | 2500 | 涨了 5 倍以上 |
如果你的应用是 Agent 类的(input 重、output 轻),用 cache + off-peak 时间跑,账单可以做到 V4-Flash 时代的一个零头。
七、踩坑提醒 + 不建议场景
踩坑 1:Ollama 官方库还没上架
前面已经说了,deepseek-flash 当前 404。需要走 Modelfile 路径或者等社区 PR,也可以直接用 vLLM / SGLang。
踩坑 2:max output 不能设到 384K
V4.1-Flash 的 max output tokens 上限是 384K(不是 1M,1M 是 context window)。官方文档标注 MAXIMUM: 384K,超过这个值会被 API 拒绝。最常见的误解就是把 1M context 当成 1M output——别这样写。
踩坑 3:thinking 模式的 token 也会计费
官方文档显示 V4.1-Flash 同时支持 thinking 与非 thinking 模式(默认 thinking)。thinking 产生的中间推理 token 是算在 completion_tokens 里的,所以同一段对话开不开 thinking,账单差别可能很大。如果你的场景不关心模型思考过程、只想要快速答案,建议在支持的模式下显式切到非 thinking(具体参数名以官方 thinking_mode 文档为准)。
踩坑 4:vision 输入要走特定字段
OpenAI 兼容端点支持图片输入,但 messages 里的 content 结构要用图片类型字段而非纯文本字段。Anthropic 兼容端点的 vision 写法又是另一套格式。两个端点混用时最容易踩这个坑。
不建议使用的场景
- 极复杂多步环境(Terminal-Bench 4.0 这类):V4.1-Flash 报 31.2,Opus 5 是 51.8。需要长时间跨工具推理与规划的任务,开源旗舰目前仍打不过顶级闭源旗舰
- 24GB 消费级显卡本地跑:552B 主干量化后仍是百 GB 级,显存不够。这类硬件请直接走 API
- 只做高频短对话:单次 token 价格算下来优势不明显,纯短对话场景和 Qwen 3.8 Max 这类模型的隐式缓存价 差异不大——V4.1-Flash 真正的优势在长上下文和 Agent 类负载
- 把它当多模态旗舰用:官方标注 V4.1-Flash 支持 vision,但它的定位是 Flash 档(性价比线),图像理解不是它的最强项。复杂视觉任务建议保留专门的视觉模型
八、和站内已有文章的连接
把本站之前写过的几篇放在一起看,DeepSeek 这条线其实已经比较完整了:
- 8/2 的 V4-Flash 正式版指南——是 V4.1 的”前传”。如果你是 V4-Flash 用户,那篇里的缓存调优思路仍然适用
- 8/14 的 DeepSeek Harness 上手指南——Harness 是 Agent 执行框架,本文讲的是被它调用的那层模型。两篇一起读,可以拼出一个完整的”DeepSeek 工具栈”画像
- 9/9 的 MiniCPM5-2B 端侧部署——2B 与 552B 在本站的对照。本地内存紧、设备能力受限用 MiniCPM5;服务器有 GPU、要跑长上下文或 Agent 负载用 V4.1-Flash
- 6/29 的 DeepSeek DSpark 投机解码——开源推理加速器,对 V4.1-Flash 同样适用
- 8/30 的 vLLM v0.28 指南——v0.28 已经为 DeepSeek V4 做了端到端优化(端到端 Sparse MLA),V4.1-Flash 直接受益
连起来看,我的判断是:V4.1-Flash 是”参数量扩张但单 token 激活量压缩”的极端 MoE 形态——552B 主干只点 8B,把长上下文、原生视觉、MIT 开放这几件事一次性凑齐了。它和 V4-Flash 不是简单替代,而是 V4 家族换架构后的”标准化新一代”。
发表回复