DeepSeek V4.1-Flash 上手:CED 架构 + 1M 上下文 + V4 Pro 自动退市,9 月 14 日前该做什么

本文基于 DeepSeek 官方模型卡 deepseek-ai/DeepSeek-V4.1-Flash、官方 API 文档 api-docs.deepseek.com/quick_start/pricing、Hugging Face 量化列表及 Reuters、Flowtivity.ai 等公开来源整理。benchmark 与定价数据取自官方模型卡与第三方评测,尚未经独立第三方复测;部署命令为官方文档整理的推荐路径,实际表现会随硬件、量化精度与提示词质量变化。

一、为什么要现在关注这个模型

9 月 10 日,DeepSeek 把 V4.1-Flash 推上了 GA——不是小迭代,是把 V4 家族的架构推倒重来了一版。最关键的两件事:

  1. MIT 协议 + Hugging Face 权重公开——商用、可改、可分发。552B 主干量级的旗舰用这个许可证开放,在国产生态里是头一回。
  2. V4 Pro 计划于北京时间 9 月 14 日 12:00 自动路由到 V4.1 Flash,按 Flash 价格计费(来源:DeepSeek API 文档注 (2))。也就是说,V4 Pro 这条产品线在四天后正式退场——这不是普通升级,是旗舰让位给新一代。

回到本月早期,9 月 9 日我们刚写过面壁智能 MiniCPM5-2B 的端侧部署——1.2GB 量化版跑在旧笔记本上。V4.1-Flash 是完全相反的方向:552B 主干 + 196B Engram 条件记忆,prefill 时激活 8B 参数,decode 时激活 16B 参数。这两个数字才是你看新闻时应该记住的——不是 552,而是 8。

写到这里要先做个澄清:站内 8/2 的 V4-Flash 文章 当时的核心叙事是”V4-Flash 架构一点没变,纯靠重做后训练把 Agent 能力涨 6 倍”。V4.1-Flash 和 V4-Flash 不是同一篇文章能装得下的——架构、上下文、模态、价格档全部变了。读完这篇你会明白具体变了什么、怎么用上它、以及 14 号之前你需要把哪些脚本改掉。

二、CED 架构改了哪些东西(通俗版)

V4.1-Flash 的核心技术点是 Causal Encoder-Decoder (CED)——一个 40 层 Transformer,被切成 20 层因果编码器 + 20 层解码器。区别在哪?

传统 decoder-only 模型(比如 V4-Flash、GPT 系列、Claude Fable 系列)的全局 KV cache 是每层重建的。V4.1-Flash 把解码器那一半的全局 KV cache 直接从编码器的最终隐藏状态投影出来,不再层层重建。配合 Compressed Sparse Attention 2 (CSA2) 的 Full / Reindex / Reuse 三种静态共享模式,以及 FP4 的主 KV 缓存,官方公布的 KV cache 占用是 每 token 890 字节

换成人话:这是一个 552B 主干的模型,缓存开销比 V4-Flash 小 4 倍、比最早的 V1 小 437 倍。1M token 上下文在工程上第一次能撑得起来

另一个值得看的组件:Engram 条件记忆——一个 196B 参数的稀疏访问记忆表。模型主体跑标准 MoE 推理时,Engram 通过 token-based lookup 介入,根据当前输入决定要不要”召回”一段记忆。可以理解为模型内置了一个有 196B 参数量的”长期记忆区”,但不是每次都用。

最后是推理档位的控制:API 暴露 max / high / low 三档(连续 1-100 的 dial),max 档跑下面这些 bench 时表现最好(来源:模型卡):

  • DeepSWE v1.1 编程 Agent:74.2(Opus 5 是 74.0、GPT-5.6 Sol 是 73.0、V4-Flash 是 54.4)
  • Terminal-Bench 2.1:90.6(Opus 5 官方数字 89.1 左右)
  • Terminal-Bench 4.0:31.2(Opus 5 是 51.8,这一项落后——说明 V4.1 在极复杂的多步环境里还不如 Opus 5 强)
  • GPQA Diamond:90.9
  • Codeforces rating:3471
  • Humanity’s Last Exam(带工具,纯文本):63.9

简单说:在最常见的 Agent 编程任务上它打平或微超 Opus 5;在极复杂的多步环境上仍有差距。这是后面「不建议场景」的依据之一。

三、立刻能用的三种 API 接入方式

你需要先做三件事:(1) 去 platform.deepseek.com 注册并获取 API Key;(2) 余额充值(off-peak 时段 1M 输出 token 约 ¥4.3,按 1 USD ≈ 7.1 CNY 折算);(3) 决定用哪种调用风格。

3.1 OpenAI 兼容端点(最经典)

Python
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com"
)

resp = client.chat.completions.create(
    model="deepseek-flash",     # 9/10 起新名,旧的 deepseek-v4-flash 仍可用但已停服
    messages=[
        {"role": "system", "content": "你是一名 Python 教学助手。"},
        {"role": "user", "content": "用 Python 写一个去重的 dict 子类"},
    ],
    max_tokens=1024,
    temperature=1.0,            # thinking 默认开启;想要更确定的输出可降到 0.3
)
print(resp.choices[0].message.content)
print("usage:", resp.usage)

deepseek-flash 这个名字在 9/14 之后会一直生效,V4 Pro 用户改这一个字符串就完成迁移。

3.2 Anthropic 兼容端点(如果你已经在用 Claude Code 或 Anthropic SDK)

Python
from anthropic import Anthropic

client = Anthropic(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com/anthropic",   # 走 Anthropic 协议
)

msg = client.messages.create(
    model="deepseek-flash",
    max_tokens=1024,
    messages=[{"role": "user", "content": "用一句话解释 BP 算法"}],
)
print(msg.content[0].text)

Anthropic 兼容路径支持 tools 和 vision,调法与 Claude 完全一致。如果你在用 Claude Code + 第三方 provider 路由 的工作流,可以把轻量任务切到 V4.1 Flash 跑 agent 编码、把 Claude 留给代码评审。

3.3 原生 HTTP / curl(最直接,便于抄到任何环境)

Bash
curl -X POST "https://api.deepseek.com/v1/chat/completions" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-flash",
    "messages": [{"role":"user","content":"用 Python 写 quicksort"}],
    "max_tokens": 512,
    "stream": false
  }'

返回 JSON 里能看到 usage.prompt_tokens / completion_tokens / total_tokens 三个字段。对账最方便的就是这个直 curl 的版本。

四、9 月 14 日前你必须做的三件事

来源是 DeepSeek API 文档底部注 (1)(2)

(1) Use deepseek-flash as the model name. The legacy names deepseek-v4-flash and deepseek-v4-flash-vision-exp are still accepted, but the corresponding models have been retired.
(2) From 12:00 Beijing Time on September 14, 2026, and until V4.1 Pro is released in the future, requests to deepseek-v4-pro will all be routed to V4.1 Flash and billed at the V4.1 Flash price.

具体的三个动作:

  1. 把硬编码 deepseek-v4-flash 的字符串换成 deepseek-flash——V4-Flash 在 9/10 已经停服,新名字才会路由到 V4.1-Flash
  2. 检查所有用 deepseek-v4-pro 的地方——9/14 12:00(北京时间)之后仍能返回结果,但价格会按 Flash 计价。如果你的脚本里写死了”用 Pro 任务”且对成本敏感,建议改成 deepseek-flash + 显式设 reasoning_effort=max
  3. 重跑预算估算:V4 Pro 的旧定价是 peak $1.32/M input,V4.1 Flash 是 $0.30/M input——9/14 之后账单应该明显下降,但成本结构变了,压力测试值得重跑一遍

五、量化版与本地部署路径

权重在 Hugging Face 是公开的(MIT)。官方模型卡里有「Browse Quantizations」区,收录了社区做的 GGUF、AWQ、GPTQ 等 23 个量化版本。但有一个现状要直接告诉你:截至发稿(9/11),Ollama 官方库的 deepseek-flash 页面返回 404——和上周 MiniCPM5 的情况一样,新模型 Day0 不在 Ollama 上架,要等社区提交。

想本地跑有三条路:

A. Modelfile 导入 GGUF(推荐消费级显卡)

Bash
# 1. 从 HuggingFace 拉一份 Q4_K_M 或 Q5_K_M 量化版
# 路径示例:bartowski/DeepSeek-V4.1-Flash-GGUF
# 2. 写 Modelfile
cat > Modelfile << 'EOF'
FROM ./deepseek-v4.1-flash-Q5_K_M.gguf
TEMPLATE """{{ .System }}
{{ .Prompt }}"""
SYSTEM "你是 DeepSeek V4.1-Flash,由深度求索训练的 AI 助手。"
PARAMETER stop "<|im_end|>"
PARAMETER num_ctx 131072
EOF
# 3. 导入并运行
ollama create v41f -f Modelfile
ollama run v41f

B. vLLM 跑 FP8 原生权重(推荐有 H100/H200 集群的团队,按 vLLM v0.28 的 DeepSeek V4 优化路径):

Bash
vllm serve deepseek-ai/DeepSeek-V4.1-Flash \
  --tensor-parallel-size 4 \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.9 \
  --enable-prefix-caching

C. SGLang

Bash
python -m sglang.launch_server \
  --model-path deepseek-ai/DeepSeek-V4.1-Flash \
  --host 0.0.0.0 --port 30000

完整路径建议参考本站之前的 Ollama + LM Studio 本地部署指南OpenAI gpt-oss 部署指南——那两篇里的命令改个模型名就能跑 V4.1-Flash。要提醒的是:552B 主干即使量化到 4-bit 也是百 GB 级,24GB 消费级显卡上是跑不动的,这条路实际上只对多卡集群有意义;单卡设备请直接走 API。

六、和正在跑 V4-Flash 的脚本对比成本

下面的数字来自 DeepSeek API 文档当前价目表。Off-peak 指除周一至周五 01:00-04:00 和 06:00-10:00 UTC 之外的所有时段;对中国大陆来说大部分时间是 off-peak。

场景 V4-Flash(已停服)峰值 V4.1-Flash 峰值 V4.1-Flash off-peak 备注
1M input tokens(cache miss) ~$0.55 $0.30 $0.15 比 V4-Flash 便宜约 1.8 倍
1M input tokens(cache hit) ~$0.011 $0.006 $0.003 缓存机制继承
1M output tokens ~$1.65 $1.20 $0.60 同样降 1.4-2.7 倍
并发上限 较低 2500 2500 涨了 5 倍以上

如果你的应用是 Agent 类的(input 重、output 轻),用 cache + off-peak 时间跑,账单可以做到 V4-Flash 时代的一个零头。

七、踩坑提醒 + 不建议场景

踩坑 1:Ollama 官方库还没上架

前面已经说了,deepseek-flash 当前 404。需要走 Modelfile 路径或者等社区 PR,也可以直接用 vLLM / SGLang。

踩坑 2:max output 不能设到 384K

V4.1-Flash 的 max output tokens 上限是 384K(不是 1M,1M 是 context window)。官方文档标注 MAXIMUM: 384K,超过这个值会被 API 拒绝。最常见的误解就是把 1M context 当成 1M output——别这样写。

踩坑 3:thinking 模式的 token 也会计费

官方文档显示 V4.1-Flash 同时支持 thinking 与非 thinking 模式(默认 thinking)。thinking 产生的中间推理 token 是算在 completion_tokens 里的,所以同一段对话开不开 thinking,账单差别可能很大。如果你的场景不关心模型思考过程、只想要快速答案,建议在支持的模式下显式切到非 thinking(具体参数名以官方 thinking_mode 文档为准)。

踩坑 4:vision 输入要走特定字段

OpenAI 兼容端点支持图片输入,但 messages 里的 content 结构要用图片类型字段而非纯文本字段。Anthropic 兼容端点的 vision 写法又是另一套格式。两个端点混用时最容易踩这个坑。

不建议使用的场景

  1. 极复杂多步环境(Terminal-Bench 4.0 这类):V4.1-Flash 报 31.2,Opus 5 是 51.8。需要长时间跨工具推理与规划的任务,开源旗舰目前仍打不过顶级闭源旗舰
  2. 24GB 消费级显卡本地跑:552B 主干量化后仍是百 GB 级,显存不够。这类硬件请直接走 API
  3. 只做高频短对话:单次 token 价格算下来优势不明显,纯短对话场景和 Qwen 3.8 Max 这类模型的隐式缓存价 差异不大——V4.1-Flash 真正的优势在长上下文和 Agent 类负载
  4. 把它当多模态旗舰用:官方标注 V4.1-Flash 支持 vision,但它的定位是 Flash 档(性价比线),图像理解不是它的最强项。复杂视觉任务建议保留专门的视觉模型

八、和站内已有文章的连接

把本站之前写过的几篇放在一起看,DeepSeek 这条线其实已经比较完整了:

连起来看,我的判断是:V4.1-Flash 是”参数量扩张但单 token 激活量压缩”的极端 MoE 形态——552B 主干只点 8B,把长上下文、原生视觉、MIT 开放这几件事一次性凑齐了。它和 V4-Flash 不是简单替代,而是 V4 家族换架构后的”标准化新一代”。

参考来源

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

推荐阅读

  • DeepSeek V4.1-Flash 上手:CED 架构 + 1M 上下文 + V4 Pro 自动退市,9 月 14 日前该做什么

    DeepSeek 9 月 10 日推送 V4.1-Flash 正式版:全新 Causal Encoder-Decoder 架构把 552B 主干压到 prefill 仅激活 8B,配 1M 上下文、M…

  • MiniCPM5-2B 开源上手:2B 参数端侧 Agent 部署指南,1.2GB 量化版跑在旧笔记本上是什么体验

    面壁智能开源 MiniCPM5-2B:2B 参数、Apache 2.0、AA 榜单 4B 以下第一,Agentic 指标同级 10 倍。INT4 量化仅 1.2GB,原生支持工具调用、深度搜索与代码生…

  • NVIDIA PAIR 上手指南:把家里 RTX 和 Mac 拼成局域网 AI 推理集群,多 Agent 任务提速 2 倍

    NVIDIA 9 月 3 日开源的 PAIR 让你不动 Ollama / LM Studio 接口就能把家里几台电脑拼成局域网 AI 推理集群,5 个 subagent 任务从 18 分钟压到 8 分…

  • Claude Fable 5.1 发布:8 项基准屠榜、缓存降价 75%,但升级前先改这三处代码

    Claude Fable 5.1 发布:8 项基准屠榜,缓存读取直降 75%,但升级前必须改三处代码——tool_choice 返回 400、thinking blocks 跨模型失效、编辑 syst…