把大模型推理速度翻倍:腾讯混元开源 AngelSpec,教你部署投机解码

大模型推理贵、慢、卡,这件事困扰整个行业太久了。

7 月 30 日,腾讯混元团队甩出一个新开源项目:AngelSpec。这是一个端到端的投机解码(Speculative Decoding)训练与部署框架,覆盖了 drafter 训练、架构设计到线上推理的全链路,还同步放出了 Hy3-A21B 和 Qwen3-8B 的 MTP / DFly 草稿权重与训练代码。

官方给出的数字很唬人:在六大 benchmark 上,对比自回归基线平均加速 1.98–2.40 倍,代码和数学任务峰值能到 2.86 倍。

但比起看数字,我更关心一件事:这东西普通人能不能用?开发者能不能在自己机器上跑起来? 我翻了它的 GitHub、文档和 arXiv 技术报告,结论是:可以,但门槛不低。这篇文章就聊聊 AngelSpec 到底是什么、能解决什么问题,以及怎么从零把它跑起来。


投机解码:让大模型”猜”着走

先别被”投机解码”这个名字吓到。它的核心思想其实很朴素:

大模型生成文本时,传统方式是一个一个 token 往外蹦,每蹦一个都要过一遍大模型,开销很大。投机解码的做法是,先用一个轻量级的”草稿模型”(drafter)一次性猜好几个 token,然后让大模型一次性验证这批猜测。猜对的直接保留,猜错的再修正。

就像考试时先快速把会做的题填完,再回头检查一遍。只要草稿模型够准,整体速度就能快很多,而且输出结果和不加速时完全一致——这是投机解码相比蒸馏、量化最诱人的地方,它不改变模型分布。

但问题也很现实:

  • 草稿模型不能太重,否则验证开销会吃掉加速收益;
  • 不同任务难度不一样,代码和数学场景长可预测跨度多,对话场景则熵高、难猜;
  • 训练、部署、在线调参经常脱节,工程上很繁琐。

AngelSpec 就是冲着这些工程痛点来的。


AngelSpec 到底有什么不一样

市面上做投机解码的工具不少,比如美团的 DFlash、DeepSeek 的 DSpark、EAGLE 系列。AngelSpec 最大的特点是全链路开源 + 统一训练框架

它把六种草稿架构塞进了同一个训练流水线:DFly、DFlash、DFlare、Eagle3、DSpark、MTP。切换架构只需要改配置,不用重写训练代码。对于想尝试不同方案的团队来说,这省了不少事。

其中最值得说的是 DFly。它算是 DFlash 的升级版:

  • 混合 target 条件注入,让每一层 draft 既能看到全局语义,也能拿到适合自己深度的 target 特征;
  • 加了一个轻量的隐状态校正自回归头,在并行生成的同时修正块内 token 依赖;
  • 训练目标直接面向”接受率”优化,而不是单纯拟合下一个 token。

效果也很直观:DFly 平均接受长度达到 4.79,比 DFlash 的 3.69 高出约 30%,比 MTP 的 3.00 高出约 60%。接受长度越长,意味着一次猜测能蒙对的 token 越多,加速效果越明显。

另外几个工程细节也很实用:

  • D-cut 动态验证:高并发时不一刀切地验证固定长度,而是根据前缀置信度和运行成本自适应调整验证深度,线上真实流量额外提升 15.7% 吞吐;
  • MTP + TTT:解决训练时”老师强制”和推理时”自回归生成”的分布不一致问题,对话场景平均接受率从 52.8% 提升到 66.4%;
  • 推理和训练解耦:通过 Mooncake tensor store 连接,两边可以独立扩缩容,适合大规模线上服务。

如果你之前关注过 腾讯混元 Hy3 或者 HyOCR-1.5,应该能感觉到腾讯混元在基础设施这块是认真在开源的,不是只放几个权重做做样子。


六种草稿架构,怎么选

AngelSpec 支持的六种架构,大致可以分成三类:

架构类型适合场景
MTP自回归开放域对话、高熵文本生成
DFlash / DFlare / DFly块并行代码、数学、长可预测跨度任务
Eagle3 / DSpark混合通用场景,需要平衡接受率和延迟

简单粗暴的选型建议:

  • 如果你的服务主要是聊天、问答,优先试 MTP + TTT;
  • 如果是代码补全、数学推理、结构化生成,DFly 或 DFlash 更合适;
  • 如果不知道业务分布,或者任务很杂,就从 DSpark 或 Eagle3 开始跑 benchmark,再决定精调方向。

AngelSpec 的好处是,这几种架构共用一套数据加载、训练流程和评估工具,换方案的成本主要是改配置文件。


本地部署实操:8 张 GPU 跑起来

AngelSpec 的硬件门槛不友好。官方示例里,单节点快速启动需要 8 张 GPU(4 张做推理、4 张做训练),目标模型是 Qwen3-8B。多节点训练则是面向 Hy3-A21B 这种大模型。

对于个人开发者,最现实的玩法是:用 Qwen3-8B 示例跑通流程,理解原理,再决定是否投入资源做生产部署

环境准备

官方推荐两种安装方式。最简单的是 pip:

Markdown
# 克隆仓库
git clone https://github.com/Tencent/AngelSpec.git
cd AngelSpec

# 安装 AngelSpec + vLLM 后端
pip install -e ".[vllm]"
pip install mooncake-transfer-engine

如果你的 CUDA 版本是 12.x,注意 PyPI 默认的 torch / vLLM wheels 是针对 CUDA 13 编译的,需要手动安装对应 CUDA 版本的 wheel,否则运行时会报加载错误。具体可以参考 官方安装文档

也可以用 Conda 一键构建:

Bash
./tools/build_conda.sh 1 vllm
micromamba activate angelspec

跑第一个示例

以 Qwen3-8B + DFly 为例,官方已经配好了脚本:

Bash
./examples/qwen3-8b-dfly/run.sh

想改训练参数可以直接通过 CLI 覆盖:

Bash
./examples/qwen3-8b-dfly/run.sh \
  training.learning_rate=5e-5 \
  training.num_train_steps=500

配置文件在 configs/ 目录下,比如:

  • configs/vllm_qwen3_8b_dfly.yaml:DFly 块并行 + vLLM 后端
  • configs/vllm_qwen3_8b_mtp_pack_usp_40k.yaml:MTP + 40k 序列并行
  • configs/sglang_qwen3_8b_dflash.yaml:DFlash + SGLang 后端

如果你不想从头训练,也可以直接用官方放出的草稿权重做推理加速:

把这些权重挂到 vLLM 或 SGLang 上,配合目标模型一起跑,就能看到加速效果。

没有 8 张卡怎么办

坦白说,如果没有多卡环境,AngelSpec 的训练部分是跑不起来的。但你仍然可以:

  1. 用官方预训练权重,在单卡或多卡推理环境里验证加速比;
  2. 读它的代码和配置,学习投机解码的实战经验;
  3. 等云平台集成——腾讯云、阿里云、火山引擎这些厂商通常会在开源框架发布后不久推出托管服务。

对于想深入了解大模型推理优化的同学,AngelSpec 的代码本身就是一个很好的教材。它的 技术报告 也值得读,里面详细讲了 DFly 和 D-cut 的设计动机。


普通用户能蹭上这波加速吗

如果你不是开发者,可能会问:这跟我有什么关系?

关系在于,所有你日常用的 AI 服务,底层推理成本越低,你拿到的响应就越快、越便宜。AngelSpec 这种框架开源后,会被集成到 vLLM、SGLang、HuggingFace TGI 这些主流推理引擎里,再被云平台封装成 API。到时候你调用千问、Kimi、DeepSeek 的接口,响应延迟和价格在竞争中都会被压下来。

另外,AngelSpec 也是国产大模型基础设施的一次重要补充。之前 DeepSeek 的 DSpark、阿里的加速方案多在各自生态里,AngelSpec 把训练框架、权重、部署工具一次性放出来,对国内开发者做私有化部署和国产算力适配是有帮助的。

如果你想自己折腾本地大模型,可以先看 本地部署大模型完全指南,把 Ollama、LM Studio 这些工具玩熟,再考虑上 AngelSpec 这种生产级方案。


和 DSpark 相比,怎么选

很多人会把 AngelSpec 和 DeepSeek DSpark 放一起比较。两者都是投机解码框架,但定位略有不同:

  • DSpark 更偏向 DeepSeek 自家模型的推理加速,强调单用户生成速度提升,最高能到 85%;
  • AngelSpec 更像一个通用训练平台,支持多种架构、多个目标模型,强调从训练到部署的全链路能力。

如果你是 DeepSeek 生态用户,优先 DSpark;如果你需要对比多种投机解码方案、训练自己的草稿模型,或者服务腾讯混元 / 千问模型,AngelSpec 更合适。

当然,两者也可以结合着看——投机解码这个方向,2026 年明显在从”单点技巧”变成”系统工程”。


写在最后

AngelSpec 不是那种下载下来点两下就能用的”玩具”,它是一个面向生产环境的推理加速基础设施。对于个人开发者,它的价值更多在于学习思路和直接用预训练权重做推理加速;对于团队和企业,它提供了一个可以训练、评估、部署自己草稿模型的完整流水线。

比起”大模型参数又多了多少”,这种把同样参数跑得更快、更便宜的工作,才是让 AI 真正落地最关键的一环。

如果你对大模型推理优化感兴趣,建议先 star 一下 AngelSpec 仓库,把 Qwen3-8B 示例跑一遍。就算没有 8 张卡,读一遍配置和训练脚本,也会对这个方向的工程细节有更深的理解。

毕竟,会用工具的人,和只会围观参数发布会的人,看到的完全不是同一个世界。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

推荐阅读

  • Claude Code 的多个终端终于能互相发消息了:跨会话消息上手指南

    Claude Code v2.1.224 在 macOS 与 Linux 上新增跨会话消息:多个独立终端里的 Agent 可以互相发现、发送文本。本文带你升级 CLI、用 /list-agents 查…

  • 蚂蚁百灵 Ling-3.0-flash 开源了:124B/5.1B MoE,单台 DGX Spark 能跑,开发者怎么接?

    如果你最近已经被国产大模型的“八周五连发”轰炸得有点麻木,那蚂蚁集团 8 月 7 日这条消息还是值得单独拎出来说:旗下百灵大模型团队把新一代原生混合推理模型 Ling-3.0-flash 的权重正式放…

  • 扎克伯格终于对 AI 编程下手了:Muse Code 测试版上手,一条命令让 Agent 替你改代码

    8 月 5 日,Meta 正式发布了自己的第一款终端 AI 编程智能体——Muse Code。不是模型 API,不是网页聊天,而是直接钻进你终端、能读你代码库、能自己规划任务并执行的那类工具。 在这之…

  • ChatGPT 免费版终于「解禁」了:无限对话 + GPT-5.6 Luna + 思考按钮,一文看懂怎么用

    如果你用 ChatGPT 的免费版,大概率遇到过这种情况:聊到一半,屏幕突然弹出一行灰字——”您已达到使用上限”。那种被硬生生打断思路的感觉,跟看电影看到高潮突然插播广告差不多…