把大模型推理速度翻倍:腾讯混元开源 AngelSpec,教你部署投机解码

大模型推理贵、慢、卡,这件事困扰整个行业太久了。

7 月 30 日,腾讯混元团队甩出一个新开源项目:AngelSpec。这是一个端到端的投机解码(Speculative Decoding)训练与部署框架,覆盖了 drafter 训练、架构设计到线上推理的全链路,还同步放出了 Hy3-A21B 和 Qwen3-8B 的 MTP / DFly 草稿权重与训练代码。

官方给出的数字很唬人:在六大 benchmark 上,对比自回归基线平均加速 1.98–2.40 倍,代码和数学任务峰值能到 2.86 倍。

但比起看数字,我更关心一件事:这东西普通人能不能用?开发者能不能在自己机器上跑起来? 我翻了它的 GitHub、文档和 arXiv 技术报告,结论是:可以,但门槛不低。这篇文章就聊聊 AngelSpec 到底是什么、能解决什么问题,以及怎么从零把它跑起来。


投机解码:让大模型”猜”着走

先别被”投机解码”这个名字吓到。它的核心思想其实很朴素:

大模型生成文本时,传统方式是一个一个 token 往外蹦,每蹦一个都要过一遍大模型,开销很大。投机解码的做法是,先用一个轻量级的”草稿模型”(drafter)一次性猜好几个 token,然后让大模型一次性验证这批猜测。猜对的直接保留,猜错的再修正。

就像考试时先快速把会做的题填完,再回头检查一遍。只要草稿模型够准,整体速度就能快很多,而且输出结果和不加速时完全一致——这是投机解码相比蒸馏、量化最诱人的地方,它不改变模型分布。

但问题也很现实:

  • 草稿模型不能太重,否则验证开销会吃掉加速收益;
  • 不同任务难度不一样,代码和数学场景长可预测跨度多,对话场景则熵高、难猜;
  • 训练、部署、在线调参经常脱节,工程上很繁琐。

AngelSpec 就是冲着这些工程痛点来的。


AngelSpec 到底有什么不一样

市面上做投机解码的工具不少,比如美团的 DFlash、DeepSeek 的 DSpark、EAGLE 系列。AngelSpec 最大的特点是全链路开源 + 统一训练框架

它把六种草稿架构塞进了同一个训练流水线:DFly、DFlash、DFlare、Eagle3、DSpark、MTP。切换架构只需要改配置,不用重写训练代码。对于想尝试不同方案的团队来说,这省了不少事。

其中最值得说的是 DFly。它算是 DFlash 的升级版:

  • 混合 target 条件注入,让每一层 draft 既能看到全局语义,也能拿到适合自己深度的 target 特征;
  • 加了一个轻量的隐状态校正自回归头,在并行生成的同时修正块内 token 依赖;
  • 训练目标直接面向”接受率”优化,而不是单纯拟合下一个 token。

效果也很直观:DFly 平均接受长度达到 4.79,比 DFlash 的 3.69 高出约 30%,比 MTP 的 3.00 高出约 60%。接受长度越长,意味着一次猜测能蒙对的 token 越多,加速效果越明显。

另外几个工程细节也很实用:

  • D-cut 动态验证:高并发时不一刀切地验证固定长度,而是根据前缀置信度和运行成本自适应调整验证深度,线上真实流量额外提升 15.7% 吞吐;
  • MTP + TTT:解决训练时”老师强制”和推理时”自回归生成”的分布不一致问题,对话场景平均接受率从 52.8% 提升到 66.4%;
  • 推理和训练解耦:通过 Mooncake tensor store 连接,两边可以独立扩缩容,适合大规模线上服务。

如果你之前关注过 腾讯混元 Hy3 或者 HyOCR-1.5,应该能感觉到腾讯混元在基础设施这块是认真在开源的,不是只放几个权重做做样子。


六种草稿架构,怎么选

AngelSpec 支持的六种架构,大致可以分成三类:

架构类型适合场景
MTP自回归开放域对话、高熵文本生成
DFlash / DFlare / DFly块并行代码、数学、长可预测跨度任务
Eagle3 / DSpark混合通用场景,需要平衡接受率和延迟

简单粗暴的选型建议:

  • 如果你的服务主要是聊天、问答,优先试 MTP + TTT;
  • 如果是代码补全、数学推理、结构化生成,DFly 或 DFlash 更合适;
  • 如果不知道业务分布,或者任务很杂,就从 DSpark 或 Eagle3 开始跑 benchmark,再决定精调方向。

AngelSpec 的好处是,这几种架构共用一套数据加载、训练流程和评估工具,换方案的成本主要是改配置文件。


本地部署实操:8 张 GPU 跑起来

AngelSpec 的硬件门槛不友好。官方示例里,单节点快速启动需要 8 张 GPU(4 张做推理、4 张做训练),目标模型是 Qwen3-8B。多节点训练则是面向 Hy3-A21B 这种大模型。

对于个人开发者,最现实的玩法是:用 Qwen3-8B 示例跑通流程,理解原理,再决定是否投入资源做生产部署

环境准备

官方推荐两种安装方式。最简单的是 pip:

Markdown
# 克隆仓库
git clone https://github.com/Tencent/AngelSpec.git
cd AngelSpec

# 安装 AngelSpec + vLLM 后端
pip install -e ".[vllm]"
pip install mooncake-transfer-engine

如果你的 CUDA 版本是 12.x,注意 PyPI 默认的 torch / vLLM wheels 是针对 CUDA 13 编译的,需要手动安装对应 CUDA 版本的 wheel,否则运行时会报加载错误。具体可以参考 官方安装文档

也可以用 Conda 一键构建:

Bash
./tools/build_conda.sh 1 vllm
micromamba activate angelspec

跑第一个示例

以 Qwen3-8B + DFly 为例,官方已经配好了脚本:

Bash
./examples/qwen3-8b-dfly/run.sh

想改训练参数可以直接通过 CLI 覆盖:

Bash
./examples/qwen3-8b-dfly/run.sh \
  training.learning_rate=5e-5 \
  training.num_train_steps=500

配置文件在 configs/ 目录下,比如:

  • configs/vllm_qwen3_8b_dfly.yaml:DFly 块并行 + vLLM 后端
  • configs/vllm_qwen3_8b_mtp_pack_usp_40k.yaml:MTP + 40k 序列并行
  • configs/sglang_qwen3_8b_dflash.yaml:DFlash + SGLang 后端

如果你不想从头训练,也可以直接用官方放出的草稿权重做推理加速:

把这些权重挂到 vLLM 或 SGLang 上,配合目标模型一起跑,就能看到加速效果。

没有 8 张卡怎么办

坦白说,如果没有多卡环境,AngelSpec 的训练部分是跑不起来的。但你仍然可以:

  1. 用官方预训练权重,在单卡或多卡推理环境里验证加速比;
  2. 读它的代码和配置,学习投机解码的实战经验;
  3. 等云平台集成——腾讯云、阿里云、火山引擎这些厂商通常会在开源框架发布后不久推出托管服务。

对于想深入了解大模型推理优化的同学,AngelSpec 的代码本身就是一个很好的教材。它的 技术报告 也值得读,里面详细讲了 DFly 和 D-cut 的设计动机。


普通用户能蹭上这波加速吗

如果你不是开发者,可能会问:这跟我有什么关系?

关系在于,所有你日常用的 AI 服务,底层推理成本越低,你拿到的响应就越快、越便宜。AngelSpec 这种框架开源后,会被集成到 vLLM、SGLang、HuggingFace TGI 这些主流推理引擎里,再被云平台封装成 API。到时候你调用千问、Kimi、DeepSeek 的接口,响应延迟和价格在竞争中都会被压下来。

另外,AngelSpec 也是国产大模型基础设施的一次重要补充。之前 DeepSeek 的 DSpark、阿里的加速方案多在各自生态里,AngelSpec 把训练框架、权重、部署工具一次性放出来,对国内开发者做私有化部署和国产算力适配是有帮助的。

如果你想自己折腾本地大模型,可以先看 本地部署大模型完全指南,把 Ollama、LM Studio 这些工具玩熟,再考虑上 AngelSpec 这种生产级方案。


和 DSpark 相比,怎么选

很多人会把 AngelSpec 和 DeepSeek DSpark 放一起比较。两者都是投机解码框架,但定位略有不同:

  • DSpark 更偏向 DeepSeek 自家模型的推理加速,强调单用户生成速度提升,最高能到 85%;
  • AngelSpec 更像一个通用训练平台,支持多种架构、多个目标模型,强调从训练到部署的全链路能力。

如果你是 DeepSeek 生态用户,优先 DSpark;如果你需要对比多种投机解码方案、训练自己的草稿模型,或者服务腾讯混元 / 千问模型,AngelSpec 更合适。

当然,两者也可以结合着看——投机解码这个方向,2026 年明显在从”单点技巧”变成”系统工程”。


写在最后

AngelSpec 不是那种下载下来点两下就能用的”玩具”,它是一个面向生产环境的推理加速基础设施。对于个人开发者,它的价值更多在于学习思路和直接用预训练权重做推理加速;对于团队和企业,它提供了一个可以训练、评估、部署自己草稿模型的完整流水线。

比起”大模型参数又多了多少”,这种把同样参数跑得更快、更便宜的工作,才是让 AI 真正落地最关键的一环。

如果你对大模型推理优化感兴趣,建议先 star 一下 AngelSpec 仓库,把 Qwen3-8B 示例跑一遍。就算没有 8 张卡,读一遍配置和训练脚本,也会对这个方向的工程细节有更深的理解。

毕竟,会用工具的人,和只会围观参数发布会的人,看到的完全不是同一个世界。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

推荐阅读

  • 把大模型推理速度翻倍:腾讯混元开源 AngelSpec,教你部署投机解码

    大模型推理贵、慢、卡,这件事困扰整个行业太久了。 7 月 30 日,腾讯混元团队甩出一个新开源项目:AngelSpec。这是一个端到端的投机解码(Speculative Decoding)训练与部署框…

  • OpenAI 也终于开源了:gpt-oss-120b 和 gpt-oss-20b 上手指南,从下载到本地部署一篇讲清楚

    7 月 29 日凌晨,OpenAI 把两枚模型权重扔到了 Hugging Face 上:gpt-oss-120b 和 gpt-oss-20b。Apache 2.0 协议,可商用、可改、可再分发。这是 …

  • Kimi K3 权重真的开源了:2.8T 模型怎么下载、部署和接入,一篇讲清楚

    7 月 27 日深夜,月之暗面把 Kimi K3 的模型权重、技术报告,以及支撑它训练的三项 Infra——MoonEP、FlashKDA、AgentEnv——一次性全扔了出来。 这不是那种「只发论文…

  • 阿里终于把AI办公这件事想清楚了:千问办公来了,三条产品线合成一个

    7月27日是个有意思的日子。 同一天,美团把「小团」从嘴替升级成了跑腿的,腾讯WorkBuddy正式登上了鸿蒙电脑应用市场,而阿里——悄悄放出了一个叫「千问办公」的桌面客户端,小范围开始内测。 三巨头…

暗夜独行