大模型推理贵、慢、卡,这件事困扰整个行业太久了。
7 月 30 日,腾讯混元团队甩出一个新开源项目:AngelSpec。这是一个端到端的投机解码(Speculative Decoding)训练与部署框架,覆盖了 drafter 训练、架构设计到线上推理的全链路,还同步放出了 Hy3-A21B 和 Qwen3-8B 的 MTP / DFly 草稿权重与训练代码。
官方给出的数字很唬人:在六大 benchmark 上,对比自回归基线平均加速 1.98–2.40 倍,代码和数学任务峰值能到 2.86 倍。
但比起看数字,我更关心一件事:这东西普通人能不能用?开发者能不能在自己机器上跑起来? 我翻了它的 GitHub、文档和 arXiv 技术报告,结论是:可以,但门槛不低。这篇文章就聊聊 AngelSpec 到底是什么、能解决什么问题,以及怎么从零把它跑起来。
投机解码:让大模型”猜”着走
先别被”投机解码”这个名字吓到。它的核心思想其实很朴素:
大模型生成文本时,传统方式是一个一个 token 往外蹦,每蹦一个都要过一遍大模型,开销很大。投机解码的做法是,先用一个轻量级的”草稿模型”(drafter)一次性猜好几个 token,然后让大模型一次性验证这批猜测。猜对的直接保留,猜错的再修正。
就像考试时先快速把会做的题填完,再回头检查一遍。只要草稿模型够准,整体速度就能快很多,而且输出结果和不加速时完全一致——这是投机解码相比蒸馏、量化最诱人的地方,它不改变模型分布。
但问题也很现实:
- 草稿模型不能太重,否则验证开销会吃掉加速收益;
- 不同任务难度不一样,代码和数学场景长可预测跨度多,对话场景则熵高、难猜;
- 训练、部署、在线调参经常脱节,工程上很繁琐。
AngelSpec 就是冲着这些工程痛点来的。
AngelSpec 到底有什么不一样
市面上做投机解码的工具不少,比如美团的 DFlash、DeepSeek 的 DSpark、EAGLE 系列。AngelSpec 最大的特点是全链路开源 + 统一训练框架。
它把六种草稿架构塞进了同一个训练流水线:DFly、DFlash、DFlare、Eagle3、DSpark、MTP。切换架构只需要改配置,不用重写训练代码。对于想尝试不同方案的团队来说,这省了不少事。
其中最值得说的是 DFly。它算是 DFlash 的升级版:
- 混合 target 条件注入,让每一层 draft 既能看到全局语义,也能拿到适合自己深度的 target 特征;
- 加了一个轻量的隐状态校正自回归头,在并行生成的同时修正块内 token 依赖;
- 训练目标直接面向”接受率”优化,而不是单纯拟合下一个 token。
效果也很直观:DFly 平均接受长度达到 4.79,比 DFlash 的 3.69 高出约 30%,比 MTP 的 3.00 高出约 60%。接受长度越长,意味着一次猜测能蒙对的 token 越多,加速效果越明显。
另外几个工程细节也很实用:
- D-cut 动态验证:高并发时不一刀切地验证固定长度,而是根据前缀置信度和运行成本自适应调整验证深度,线上真实流量额外提升 15.7% 吞吐;
- MTP + TTT:解决训练时”老师强制”和推理时”自回归生成”的分布不一致问题,对话场景平均接受率从 52.8% 提升到 66.4%;
- 推理和训练解耦:通过 Mooncake tensor store 连接,两边可以独立扩缩容,适合大规模线上服务。
如果你之前关注过 腾讯混元 Hy3 或者 HyOCR-1.5,应该能感觉到腾讯混元在基础设施这块是认真在开源的,不是只放几个权重做做样子。
六种草稿架构,怎么选
AngelSpec 支持的六种架构,大致可以分成三类:
| 架构 | 类型 | 适合场景 |
|---|---|---|
| MTP | 自回归 | 开放域对话、高熵文本生成 |
| DFlash / DFlare / DFly | 块并行 | 代码、数学、长可预测跨度任务 |
| Eagle3 / DSpark | 混合 | 通用场景,需要平衡接受率和延迟 |
简单粗暴的选型建议:
- 如果你的服务主要是聊天、问答,优先试 MTP + TTT;
- 如果是代码补全、数学推理、结构化生成,DFly 或 DFlash 更合适;
- 如果不知道业务分布,或者任务很杂,就从 DSpark 或 Eagle3 开始跑 benchmark,再决定精调方向。
AngelSpec 的好处是,这几种架构共用一套数据加载、训练流程和评估工具,换方案的成本主要是改配置文件。
本地部署实操:8 张 GPU 跑起来
AngelSpec 的硬件门槛不友好。官方示例里,单节点快速启动需要 8 张 GPU(4 张做推理、4 张做训练),目标模型是 Qwen3-8B。多节点训练则是面向 Hy3-A21B 这种大模型。
对于个人开发者,最现实的玩法是:用 Qwen3-8B 示例跑通流程,理解原理,再决定是否投入资源做生产部署。
环境准备
官方推荐两种安装方式。最简单的是 pip:
# 克隆仓库
git clone https://github.com/Tencent/AngelSpec.git
cd AngelSpec
# 安装 AngelSpec + vLLM 后端
pip install -e ".[vllm]"
pip install mooncake-transfer-engine
如果你的 CUDA 版本是 12.x,注意 PyPI 默认的 torch / vLLM wheels 是针对 CUDA 13 编译的,需要手动安装对应 CUDA 版本的 wheel,否则运行时会报加载错误。具体可以参考 官方安装文档。
也可以用 Conda 一键构建:
./tools/build_conda.sh 1 vllm
micromamba activate angelspec跑第一个示例
以 Qwen3-8B + DFly 为例,官方已经配好了脚本:
./examples/qwen3-8b-dfly/run.sh想改训练参数可以直接通过 CLI 覆盖:
./examples/qwen3-8b-dfly/run.sh \
training.learning_rate=5e-5 \
training.num_train_steps=500配置文件在 configs/ 目录下,比如:
configs/vllm_qwen3_8b_dfly.yaml:DFly 块并行 + vLLM 后端configs/vllm_qwen3_8b_mtp_pack_usp_40k.yaml:MTP + 40k 序列并行configs/sglang_qwen3_8b_dflash.yaml:DFlash + SGLang 后端
如果你不想从头训练,也可以直接用官方放出的草稿权重做推理加速:
把这些权重挂到 vLLM 或 SGLang 上,配合目标模型一起跑,就能看到加速效果。
没有 8 张卡怎么办
坦白说,如果没有多卡环境,AngelSpec 的训练部分是跑不起来的。但你仍然可以:
- 用官方预训练权重,在单卡或多卡推理环境里验证加速比;
- 读它的代码和配置,学习投机解码的实战经验;
- 等云平台集成——腾讯云、阿里云、火山引擎这些厂商通常会在开源框架发布后不久推出托管服务。
对于想深入了解大模型推理优化的同学,AngelSpec 的代码本身就是一个很好的教材。它的 技术报告 也值得读,里面详细讲了 DFly 和 D-cut 的设计动机。
普通用户能蹭上这波加速吗
如果你不是开发者,可能会问:这跟我有什么关系?
关系在于,所有你日常用的 AI 服务,底层推理成本越低,你拿到的响应就越快、越便宜。AngelSpec 这种框架开源后,会被集成到 vLLM、SGLang、HuggingFace TGI 这些主流推理引擎里,再被云平台封装成 API。到时候你调用千问、Kimi、DeepSeek 的接口,响应延迟和价格在竞争中都会被压下来。
另外,AngelSpec 也是国产大模型基础设施的一次重要补充。之前 DeepSeek 的 DSpark、阿里的加速方案多在各自生态里,AngelSpec 把训练框架、权重、部署工具一次性放出来,对国内开发者做私有化部署和国产算力适配是有帮助的。
如果你想自己折腾本地大模型,可以先看 本地部署大模型完全指南,把 Ollama、LM Studio 这些工具玩熟,再考虑上 AngelSpec 这种生产级方案。
和 DSpark 相比,怎么选
很多人会把 AngelSpec 和 DeepSeek DSpark 放一起比较。两者都是投机解码框架,但定位略有不同:
- DSpark 更偏向 DeepSeek 自家模型的推理加速,强调单用户生成速度提升,最高能到 85%;
- AngelSpec 更像一个通用训练平台,支持多种架构、多个目标模型,强调从训练到部署的全链路能力。
如果你是 DeepSeek 生态用户,优先 DSpark;如果你需要对比多种投机解码方案、训练自己的草稿模型,或者服务腾讯混元 / 千问模型,AngelSpec 更合适。
当然,两者也可以结合着看——投机解码这个方向,2026 年明显在从”单点技巧”变成”系统工程”。
写在最后
AngelSpec 不是那种下载下来点两下就能用的”玩具”,它是一个面向生产环境的推理加速基础设施。对于个人开发者,它的价值更多在于学习思路和直接用预训练权重做推理加速;对于团队和企业,它提供了一个可以训练、评估、部署自己草稿模型的完整流水线。
比起”大模型参数又多了多少”,这种把同样参数跑得更快、更便宜的工作,才是让 AI 真正落地最关键的一环。
如果你对大模型推理优化感兴趣,建议先 star 一下 AngelSpec 仓库,把 Qwen3-8B 示例跑一遍。就算没有 8 张卡,读一遍配置和训练脚本,也会对这个方向的工程细节有更深的理解。
毕竟,会用工具的人,和只会围观参数发布会的人,看到的完全不是同一个世界。




发表回复