大模型越来越聪明,但推理也越来越慢、越来越贵。7月29日,腾讯混元团队正式开源AngelSpec——一个覆盖训练、架构设计到线上部署全流程的投机解码框架。同步开源的还有Hy3-A21B模型的MTP与DFly drafter权重及训练代码。项目已在GitHub上线,技术报告同步发布在arXiv。
大模型生成文本的方式是“自回归解码”——一个词一个词往外蹦,每生成一个词都要重新计算一次。模型越大、生成越长,计算量越呈线性增长。这在聊天场景还能忍受,但在代码生成、数学推理等需要长输出、高并发的真实业务场景中,延迟和成本就变得难以接受。
投机解码(Speculative Decoding)是目前业界公认的提速方案:用一个轻量级的“草稿模型”(drafter)快速生成多个候选token,再由大模型一次性并行验证。但现有方案有个通病——“一套草稿打天下”,在对话、代码、数学等不同任务上表现参差不齐。此外,块并行解码的架构缺陷和固定验证深度导致的资源浪费,也让实际提速效果大打折扣。
AngelSpec从三个层面逐个击破。
第一,针对不同任务,配不同的“草稿模型”。 AngelSpec不再用一个drafter处理所有任务,而是为高熵值对话场景训练了MTP(多token预测)drafter,为代码、数学等结构化任务训练了DFly块扩散drafter。两者都通过目标模型回放和端到端价值目标进行训练,确保草稿质量。
GitHub页面显示,AngelSpec一口气支持6种草稿架构:DFly、DFlash、DFlare、Eagle3、DSpark、MTP,切换只需改一行配置。
第二,块并行解码的架构升级。 DFly是AngelSpec提出的创新块扩散框架。它通过混合目标条件编码骨干与前序条件自回归头,在保持高吞吐量并行生成的同时,大幅优化了目标特征利用率与块内依赖建模。
第三,动态验证深度管理。 传统投机解码的验证深度是固定的,但不同请求的接受长度和计算成本差异很大。AngelSpec引入了名为D-cut的自适应机制,根据每个请求的预估进度和运行时全局预算,动态管理目标验证深度。推理和训练分为独立的GPU工作组,通过Mooncake张量存储连接,使得隐状态生成和优化可以独立扩展。
在Hy3模型系列上的系统测试中,AngelSpec交出了一组扎实的数据:
MTP drafter配合训练时测试(TTT)和目标模型回放后,平均接受率从52.8%提升至66.4%,平均接受长度从2.58提升至2.99
DFly在Hy3-A21B上的平均接受长度达到4.79,相比MTP(3.00)提升59.7%,相比DFlash(3.69)提升29.8%
D-cut集成后,整体解码速度最高达到自回归解码的2.40倍,吞吐量比DFlash-8高出10.5%–11.8%,在并发数64时有效并发范围扩展了15.7%
AngelSpec的开源内容覆盖了从训练到部署的全链路:
训练框架:torch-native,支持MTP和块并行投机解码训练
6种草稿架构:DFly、DFlash、DFlare、Eagle3、DSpark、MTP,切换只需改配置
Hy3-A21B模型权重:MTP与DFly drafter权重及训练代码同步开源
双模推理引擎:自带MTP调度器和DFly drafter,支持任意Transformer架构接入
对开发者来说,AngelSpec最直接的价值不是“立刻把API账单砍半”,而是提供了一套可追踪的实验基线:同一模型在聊天、代码、数学、Agent工具调用场景中,应该用哪类drafter,接受长度和验证成本如何随并发变化。这意味着团队可以根据自己的业务场景,精准选择合适的加速方案,而不是盲目套用通用模板。



