智客 ZICQ
EN 登录 / 注册
智客前沿 前沿论文 #扩散语言模型 #投机解码 #推理加速 #LLaDA

新研究提出投机修正解码:草稿-精炼模式显著加速扩散语言模型生成

Mr.Xu 的头像

文 / Mr.Xu

发布时间: · 3 次阅读

中文阅读 (Chinese) English Version

摘要:arXiv 最新论文提出一种即插即用的推理模式——投机修正(Speculative Correction),用于扩散语言模型(DLM)。该方法先由模型生成完整草稿,再利用双向扩散进行全局精炼。在 LLaDA2.1-Flash 和 LLaDA2.1-Mini 上的实验表明,同模型草稿-精炼(Flash-Flash)在 GSM8K-384 上准确率从 0.848 提升至 0.899,且速度提升 1.20 倍;异构级联(Mini-Flash)在 MATH-384 上以 2.17 倍加速达到接近 Flash 的性能。该工作为 DLM 的高效解码提供了新范式,无需额外训练即可实现质量与延迟的 Pareto 优化。


研究背景

扩散语言模型(DLM)具备双向修订 token 的能力,但标准解码流程通常将其适配为从左到右的逐块生成,未能充分利用其全局精炼潜力。

核心方法

论文提出一种即插即用的推理模式:草稿-精炼(Draft-then-Refine)。具体分为两种配置:

  • Flash-Flash:同一模型(LLaDA2.1-Flash)既作为草稿生成器,又作为精炼器,检验模型能否通过全局精炼改进自身的块自回归输出。
  • Mini-Flash:受投机解码启发,由较小模型(LLaDA2.1-Mini)生成完整草稿,再由 Flash 模型将其作为可编辑初始化进行修订,称为投机修正(Speculative Correction)。

实验结果

  • Flash-Flash:GSM8K-384 准确率从 0.848 提升至 0.899,同时比基线快 1.20 倍;MBPP-384 从 0.545 提升至 0.693。
  • Mini-Flash:在 MATH-384 上达到 0.294(Flash 为 0.300),但速度提升 2.17 倍,展示了质量-延迟的 Pareto 前沿。

因果消融实验表明:完整草稿提供了有效初始化,完全掩码的跨度精炼效果差,全局精炼在 GSM8K 上增益明显,局部精炼在 MBPP 和 MATH 上捕获大部分增益。

技术亮点

  • 无需训练:投机修正完全无需额外训练,即可实现加速。
  • 双向精炼:验证了双向扩散作为 DLM 解码原语的有效性。
  • Pareto 优化:异构级联并非在所有场景下都匹配 Flash 质量,但提供了更优的延迟-质量权衡。

行业影响与开发者建议

该研究为 DLM 的高效部署提供了新思路,尤其适合对延迟敏感的应用场景。开发者可考虑在现有 DLM 推理流程中集成草稿-精炼模式,以在保持质量的同时提升吞吐量。未来可探索更优的草稿模型选择与精炼策略。

—— 完 ——

主题标签: #扩散语言模型 #投机解码 #推理加速 #LLaDA

社区整体评论区

正在加载实时智能评论与划词标注…