新研究提出投机修正解码:草稿-精炼模式显著加速扩散语言模型生成
文 / Mr.Xu
发布时间: · 3 次阅读
摘要:arXiv 最新论文提出一种即插即用的推理模式——投机修正(Speculative Correction),用于扩散语言模型(DLM)。该方法先由模型生成完整草稿,再利用双向扩散进行全局精炼。在 LLaDA2.1-Flash 和 LLaDA2.1-Mini 上的实验表明,同模型草稿-精炼(Flash-Flash)在 GSM8K-384 上准确率从 0.848 提升至 0.899,且速度提升 1.20 倍;异构级联(Mini-Flash)在 MATH-384 上以 2.17 倍加速达到接近 Flash 的性能。该工作为 DLM 的高效解码提供了新范式,无需额外训练即可实现质量与延迟的 Pareto 优化。
研究背景
扩散语言模型(DLM)具备双向修订 token 的能力,但标准解码流程通常将其适配为从左到右的逐块生成,未能充分利用其全局精炼潜力。
核心方法
论文提出一种即插即用的推理模式:草稿-精炼(Draft-then-Refine)。具体分为两种配置:
- Flash-Flash:同一模型(LLaDA2.1-Flash)既作为草稿生成器,又作为精炼器,检验模型能否通过全局精炼改进自身的块自回归输出。
- Mini-Flash:受投机解码启发,由较小模型(LLaDA2.1-Mini)生成完整草稿,再由 Flash 模型将其作为可编辑初始化进行修订,称为投机修正(Speculative Correction)。
实验结果
- Flash-Flash:GSM8K-384 准确率从 0.848 提升至 0.899,同时比基线快 1.20 倍;MBPP-384 从 0.545 提升至 0.693。
- Mini-Flash:在 MATH-384 上达到 0.294(Flash 为 0.300),但速度提升 2.17 倍,展示了质量-延迟的 Pareto 前沿。
因果消融实验表明:完整草稿提供了有效初始化,完全掩码的跨度精炼效果差,全局精炼在 GSM8K 上增益明显,局部精炼在 MBPP 和 MATH 上捕获大部分增益。
技术亮点
- 无需训练:投机修正完全无需额外训练,即可实现加速。
- 双向精炼:验证了双向扩散作为 DLM 解码原语的有效性。
- Pareto 优化:异构级联并非在所有场景下都匹配 Flash 质量,但提供了更优的延迟-质量权衡。
行业影响与开发者建议
该研究为 DLM 的高效部署提供了新思路,尤其适合对延迟敏感的应用场景。开发者可考虑在现有 DLM 推理流程中集成草稿-精炼模式,以在保持质量的同时提升吞吐量。未来可探索更优的草稿模型选择与精炼策略。
—— 完 ——社区整体评论区
正在加载实时智能评论与划词标注…