智客 ZICQ
EN 登录 / 注册
智客前沿 开源AI #CoDR #扩散模型 #推理优化 #开源 #掩码语言模型

CoDR开源:革新扩散语言模型的推理精度与效率

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:CoDR(Confidence Drift Remasking)是一种无需训练且与采样器无关的改进方法,旨在解决掩码扩散语言模型(MDLMs)中由于置信度漂移导致的推理错误问题。该方法通过k次前向传递估计所有已提交位置的漂移,并仅对模型不再支持的token进行重新掩码和生成。实验表明,CoDR在多个推理和编码任务上提升了平均准确率,同时保持了较低的计算开销。CoDR的发布为扩散语言模型的推理优化提供了新的技术路径。


技术背景

掩码扩散语言模型(MDLMs)在解码过程中通过反复提交token到掩码位置进行推理,但这些提交通常是不可逆的。由于模型在稀疏、不完整上下文下选择的token在后续更丰富的上下文中可能不再适用,现有的采样器主要关注何时提交token,而很少检查已提交的token是否仍然有效。这导致了早期错误可能传播的问题。

CoDR的核心创新

CoDR(Confidence Drift Remasking)通过以下方式解决了上述问题:

  • 置信度漂移检测:CoDR通过k次前向传递估计所有已提交位置的置信度漂移。
  • 选择性重新生成:仅对模型不再支持的token进行重新掩码和生成,避免了不必要的计算开销。
  • 无训练且与采样器无关:CoDR无需额外训练,可以与多种采样器无缝集成。

实验结果

在两个骨干模型、四个推理和编码任务以及三种基础采样器上的实验表明,CoDR在所有评估的配置中提升了平均准确率,并在大多数单独任务设置中表现出色。

技术亮点

  • 高效性:CoDR通过k-partition probing显著减少了前向传递次数,相比现有重新生成方法更高效。
  • 准确性提升:通过针对性置信度漂移重新生成,CoDR有效提升了推理精度。
  • 灵活性:无需训练且与采样器无关,使其适用于多种场景。

行业影响与开发者建议

CoDR的发布为扩散语言模型的推理优化提供了新的思路,尤其适用于对推理精度和效率有较高要求的应用场景。开发者可以尝试将CoDR集成到现有的MDLMs中,以提升模型的推理性能。此外,CoDR的开源特性也使其成为研究人员和工程师进行进一步优化和扩展的良好基础。

未来展望

随着扩散模型在AI领域的广泛应用,CoDR有望在文本生成、图像生成等领域发挥重要作用。未来研究可以探索CoDR在更大规模模型和更复杂任务上的表现,并进一步优化其计算效率。


消息来源:ArXiv NLP/LLM (cs.CL) (2026-10-08)

—— 完 ——

主题标签: #CoDR #扩散模型 #推理优化 #开源 #掩码语言模型

社区整体评论区

正在加载实时智能评论与划词标注…