Hugging Face提出Rowmax-PoT与Rowmax-H15:优化LLM推理中的Softmax近似计算
文 / Mr.Xu
发布时间:
摘要:Hugging Face团队提出了一种名为Rowmax-PoT的粗粒度对数权重表示方法,以及其硬件优化版本Rowmax-H15,用于优化预训练大语言模型(LLM)推理中的Softmax近似计算。研究表明,通过减少Softmax分配概率的位置数量和行内分辨率,可以在保持模型性能的同时显著提升计算效率。在NVIDIA Blackwell B200上,FP8注意力前向传播速度提升了12.4%(因果8K)和25.8%(非因果8K),能耗降低了8.4%(因果16K)。这一研究为AI模型推理效率的提升提供了新的思路,尤其在资源受限的应用场景中具有重要意义。
研究背景与动机
近年来,随着大语言模型(LLM)的快速发展,如何在保持模型性能的同时提升推理效率成为研究热点。Softmax函数作为LLM中注意力机制的重要组成部分,其计算开销一直是瓶颈之一。Hugging Face团队通过研究Softmax在推理中的近似计算,提出了一种新的优化方法。
主要贡献
- Rowmax-PoT方法:提出了一种粗粒度对数权重表示方法,通过减少Softmax分配概率的位置数量和行内分辨率,在保持模型性能的同时提升了计算效率。
- Rowmax-H15硬件优化:针对NVIDIA Blackwell B200架构,团队进一步优化了Rowmax-PoT方法,推出了硬件优化版本Rowmax-H15。
- 实验验证:在多个模型和不同配置下进行了实验,结果表明,FP8注意力前向传播速度在因果8K和非因果8K配置下分别提升了12.4%和25.8%,能耗在因果16K配置下降低了8.4%。
技术亮点
- 减少Softmax分配概率的位置数量和行内分辨率:通过减少这些参数,在不影响模型性能的情况下,显著降低了计算开销。
- 硬件优化:针对NVIDIA Blackwell B200架构进行了优化,进一步提升了计算效率。
- 实验结果:实验结果表明,该方法在多个模型和配置下均表现出色,验证了其有效性和通用性。
行业影响与开发者建议
- 提升推理效率:该方法为AI模型推理效率的提升提供了新的思路,尤其在资源受限的应用场景中具有重要意义。
- 硬件优化:开发者可以参考该方法,针对不同硬件架构进行优化,以实现更高效的AI模型推理。
- 未来研究方向:未来可以进一步探索如何在不同类型的模型和任务中应用该方法,以实现更广泛的优化效果。
—— 完 ——消息来源:Hugging Face Daily Papers (2026-09-27)
主题标签: #Hugging Face #LLM #Softmax优化 #推理效率 #硬件加速
社区整体评论区