Fireworks AI发布针对NVIDIA Blackwell优化的MiniMax M3稀疏注意力内核,性能提升显著
文 / Mr.Xu
发布时间:
摘要:Fireworks AI开发了一款针对NVIDIA Blackwell(SM100)架构优化的MiniMax M3稀疏注意力内核,其性能达到约980 TFLOP/s,比基于查询的基线方法快1.9-2.4倍,比开源MSA快约1.6倍。该内核采用KV-静态稀疏注意力机制,并结合多种优化技术,如连续部分输出存储、三线程异步查询收集、简化的softmax→存储流水线、负载均衡的分割查询调度、D2H消除以及C++ AOT调度后端。相关实验在单个B200芯片上进行了全面模块化基准测试,结果展示了该内核在稀疏注意力计算中的高效性和优越性。
技术亮点解析
-
KV-静态稀疏注意力机制:Fireworks AI采用KV-静态稀疏注意力机制,相较于传统的查询静态方法,在计算效率上有显著提升。这种机制通过减少冗余计算和优化内存访问模式,实现了更高的性能。
-
多层次优化技术:
- 连续部分输出存储与合并收集:通过连续存储部分输出并使用合并收集技术,减少了内存带宽需求。
- 三线程异步查询收集:利用三线程异步机制加速查询数据的收集过程。
- 简化的softmax→存储流水线:缩短了softmax到存储的流水线长度,降低了延迟。
- 负载均衡的分割查询调度:通过负载均衡的查询调度机制,提升了整体计算资源的利用率。
- D2H消除:减少了主机到设备的数据传输,进一步提升了效率。
- C++ AOT调度后端:使用C++编写的AOT(提前编译)调度后端,优化了任务调度和资源管理。
-
性能表现:在NVIDIA Blackwell架构上,该内核实现了约980 TFLOP/s的峰值性能,比基线方法快1.9-2.4倍,比开源MSA快约1.6倍。
行业影响与开发者建议
-
对AI模型优化的影响:该内核的发布为AI模型在稀疏注意力计算上的优化提供了新的思路,尤其适用于需要高效计算和低延迟的应用场景,如实时推理和大规模数据处理。
-
对NVIDIA Blackwell用户的建议:NVIDIA Blackwell用户可以尝试采用Fireworks AI的优化内核,以提升其AI模型的计算效率。同时,开发者可以参考该内核的设计理念和优化技术,应用到其他AI模型的优化中。
-
未来研究方向:未来可以进一步探索KV-静态稀疏注意力机制在其他模型和硬件平台上的应用,以及结合其他优化技术,如混合精度计算和模型剪枝,以实现更高的性能提升。
—— 完 ——消息来源:Fireworks AI Blog (2026-07-10)
社区整体评论区