NVIDIA发布Vera Rubin NVL72:MLPerf推理性能提升3.7倍
文 / Mr.Xu
发布时间: · 8 次阅读
摘要:NVIDIA推出了新一代AI推理系统Vera Rubin NVL72,在MLPerf Inference v6.1基准测试中表现优异。与前代GB300 NVL72相比,Vera Rubin NVL72在Qwen3-VL模型上的吞吐量提升了3.7倍,在DeepSeek-R1模型上提升了2.5倍。该系统通过硬件与软件的协同优化,包括增强的Tensor Cores、Transformer Engine以及NVFP4精度技术,实现了更高的性能和效率。Vera Rubin NVL72的发布标志着NVIDIA在AI基础设施领域的持续创新,为大规模AI推理任务提供了更强大的支持。
NVIDIA近日发布了其新一代AI推理系统——Vera Rubin NVL72,该系统在MLPerf Inference v6.1基准测试中表现出色,主要技术亮点如下:
主要技术亮点
- 性能提升:Vera Rubin NVL72在Qwen3-VL模型上的吞吐量比GB300 NVL72提升了3.7倍,在DeepSeek-R1模型上提升了2.5倍。
- 硬件优化:通过增强的Tensor Cores和Transformer Engine,Vera Rubin NVL72加速了推理的预填充和解码阶段。
- 精度技术:NVFP4精度技术减少了模型权重、注意力和KV缓存的内存占用,在保证输出质量的同时提高了吞吐量。
- 软件优化:持续的软件优化使得Vera Rubin NVL72在v6.1中的性能比v6.0提升了1.6倍,且优化工作仍在进行中。
- 扩展性:在离线场景下,Vera Rubin NVL72的扩展效率达到99%,硬件增加带来的吞吐量增长几乎呈线性。
行业影响
Vera Rubin NVL72的发布不仅展示了NVIDIA在AI硬件和软件协同设计上的强大能力,还为AI推理任务提供了更高的效率和更低的成本。对于需要处理大规模AI推理任务的企业和研究机构,该系统能够显著提升生产力并降低运营成本。
开发者建议
- 硬件选择:对于需要高性能AI推理的应用场景,Vera Rubin NVL72是一个值得考虑的选择。
- 软件优化:开发者可以利用NVIDIA提供的软件工具,如NVIDIA Dynamo和TensorRT-LLM,进一步优化模型性能。
- 持续关注:NVIDIA的持续软件优化意味着未来可能会有更多性能提升,建议开发者定期关注相关更新。
—— 完 ——消息来源:NVIDIA AI News (2026-09-16)
社区整体评论区
正在加载实时智能评论与划词标注…