智客 ZICQ
EN 登录 / 注册
智客前沿 算力架构 #NVIDIA #AI推理 #MLPerf #Vera Rubin NVL72 #硬件加速

NVIDIA发布Vera Rubin NVL72:MLPerf推理性能提升3.7倍

Mr.Xu 的头像

文 / Mr.Xu

发布时间: · 8 次阅读

中文阅读 (Chinese) English Version

摘要:NVIDIA推出了新一代AI推理系统Vera Rubin NVL72,在MLPerf Inference v6.1基准测试中表现优异。与前代GB300 NVL72相比,Vera Rubin NVL72在Qwen3-VL模型上的吞吐量提升了3.7倍,在DeepSeek-R1模型上提升了2.5倍。该系统通过硬件与软件的协同优化,包括增强的Tensor Cores、Transformer Engine以及NVFP4精度技术,实现了更高的性能和效率。Vera Rubin NVL72的发布标志着NVIDIA在AI基础设施领域的持续创新,为大规模AI推理任务提供了更强大的支持。


NVIDIA近日发布了其新一代AI推理系统——Vera Rubin NVL72,该系统在MLPerf Inference v6.1基准测试中表现出色,主要技术亮点如下:

主要技术亮点

  1. 性能提升:Vera Rubin NVL72在Qwen3-VL模型上的吞吐量比GB300 NVL72提升了3.7倍,在DeepSeek-R1模型上提升了2.5倍。
  2. 硬件优化:通过增强的Tensor Cores和Transformer Engine,Vera Rubin NVL72加速了推理的预填充和解码阶段。
  3. 精度技术:NVFP4精度技术减少了模型权重、注意力和KV缓存的内存占用,在保证输出质量的同时提高了吞吐量。
  4. 软件优化:持续的软件优化使得Vera Rubin NVL72在v6.1中的性能比v6.0提升了1.6倍,且优化工作仍在进行中。
  5. 扩展性:在离线场景下,Vera Rubin NVL72的扩展效率达到99%,硬件增加带来的吞吐量增长几乎呈线性。

行业影响

Vera Rubin NVL72的发布不仅展示了NVIDIA在AI硬件和软件协同设计上的强大能力,还为AI推理任务提供了更高的效率和更低的成本。对于需要处理大规模AI推理任务的企业和研究机构,该系统能够显著提升生产力并降低运营成本。

开发者建议

  • 硬件选择:对于需要高性能AI推理的应用场景,Vera Rubin NVL72是一个值得考虑的选择。
  • 软件优化:开发者可以利用NVIDIA提供的软件工具,如NVIDIA Dynamo和TensorRT-LLM,进一步优化模型性能。
  • 持续关注:NVIDIA的持续软件优化意味着未来可能会有更多性能提升,建议开发者定期关注相关更新。

消息来源:NVIDIA AI News (2026-09-16)

—— 完 ——

主题标签: #NVIDIA #AI推理 #MLPerf #Vera Rubin NVL72 #硬件加速

社区整体评论区

正在加载实时智能评论与划词标注…