智客 ZICQ
EN 登录 / 注册
智客前沿 算力架构 #Together AI #ThunderKittens #NVIDIA Vera Rubin NVL72 #高性能计算 #AI模型优化

Together AI将ThunderKittens移植至NVIDIA Vera Rubin NVL72,性能提升至22 PFLOPS

Mr.Xu 的头像

文 / Mr.Xu

发布时间: · 16 次阅读

中文阅读 (Chinese) English Version

摘要:Together AI宣布将ThunderKittens项目成功移植到NVIDIA最新发布的Vera Rubin NVL72超级计算平台上,并围绕新硬件重新构建了NVFP4 GEMM(通用矩阵乘法)模块,使其性能从42%的屋顶线提升至超过22 PFLOPS。这一性能水平已与NVIDIA的cuBLAS和CuTe DSL等主流高性能计算库相媲美。ThunderKittens的移植展示了AI模型与硬件架构的深度协同优化,为高性能计算和AI应用提供了新的可能性。


核心突破

Together AI宣布将ThunderKittens项目成功移植到NVIDIA最新发布的Vera Rubin NVL72超级计算平台上。这一移植工作主要围绕新硬件对NVFP4 GEMM(通用矩阵乘法)模块进行了全面优化和重构,使其性能从42%的屋顶线提升至超过22 PFLOPS。这一性能水平已与NVIDIA的cuBLAS和CuTe DSL等主流高性能计算库相媲美。

技术亮点

  • 硬件适配与优化:ThunderKittens的移植涉及对NVIDIA Vera Rubin NVL72硬件架构的深度适配,包括对ISA(指令集架构)的调整和优化。
  • 性能提升:通过优化NVFP4 GEMM模块,ThunderKittens的性能实现了从42%到超过22 PFLOPS的飞跃,展示了AI模型与硬件的深度协同优化。
  • 与主流库媲美:优化后的ThunderKittens性能已与NVIDIA的cuBLAS和CuTe DSL等主流高性能计算库相媲美,证明了其在高性能计算领域的竞争力。

行业影响

ThunderKittens的成功移植展示了AI模型与硬件架构的深度协同优化,为高性能计算和AI应用提供了新的可能性。这一成果不仅对AI研究具有重要意义,也为AI模型的硬件适配和性能优化提供了宝贵的经验。

开发者建议

  • 关注硬件适配:AI开发者应关注硬件架构的最新发展,并积极探索AI模型与硬件的协同优化策略。
  • 利用高性能计算资源:对于需要高性能计算的应用场景,开发者可以考虑利用NVIDIA Vera Rubin NVL72等超级计算平台,以提升AI模型的性能。

结论

Together AI的ThunderKittens项目在NVIDIA Vera Rubin NVL72上的成功移植,标志着AI模型与硬件协同优化的重要进展,为AI研究和高性能计算领域带来了新的机遇。


消息来源:Together AI Blog (2026-09-10)

—— 完 ——

主题标签: #Together AI #ThunderKittens #NVIDIA Vera Rubin NVL72 #高性能计算 #AI模型优化

社区整体评论区

正在加载实时智能评论与划词标注…