← 最新论文
🤖 machine learning

Evaluating CUDA Tile for AI Workloads on Hopper and Blackwell GPUs

本文通过在 Hopper 和 Blackwell 架构 GPU 上对 CUDA Tile 进行跨架构评估,发现其在 Blackwell 数据中心级显卡上展现出极高的开发效率与部分算子性能优势,但在不同架构间的可移植性及 RTX 系列显卡上的性能表现不及 Triton。

原作者: Divakar Kumar Yadav, Tian Zhao, Deepak Kumar

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Divakar Kumar Yadav, Tian Zhao, Deepak Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇关于如何更高效地给 AI “喂饭”(编写 GPU 核心算法)的研究论文。为了让你听懂,我们把 GPU(显卡) 比作一个超级高效的自动化大厨房,而 AI 任务 就是要处理的海量食材

1. 背景:现在的“大厨”太累了

在目前的 AI 世界里,想要让显卡跑得飞快,必须雇佣顶级的“特级大厨”(程序员)去写极其复杂的“菜谱”(CUDA 代码)。

  • 现状: 这些菜谱非常长,动辄几千行,而且极其难写。最麻烦的是,如果你换了一个新厨房(换了新一代显卡),原来的菜谱可能就没法用了,你得重新写一遍。这不仅累,还费钱。

2. 新角色登场:CUDA Tile (CuTile) —— “智能预制菜系统”

NVIDIA 最近推出了一个叫 CuTile 的新工具。你可以把它想象成一套**“智能预制菜系统”**。

  • 它的逻辑是: 你不需要从洗菜、切菜、控火开始写起,你只需要告诉系统:“我要一份 10x10 的肉块,用高温煎一下,然后装盘。”
  • 优点: 以前要写 100 页的菜谱,现在只要写 2 页 Python 代码就行了。它非常省事,上手极快。

3. 实验结果:它是“神厨”还是“菜鸟”?

研究人员把这个“智能预制菜系统 (CuTile)”和几种传统的做法进行了对比,结果非常戏剧化,就像是在不同的厨房里做菜:

场景 A:在顶级豪华厨房 (B200 显卡) —— “神厨附体”

在 NVIDIA 最顶级的 B200 厨房里,CuTile 表现得简直像个天才。

  • 结果: 在处理一种叫“注意力机制”(AI 的核心思考过程)的任务时,CuTile 做出来的菜比目前世界上最顶尖的手工菜谱(FlashAttention-2)还要快 2.5 倍
  • 结论: 如果你手里有最顶级的设备,用 CuTile 是“降维打击”,又快又省事。

场景 B:在普通专业厨房 (RTX PRO 6000 显卡) —— “水土不服”

奇怪的事情发生了。同样的菜谱,换到一个稍微小一点的专业厨房(RTX 系列),CuTile 突然变笨了,表现甚至只有顶尖手工菜谱的一半。

  • 原因: 这就像是“智能预制菜系统”太依赖高端厨房的特定设备了,如果厨房的灶台稍微有点不一样,它就不知道该怎么调火候了。
  • 结论: 在这种厨房里,还是老老实实请“手工大厨”吧。

场景 C:在通用厨房 (Triton 等其他工具) —— “稳扎稳打”

论文里还提到了一个叫 Triton 的对手。Triton 就像是一个**“经验丰富的老伙计”**,虽然它做菜可能没 CuTile 在顶级厨房里那么惊艳,但它非常稳,无论你换到哪种厨房,它都能保持高水平。


4. 总结:你应该用它吗?(决策指南)

如果你是一个“餐厅老板”(AI 开发者),你可以根据以下情况做决定:

  • 如果你追求极致速度,且家里全是顶级 B200 显卡: 赶紧换 CuTile!它能让你用最少的代码,做出全世界最快的菜。
  • 如果你需要“到处跑”,一会儿用旧显卡,一会儿用新显卡: 别用 CuTile,用 Triton。它虽然没那么“神”,但胜在稳健,不会让你在换厨房时抓瞎。
  • 如果你只是想做最普通的家常菜(标准计算): 继续用现成的工具(cuBLAS)就好,没必要折腾。

一句话总结:
CuTile 是一个**“潜力无限但脾气古怪”**的新工具——在顶级环境下它是“超级天才”,但在普通环境下它还是个“半吊子”。它代表了未来,但还需要时间来磨练它的“厨艺”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →