← 最新论文
💬 NLP

CASS: Nvidia to AMD Transpilation with Data, Models, and Benchmark

该论文介绍了 CASS,这是首个包含 6 万对验证数据的跨架构 GPU 代码(CUDA/HIP、SASS/RDNA3)翻译数据集与模型套件,其训练出的专用模型在翻译准确率和性能保持上显著超越商业基线,并配套发布了开源基准测试工具 CASS-Bench。

原作者: Ahmed Heakl, Gustavo Bertolo Stahl, Sarim Hashmi, Seung Hun Eddie Han, Mukul Ranjan, Arina Kharlamova, Salman Khan, Abdulrahman Mahmoud

发布于 2026-04-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmed Heakl, Gustavo Bertolo Stahl, Sarim Hashmi, Seung Hun Eddie Han, Mukul Ranjan, Arina Kharlamova, Salman Khan, Abdulrahman Mahmoud

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 CASS 的突破性项目,它的核心目标是解决一个让很多科技公司头疼的大问题:如何让 Nvidia 显卡上的程序,在不重写代码的情况下,直接跑到 AMD 显卡上?

为了让你轻松理解,我们可以把这件事想象成**“跨国语言翻译”“方言转换”**的故事。

1. 背景:两个互不相通的“方言区”

想象一下,世界上有两个巨大的计算机王国:

  • Nvidia 王国:使用一种叫 CUDA 的语言(就像英语)。这是目前最流行的,几乎所有 AI 和科学计算都用它。
  • AMD 王国:使用一种叫 HIP 的语言(就像中文)。虽然它很强大,性价比也很高,但 Nvidia 的代码直接拿过来是跑不通的。

问题在于:以前,如果你想把 Nvidia 的程序搬到 AMD 上,就像要把一本用英语写的《哈利波特》直接给只懂中文的人看,他们完全看不懂。你要么请人把整本书重新翻译(重写代码),这非常贵且慢;要么用一些笨拙的工具(像以前的翻译机),经常翻错,导致书里的魔法失效。

2. CASS 是什么?一位“超级翻译官”

CASS 就是为了解决这个问题而诞生的。它包含两样东西:

  1. 一本超级字典(数据集):里面收录了 6 万条“完美对照”的例句。每一条都包含:Nvidia 的原始代码、AMD 的对应代码,以及它们底层最原始的“机器指令”(就像把英语和中文都拆解成了最基础的字母和笔画)。
  2. 一位超级翻译官(AI 模型):这是一个专门训练出来的 AI,它读过那本超级字典,学会了如何精准地把 Nvidia 的“底层指令”翻译成 AMD 的“底层指令”。

它的厉害之处在于:以前的翻译工具只能翻译“表面文章”(源代码),一旦遇到复杂的底层逻辑就抓瞎。而 CASS 不仅能翻译表面,还能翻译**“灵魂”**(汇编代码/机器指令)。

3. 它是如何工作的?(像做实验一样)

作者们没有坐等别人送数据,而是自己建了一个**“全自动翻译工厂”**:

  • 收集:从网上抓取了成千上万个 Nvidia 的程序。
  • 合成:因为网上的好程序不够多,他们让 AI 自己“编造”了各种复杂的数学和图形任务,生成了更多样化的练习素材。
  • 翻译与验证:用工具把 Nvidia 代码转成 AMD 代码,然后编译(尝试运行)。如果两个程序跑出来的结果一模一样,内存占用和速度也差不多,就认为这是一条“合格”的翻译。
  • 训练:把这些合格的“原句 - 译文”对喂给 AI 模型,让它学会其中的规律。

4. 成果如何?(比顶级专家还强)

作者们搞了一个考试(CASS-Bench),让各种翻译工具来答题:

  • 旧工具(如 Hipify):像个只会查字典的初级翻译,准确率大概 87%。遇到复杂的“生僻字”(底层优化指令)就卡壳。
  • 通用大模型(如 GPT-5, Claude):这些是“博学多才”的翻译家,但它们没怎么学过显卡的“底层方言”,所以翻译准确率只有 20% 左右,经常胡编乱造(幻觉)。
  • CASS 模型:这位“专科翻译官”表现惊人!
    • 源代码翻译:准确率 88.2%(比旧工具更好)。
    • 底层指令翻译:准确率 69.1%(这是以前没人做到的,因为太难了)。
    • 最关键的一点:翻译出来的代码,95% 的情况下,运行速度和内存占用跟原版几乎一模一样。这意味着你换显卡后,程序不会变慢,也不会崩溃。

5. 为什么这很重要?(打破垄断的钥匙)

  • 打破“厂商锁定”:以前,如果你用了 Nvidia 的生态,想换 AMD 显卡就得花大价钱重写代码。CASS 让这种转换变得像“换手机壳”一样简单。
  • 降低成本:AMD 显卡通常更便宜。有了 CASS,公司可以用更便宜的硬件跑同样的 AI 模型,省下的钱可以买更多显卡。
  • 开源精神:作者把数据、模型和测试工具全部免费公开了。这就像把“翻译秘籍”公之于众,让全世界的开发者都能来改进它,共同推动硬件的兼容性。

总结

CASS 就像是给显卡世界修了一座**“跨海大桥”。以前,Nvidia 和 AMD 是两个孤岛,代码过不去。现在,CASS 不仅造了桥,还派了一位精通两地“底层方言”的超级向导**,确保你带着货物(代码)过桥后,不仅没丢东西,跑得还一样快。

这对于未来降低 AI 计算成本、促进硬件市场竞争,是一个巨大的进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →