RealisticTritonBench: A Benchmark for Triton-Kernel Generation in Real-World AI Frameworks
为了解决现有基准测试在评估由大语言模型生成的 Triton 内核方面的局限性,作者引入了 RealisticTritonBench,这是一个源自真实世界框架拉取请求(pull requests)的新型基准测试,它能够实现真实的端到端性能评估,并揭示了当前领先的大语言模型在处理此类任务时仍然存在困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,现代人工智能的数字大脑是一座繁忙的城市。摩天大楼是庞大的神经网络,但真正的魔力发生在连接它们的高速、微型地铁隧道中。这些隧道被称为“GPU 核函数(GPU kernels)”。多年来,建造这些隧道需要一支精通一种名为 CUDA 的晦涩古老语言的精英工程师团队。这种方式缓慢、昂贵且容易出错。后来,一种更简单的语言——Triton 出现了。它就像是给了工程师一套乐高积木,通过简单的说明书,就能拼凑出同样高速的隧道。
最近,科学家们提出了一个重大问题:人工智能(AI)能否学会为我们建造这些乐高隧道?如果一个超级智能的计算机程序(大语言模型)能够自动编写这些隧道的代码,就能为人类节省无数的工作时间。但问题在于:仅仅因为一个隧道在蓝图中看起来可行,并不意味着当整个城市都在运行时它不会坍塌。为了弄清楚 AI 是否真的准备好成为一名“隧道建筑师”,研究人员需要一种更好的测试方法。他们需要的不仅仅是一个检查砖块是否契合的测试,而是一个能测试整个地铁系统是否真的运行得更快、且不会导致城市瘫痪的测试。
这就是名为 RealisticTritonBench 的新研究发挥作用的地方。你可以把它看作是一场针对 AI 工程师的巨大且真实的“路考”。研究人员不再是要求 AI 在安静的房间里搭建单个乐高积木,而是给了它来自真实、繁忙施工现场(流行的 AI 软件框架,如 PyTorch 和 vLLM)的实际工作任务。他们要求 AI 修补损坏的隧道、优化现有隧道的速度,或者从零开始构建全新的隧道,且这一切都要在城市正常运转的同时进行。
研究结果带来了一次现实的警示。研究人员测试了目前最智能的 AI 模型,包括像 GPT-4o 和 Qwen2.5 这样的巨头。他们发现,尽管这些 AI 在编写代码方面变得越来越好,但在构建 GPU 核函数这一混乱的现实工作中仍然显得力不从心。事实上,AI 仅在 18.71% 的案例中成功完成了完整的工作——即通过了所有测试、保持了 AI 大脑的准确性,并真正实现了提速。
更关键的一点是:即使 AI 生成的代码通过了基础的“单元测试”(比如检查单个乐高零件是否契合),它也经常在宏观层面失败。大约有一半的情况下,AI 的代码降低了 AI 大脑的准确性,而且平均而言,新修建的隧道并没有让系统比旧有的隧道运行得更快。在某些情况下,AI 生成的代码看起来是正确的,但实际上会在实际应用中拖慢速度。
这项研究表明,虽然 AI 是编写简单代码的优秀助手,但它仍然缺乏对这些复杂系统如何相互作用的深度直觉理解。这就像是一个学生虽然背下了交通规则,却还没学会如何在暴风雨中的繁忙城市里开车。研究人员构建这个新的基准测试,是为了防止 AI 仅仅是在“投机取巧”,并迫使它证明自己能够处理那些维持我们数字世界平稳运行的、高风险的真实工作。在 AI 能够稳定通过这个现实测试之前,人类专家仍将是手握蓝图的人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。