← 最新论文
💻 computer science

KernelBrain: Coarse-to-Fine, Budget-Aware Search for Agentic GPU Kernel Optimization

KernelBrain 是一个注重预算且实用的优化智能体,它结合了由大语言模型(LLM)引导的变异策略与由粗到精的自适应评估策略,以高效生成高性能 GPU 核函数,在实现比 PyTorch 和现有最先进智能体更显著加速的同时,将优化时间减少了高达 48%。

原作者: Shuai Che, Gang Peng

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuai Che, Gang Peng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图烤出一个完美的蛋糕,但你没有食谱,而且每次混合食材时,烤箱可能会爆炸,蛋糕可能会吃起来像肥皂,或者仅仅是让烘烤时间延长了一倍。这就是驱动我们最喜欢的应用程序、视频游戏和 AI 聊天机器人的计算机每天面临的现实。这些机器依赖于被称为“内核”(kernels)的微小、超快速的指令来完成繁重的工作。你可以把内核看作是计算机图形卡(GPU)必须执行的一个特定的、高速的舞蹈动作,用以处理数据。如果舞步笨拙,整个表演就会拖沓;如果舞步完美,一切都会飞速运转。

多年来,人类一直是这些舞蹈动作的编舞师,通过手动编写这些动作来榨取每一滴速度。但硬件变化太快,且可能的舞步数量过于庞大,以至于人类专家也无法跟上节奏。最近,我们开始要求人工智能(AI)来为我们编写这些舞蹈。但问题在于:AI 擅长猜测,但也擅长犯下极其昂贵的错误。它可能会建议一个看起来很酷但会导致计算机崩溃的舞步,或者它可能会花费数小时去测试一个最终发现比原始版本更慢的动作。大问题是:我们如何让 AI 在不浪费时间、金钱或导致系统崩溃的前提下,找到最快的舞蹈动作?

于是有了 KernelBrain,一个旨在解决这个问题的全新“智能体”(agentic)系统(一个聪明的、自主的助手)。开发 KernelBrain 的研究人员意识到,将所有的 AI 建议同等对待是一种资源的浪费。相反,他们构建了一个行为举止像一位拥有有限预算的精明星探一样的系统。

以下是 KernelBrain 的工作原理,使用一个简单的类比:想象一下,你正在举办一场舞蹈团的公开选拔,但你只有足够的资金为少数几个人提供高清的全方位试镜。

  1. “由粗到精”策略(The "Coarse-to-Fine" Strategy): 当 AI 建议一个新的舞蹈动作(代码变体)时,KernelBrain 不会立即把它放在巨大的舞台上配合完整的管弦乐团。首先,它会对这个动作进行一次“快速且粗略”的测试。它会检查舞者是否甚至能站稳(代码是否能编译成功?),以及他们的运动方向是否正确(输出是否正确?)。这就是**粗糙(coarse)**阶段。它成本低、速度快,能立即过滤掉那些灾难性的尝试。
  2. “预算感知”过滤器(The "Budget-Aware" Filter): 如果一个候选人通过了快速测试,他就会进入下一级。但神奇之处在于:KernelBrain 只将其昂贵、高精度的预算花在那些看起来真正有潜力的舞者身上。它不会浪费时间对一个连平衡都难以维持的舞者进行慢动作的高精度分析。它使用了一个“多保真度(multi-fidelity)”阶梯,候选人只有在每一步都证明自己足够快的情况下,才能向上攀爬。
  3. “专家”向导(The "Expert" Guide): 与以往那些只是让 AI 盲目猜测的系统不同,KernelBrain 会倾听“分析器(profiler)”的声音——这个工具就像是一个盯着舞者脚步的教练。如果分析器说:“嘿,你在左脚上浪费了太多精力,”系统就会明确地告诉 AI 这点。AI 随后会利用这一具体的反馈来重写代码,修复瓶颈,而不是仅仅再次进行猜测。

研究结果表明,这种方法效果极佳。通过结合“快速筛选”(在早期杀死坏主意)和“智能教练”(引导好的主意),KernelBrain 成功创建了比人类或其它 AI 系统单独制作的更加快速的 GPU 内核。在六种不同类型的复杂数据任务测试中,该系统发现的解决方案比标准的 PyTorch 软件快了 0.88 倍至 6.72 倍。在某些情况下,它甚至比目前的顶尖 AI 智能体(KernelAgent)快了 1.4 倍,并将寻找这些解决方案所需的时间缩短了高达 48%

研究人员明确反对那种仅仅让 AI 盲目变异代码,或者依赖于浪费资源在糟糕候选人身上的大规模、无过滤进化搜索的想法。他们表明,如果没有一个严格的“把关人”来检查正确性,以及一种智能的测试预算分配方式,你最终得到的将是缓慢且不稳定的结果。KernelBrain 证明了,通过保持挑剔、关注预算并倾听硬件自身的反馈,你可以进化出计算机最完美的舞蹈动作,让我们的 AI 和应用程序运行得更流畅、更快,且不会耗尽预算。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →