← 最新论文
💬 NLP

Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization

本文提出了 Kernel-Smith 框架,通过结合基于稳定评估的进化智能体与面向进化的后训练策略,在 NVIDIA Triton 和 MetaX MACA 等异构 GPU 后端上实现了高性能内核生成,其 235B 模型在 KernelBench 基准测试中超越了 Gemini-3.0-pro 等前沿闭源模型,并成功应用于 SGLang 等生产系统。

原作者: He Du, Qiming Ge, Jiakai Hu, Aijun Yang, Zheng Cai, Zixian Huang, Sheng Yuan, Qinxiu Cheng, Xinchen Xie, Yicheng Chen, Yining Li, Jiaxing Xie, Huanan Dong, Yaguang Wu, Xiangjun Huang, Jian Yang, Hui W
发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: He Du, Qiming Ge, Jiakai Hu, Aijun Yang, Zheng Cai, Zixian Huang, Sheng Yuan, Qinxiu Cheng, Xinchen Xie, Yicheng Chen, Yining Li, Jiaxing Xie, Huanan Dong, Yaguang Wu, Xiangjun Huang, Jian Yang, Hui Wang, Bowen Zhou, Bowen Li, Qipeng Guo, Kai Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 Kernel-Smith 的新系统。为了让你轻松理解,我们可以把高性能 GPU 编程(写“内核”)想象成在极其复杂的迷宫里寻找通往宝藏的最快路径

1. 核心问题:为什么以前的方法不够好?

想象一下,你有一个超级聪明的 AI 助手(大语言模型),你让它画一张迷宫地图(写代码),希望它能一步到位画出最短路线。

  • 以前的做法(一次性生成): 你问 AI:“请给我画一条最快的路。”AI 凭直觉画了一条。但迷宫太复杂,AI 经常画错,或者画了一条虽然通但很慢的路。而且,一旦画错了,AI 很难自己发现并修正,因为它没有“试错”的机制。
  • 现实困境: 就像让一个从未跑过马拉松的人直接去跑奥运冠军的配速,光靠“灵光一闪”是不够的,需要大量的练习和反馈。

2. Kernel-Smith 的解决方案:两个核心魔法

Kernel-Smith 并没有试图让 AI 一次性画出完美地图,而是换了一套更聪明的玩法,它由两个核心部分组成:

魔法一:进化的“试错军团” (Evolutionary Agent)

想象你不再只派一个探险家,而是派出了一支探险队(种群)。

  • 分工合作: 这支队伍里有 100 个探险家,每个人都在迷宫里尝试不同的路线。
  • 优胜劣汰: 每走一步,系统就会像裁判一样,立刻测量谁跑得最快、谁没迷路(编译成功、结果正确)。
  • 基因传承: 跑得最快的路线会被保留下来,作为“种子”,让下一轮探险家在此基础上继续优化。
  • 关键创新: 以前的系统容易因为“裁判看错了”(比如因为电脑卡顿导致计时不准)而淘汰了好路线。Kernel-Smith 给裁判配了超级精密的秒表,反复测量、剔除干扰,确保只有真正优秀的路线才能留下来。这让“进化”过程非常稳定可靠。

魔法二:聪明的“教练” (Training Recipe)

这是 Kernel-Smith 最厉害的地方。通常,我们训练 AI 是让它模仿“最终答案”。但 Kernel-Smith 发现,过程比结果更重要

  • 传统教练: 给 AI 看一张完美的地图,说:“照着画。”
  • Kernel-Smith 教练: 它不看最终结果,而是盯着探险队每一次微小的进步
    • 比如:探险家 A 发现了一条路,比原来快了 10%,但没跑通。
    • 探险家 B 在 A 的基础上,修好了 bug,又快了 5%。
    • 教练只记录 B 的那一步修改,告诉 AI:“看,就是这一步修改让速度变快了,你要学会这种‘微调’的技巧。”
  • 效果: AI 不再是一个只会“瞎蒙”的画家,而变成了一个擅长“局部修补”的大师。它学会了如何在已有的基础上,一步步把代码打磨得更快。

3. 它有多强?(实战成绩)

这个系统不仅在模拟考试中拿了第一,还在真实的“战场”上证明了实力:

  • 考试排名 (KernelBench): 在标准的编程测试中,Kernel-Smith 生成的代码比目前世界上最强的商业模型(如 Gemini 3.0, Claude 4.6)都要快,平均速度快了 3.7 倍。特别是在最难的任务中,它依然能保持极高的正确率。
  • 跨平台能力: 它不仅能在 NVIDIA 显卡上跑,还能在 MetaX 等其他国产或不同品牌的显卡上跑,就像一套通用的“翻译器”,能把代码适配到不同的硬件上。
  • 真实世界应用 (最硬核的部分):
    • SGLang & LMDeploy: 这两个是现在大模型推理(让 AI 说话)的核心引擎。Kernel-Smith 自动生成的代码已经被正式合并到了这些开源项目的官方代码库中。这意味着,现在全球成千上万的用户在使用 AI 时,背后都有 Kernel-Smith 优化的代码在加速。
    • DeepSeek Engram: 它甚至优化了 DeepSeek 最新的研究项目中的代码,让速度提升了惊人的 14.59 倍

4. 总结:它到底改变了什么?

如果把大模型开发比作造车

  • 以前: 我们试图让 AI 一次性设计出一辆完美的赛车,但经常设计出无法启动或速度很慢的车。
  • 现在 (Kernel-Smith): 我们让 AI 变成一个顶级的赛车改装师。它不一定要从头造车,但它能拿着现有的车,通过无数次的微调、测试、再微调,把引擎的每一个零件都打磨到极致,最终让赛车跑出惊人的速度。

一句话总结:
Kernel-Smith 通过“像生物进化一样不断试错”加上“像金牌教练一样只教关键进步”,成功教会了 AI 写出人类专家都难以企及的超快代码,并且这些代码已经真正用在了我们日常使用的 AI 系统中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →