Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization
本文提出了 Kernel-Smith 框架,通过结合基于稳定评估的进化智能体与面向进化的后训练策略,在 NVIDIA Triton 和 MetaX MACA 等异构 GPU 后端上实现了高性能内核生成,其 235B 模型在 KernelBench 基准测试中超越了 Gemini-3.0-pro 等前沿闭源模型,并成功应用于 SGLang 等生产系统。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 Kernel-Smith 的新系统。为了让你轻松理解,我们可以把高性能 GPU 编程(写“内核”)想象成在极其复杂的迷宫里寻找通往宝藏的最快路径。
1. 核心问题:为什么以前的方法不够好?
想象一下,你有一个超级聪明的 AI 助手(大语言模型),你让它画一张迷宫地图(写代码),希望它能一步到位画出最短路线。
- 以前的做法(一次性生成): 你问 AI:“请给我画一条最快的路。”AI 凭直觉画了一条。但迷宫太复杂,AI 经常画错,或者画了一条虽然通但很慢的路。而且,一旦画错了,AI 很难自己发现并修正,因为它没有“试错”的机制。
- 现实困境: 就像让一个从未跑过马拉松的人直接去跑奥运冠军的配速,光靠“灵光一闪”是不够的,需要大量的练习和反馈。
2. Kernel-Smith 的解决方案:两个核心魔法
Kernel-Smith 并没有试图让 AI 一次性画出完美地图,而是换了一套更聪明的玩法,它由两个核心部分组成:
魔法一:进化的“试错军团” (Evolutionary Agent)
想象你不再只派一个探险家,而是派出了一支探险队(种群)。
- 分工合作: 这支队伍里有 100 个探险家,每个人都在迷宫里尝试不同的路线。
- 优胜劣汰: 每走一步,系统就会像裁判一样,立刻测量谁跑得最快、谁没迷路(编译成功、结果正确)。
- 基因传承: 跑得最快的路线会被保留下来,作为“种子”,让下一轮探险家在此基础上继续优化。
- 关键创新: 以前的系统容易因为“裁判看错了”(比如因为电脑卡顿导致计时不准)而淘汰了好路线。Kernel-Smith 给裁判配了超级精密的秒表,反复测量、剔除干扰,确保只有真正优秀的路线才能留下来。这让“进化”过程非常稳定可靠。
魔法二:聪明的“教练” (Training Recipe)
这是 Kernel-Smith 最厉害的地方。通常,我们训练 AI 是让它模仿“最终答案”。但 Kernel-Smith 发现,过程比结果更重要。
- 传统教练: 给 AI 看一张完美的地图,说:“照着画。”
- Kernel-Smith 教练: 它不看最终结果,而是盯着探险队每一次微小的进步。
- 比如:探险家 A 发现了一条路,比原来快了 10%,但没跑通。
- 探险家 B 在 A 的基础上,修好了 bug,又快了 5%。
- 教练只记录 B 的那一步修改,告诉 AI:“看,就是这一步修改让速度变快了,你要学会这种‘微调’的技巧。”
- 效果: AI 不再是一个只会“瞎蒙”的画家,而变成了一个擅长“局部修补”的大师。它学会了如何在已有的基础上,一步步把代码打磨得更快。
3. 它有多强?(实战成绩)
这个系统不仅在模拟考试中拿了第一,还在真实的“战场”上证明了实力:
- 考试排名 (KernelBench): 在标准的编程测试中,Kernel-Smith 生成的代码比目前世界上最强的商业模型(如 Gemini 3.0, Claude 4.6)都要快,平均速度快了 3.7 倍。特别是在最难的任务中,它依然能保持极高的正确率。
- 跨平台能力: 它不仅能在 NVIDIA 显卡上跑,还能在 MetaX 等其他国产或不同品牌的显卡上跑,就像一套通用的“翻译器”,能把代码适配到不同的硬件上。
- 真实世界应用 (最硬核的部分):
- SGLang & LMDeploy: 这两个是现在大模型推理(让 AI 说话)的核心引擎。Kernel-Smith 自动生成的代码已经被正式合并到了这些开源项目的官方代码库中。这意味着,现在全球成千上万的用户在使用 AI 时,背后都有 Kernel-Smith 优化的代码在加速。
- DeepSeek Engram: 它甚至优化了 DeepSeek 最新的研究项目中的代码,让速度提升了惊人的 14.59 倍!
4. 总结:它到底改变了什么?
如果把大模型开发比作造车:
- 以前: 我们试图让 AI 一次性设计出一辆完美的赛车,但经常设计出无法启动或速度很慢的车。
- 现在 (Kernel-Smith): 我们让 AI 变成一个顶级的赛车改装师。它不一定要从头造车,但它能拿着现有的车,通过无数次的微调、测试、再微调,把引擎的每一个零件都打磨到极致,最终让赛车跑出惊人的速度。
一句话总结:
Kernel-Smith 通过“像生物进化一样不断试错”加上“像金牌教练一样只教关键进步”,成功教会了 AI 写出人类专家都难以企及的超快代码,并且这些代码已经真正用在了我们日常使用的 AI 系统中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。