← 最新论文
🤖 machine learning

Toward Compiler World Models: Learning Latent Dynamics for Efficient Tensor Program Search

本文提出了一种受世界模型启发的评估器,该评估器通过学习调度动作的潜在动力学特征来高效地对张量程序候选方案进行排序,在显著提升延迟性能的同时,大幅减少了所需的测量次数,优于 Ansor 等现有自动调度器。

原作者: Haolin Pan, Lianghong Huang, Xvlin Zhou, Mingjie Xing, Yanjun Wu

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Haolin Pan, Lianghong Huang, Xvlin Zhou, Mingjie Xing, Yanjun Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图寻找一条从家到朋友家最快的驾驶路线。你有一张地图,但交通状况时刻在变,而且你可能可以走的路线有数百万条。

在计算机科学领域,特别是针对机器学习时,这正是“编译器”所做的事情。它试图为计算机执行复杂的数学任务(称为“张量程序”)找到最高效的方法。问题在于,编写代码的可能方式太多了,如果通过在计算机上实际运行每一种方式来检查,速度会极其缓慢且成本高昂。这就像是为了看哪条路最快而尝试开遍每一条可能的路线一样;你会还没找到最好的路就耗尽汽油了。

旧方法:拍摄“快照”

以前,尝试解决此类问题的计算机程序(被称为“自动调度器”)就像是一个拍摄最终目的地快照的摄影师。它们会观察生成的代码,猜测其运行速度,然后决定它是否足够好。

论文指出这并非良策,因为:

  1. 它忽略了过程: 它不理解代码是如何生成的。两条不同的路线可能会到达同一个终点,但其中一条可能是平坦的高速公路,而另一条可能是颠簸的土路。快照看起来是一样的,但体验(和速度)却截然不同。
  2. 它会被微小的细节迷惑: 如果你修改了代码中一些实际上并不改变其功能的词汇,旧系统可能会认为这是一条完全不同且更差的路线。

新想法:“世界模型”(GPS 模拟器)

作者提出了一种受世界模型(World Models)启发的全新方法。请记住,这不仅仅是一个摄影师,而是一个高科技 GPS 模拟器

它不只是观察最终目的地,而是会在它的“大脑”里(一个被称为“潜空间”的数学空间)逐步模拟整个旅程。

以下是使用烹饪类比的工作原理:

  • 食材(初始状态): 你从一个原始食谱开始(未优化的代码)。
  • 厨师的动作(行动): 编译器做出决策,比如“切洋葱”、“翻炒 5 分钟”或“加盐”。
  • 旧方法: 厨师观察最终的菜肴并猜测:“嗯,味道还可以。”
  • 新方法(世界模型): 厨师拥有心理模拟能力。他会想象:“如果我先切洋葱再翻炒,口感会是 X;如果我先翻炒再切,口感会是 Y。”他在脑海中模拟烹饪的过程,从而在实际动手做饭之前,就能预测出最终的味道。

他们是如何构建它的

研究人员构建了一个包含三个部分的系统:

  1. 翻译器(编码器): 它将杂乱的计算机代码转化为一种干净的、计算机可以轻松理解的数学“思想”(向量)。
  2. 模拟器(转换模型): 这是核心创新。它获取当前代码的“思想”,并逐一应用“厨师的动作”(调度动作)。它会在计算机内存中预测代码在每一步之后的样子,而无需实际运行代码。
  3. 裁判(排序模型): 模拟完成后,裁判会观察预测的最终结果,并判断:“这条路线可能最快,”或者“那条看起来很慢。”

实验结果

他们针对两种类型的计算机进行了测试:一款强大的 CPU(Intel Xeon)和一款高端显卡(NVIDIA RTX 4090)。

  • 更快的产出: 他们发现,相比于之前的最佳方法(称为 Ansor),他们能更快地找到更好的代码调度方案。
  • 更少的工作量: 他们实现了与旧方法同样出色的效果,但实际进行的“试驾”(测量)次数减少了 10 倍
  • 现实世界速度: 当他们使用此技术运行实际的 AI 模型(如图像识别或语言模型)时,程序的运行速度比标准版本快了 4 到 5 倍,在某些情况下甚至快了高达 58 倍

核心结论

该论文声称,通过教会计算机理解优化过程(旅程)而非仅仅是结果(快照),我们可以更高效地找到最快的代码。这就像拥有一个能在脑海中模拟交通状况的 GPS,从而找到最佳路线,而不是仅仅根据一张照片来猜测。

论文中提到的局限性:

  • 该系统是一个帮助挑选最佳路线的“裁判”;它本身并不发明路线。如果搜索引擎最初没有提出任何好的路线,裁判也无法修复它。
  • 如果“旅程”极其漫长且复杂,计算机大脑中的模拟可能会产生累积的小误差,从而降低预测的准确性。
  • 它的设计目的是为了对选项进行排序(哪个更快?),而不是精确预测到毫秒级的运行时间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →