← 最新论文
🤖 machine learning

Beyond Scaling: Self-Evolving LLM Agents for Hardware Kernel Optimization via an Experience-Driven Workflow and Experience Graph Memory

该论文介绍了 KOPE,这是一个经验驱动的框架,它利用经验图记忆(Experience Graph Memory)和主动上下文管理(Active Context Management)使 LLM 智能体能够从过去的硬件内核优化轨迹中学习,在无需更新底层基础模型的情况下,实现了相对于现有基准方案在性能和 Token 效率上的显著提升。

原作者: Siyuan Chen, Runlin Hou, Shenxiu Wu, Yansong Sun, Junming Cao, Yiyu Zhang, Shudi Shao, Junhao Qiu, Zhichao Lu, Qingfu Zhang

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Siyuan Chen, Runlin Hou, Shenxiu Wu, Yansong Sun, Junming Cao, Yiyu Zhang, Shudi Shao, Junhao Qiu, Zhichao Lu, Qingfu Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

优化计算机芯片的运行速度,往往感觉就像是在赛车引擎仍在运转时对其进行调校。这个过程涉及编写一段被称为“内核”(kernel)的微小代码,它告诉硬件如何精确地处理数据。这段代码必须经过编译、经过正确性测试,然后进行测量以观察其运行速度。如果结果不完美,代码就必须重写,循环也随之开始。几十年来,这一直是高度专业的人类专家所从事的工作,他们理解每一个新芯片设计的特定特性。最近,人工智能系统已开始协助这项工作,利用强大的语言模型来建议代码更改。然而,这些系统通常将每一次尝试视为一个全新的开始。它们不会记住之前哪些尝试成功或失败了,也无法轻易地从它们试图优化的特定硬件中学习,尤其是当该硬件是全新的且缺乏大量现有示例库时。

一组研究人员开发出一种新方法,允许人工智能代理从自身的探索中学习,将每一次试错都转化为永久性的教训。他们创建了一个名为 KOPE 的系统,这是一个旨在通过构建自身经验记忆来优化这些硬件内核的框架。KOPE 不仅仅依赖于存储在 AI 模型内部的既有知识,它还会记录自己做出的每一个决策、该决策的结果以及实现该决策所经过的路径。它将这些信息存储在一个结构化的地图中,将特定的选择与其结果联系起来,就像旅行者记录详细的旅程日志一样,记下哪些路径导致了死胡同,而哪些路径开启了新的大门。当系统面临新问题时,它不会从零开始。相反,它会查阅这张地图,寻找与当前情况相匹配的相关过往经验,并在做出新的建议之前,将这些特定的知识注入到其思考过程中。

研究人员在一组用于现代计算的五十三个不同数学运算上测试了该系统,并在华为的一种特定类型的硬件芯片上运行。他们将这种新方法与两种其他方法进行了比较:一种是使用没有这种特殊记忆系统的标准 AI 代理,另一种是使用为另一种类型计算机芯片设计的强大 AI。结果显示,带有经验记忆的系统明显更为成功。它能够为几乎所有的运算生成可运行的代码,而标准代理则在许多运算上失败了。更重要的是,这个从自身历史中学习的系统所生成的代码,平均比表现最好的竞争方法快了 1.54 倍。尽管底层 AI 模型本身并未改变,但由于系统通过记住所学知识,其性能得到了提升。

成功的关键部分在于系统如何管理其记忆。研究人员发现,如果只是将所有过去的经验一次性倾倒进 AI 的大脑中,会产生适得其反的效果,因为这会使系统因信息过载而难以应对。相反,他们构建了一种机制,能够主动选择与当前特定任务最相关的过往教训。这种选择性的方法使系统能够解决更多问题,将其成功率从百分之六十提高到了接近百分之八十五,同时使用了更少的计算资源。研究还探讨了在一种硬件上获得的知识是否能帮助优化另一种完全不同的硬件。他们发现,虽然来自原始硬件的经验有助于系统在新硬件上找到更多可行的解决方案,但并不会自动让代码变得更快。系统仍然需要通过自身的尝试来学习新硬件的具体细节,以达到最佳性能。

研究结果表明,对于新出现的或缺乏大量现有示例的硬件,保留并复用特定经验的能力比单纯拥有一个更大或更聪明的 AI 模型更有价值。通过保持一份关于成功与失败的固定记录,并仔细选择将哪些教训应用于新问题,系统可以不断提升其优化技能。这种方法并不要求对 AI 进行重新训练或改变其内部大脑;它只需要一种更好的方式来记住并应用所学知识。研究人员证明,这种方法可以应用于不同类型的计算机芯片和编程语言,展示了该工作流的适应性。虽然该系统并未完美解决每一个问题,但它证明了 AI 代理可以通过“行动、观察与记忆”的循环来进化自身的专业能力,将混乱的试错过程转变为通往更快、更高效计算的可靠路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →