← 最新论文
🤖 AI

Prior Knowledge or Search? A Study of LLM Agents in Hardware-Aware Code Optimization

本研究证明,硬件感知代码优化中的大语言模型智能体主要依赖预训练先验,而非迭代反馈或智能体结构,这体现在其在黑盒设置中的贪婪行为、无法适应未见过的核尺寸,以及在低密度中间表示下运行时性能下降等方面。

原作者: Dmitry Redko (Applied AI Institute), Albert Fazlyev (AI Talent Hub, ITMO University), Konstantin Sozykin (Applied AI Institute), Maria Ivanova (YSDA, Applied AI Institute), Evgeny Burnaev (Applied AI
发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Dmitry Redko (Applied AI Institute), Albert Fazlyev (AI Talent Hub, ITMO University), Konstantin Sozykin (Applied AI Institute), Maria Ivanova (YSDA, Applied AI Institute), Evgeny Burnaev (Applied AI Institute), Egor Shvetsov (Applied AI Institute)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《先验知识还是搜索?硬件感知代码优化中的大语言模型代理研究》的通俗化解读,辅以类比说明。

宏观图景:“智能”厨师 vs. “搜索”厨师

想象你正在寻找一份完美的蛋糕食谱。你有两位不同的厨师为你工作:

  1. 厨师 A(黑盒优化器): 这位厨师从未烤过蛋糕。他有一个笔记本,记录每一次尝试,品尝结果,并利用数学方法精确决定下一步如何调整食谱。他纯粹依靠逻辑和适应性。
  2. 厨师 B(大语言模型代理): 这位厨师是享誉世界的专家,读过数百万本食谱。他无需笔记本就知道如何烤蛋糕。然而,在与你交谈时,他并不会“学习”新事物;他只是回忆书中读到的内容,并试图将你的当前请求融入这些记忆之中。

这篇论文提出了一个简单的问题:在解决难题时,是更依赖厨师庞大的记忆(先验知识),还是更依赖其基于反馈进行搜索和适应的能力(搜索)?

研究人员通过让这两位厨师编写计算机代码(具体而言,是让图形处理器运行更快的代码)来测试这一点。以下是他们的发现。


发现一:“贪婪”的厨师

实验: 他们让厨师们在雾蒙蒙的山谷中寻找最低点(这是一个经典的数学问题)。
结果: 大语言模型厨师(厨师 B)表现得像一个贪婪的徒步者。一旦找到一个感觉比起点稍低的地方,他们就会停止四处张望。他们只是从那个点开始小心翼翼地向下走,坚信那就是谷底。他们很少偏离去探索山谷的其他部分。
类比: 想象你在黑暗的房间里寻找一把丢失的钥匙。一个智能搜索算法会系统地扫遍整个房间。然而,大语言模型厨师找到一处“可能”是钥匙的地方后,就会在那个特定位置戳弄几个小时,而忽略了房间的其他部分。
结论: 大语言模型极不擅长探索新领域。它们擅长 refinement(精炼)已知内容,但很容易陷入僵局。

发现二:“一刀切”的帽子

实验: 他们让厨师们为不同大小的数据编写代码(例如,一张小照片与巨大的 4K 视频)。他们明确告诉厨师:“这是给小照片用的!”
结果: 大语言模型厨师忽略了尺寸指令。他们为小照片编写的代码与为巨大视频编写的代码完全相同。仿佛“把它做小”这条指令对他们来说是不可见的。
类比: 想象一位裁缝制作过数百万套西装。你请他为一位 5 岁的孩子做一套西装。尽管你告诉他“这是给孩子的”,裁缝还是拿出了标准的成人版型,照样做了一套巨大的西装。他太习惯于制作成人西装(他的“先验知识”),以至于即使你要求他做儿童西装,他也无法想象。
结论: 大语言模型的记忆过于强大,以至于压过了你的具体指令。无论实际问题的规模如何,它都会默认采用它最常见到的模式。

发现三:“语言障碍”反馈循环

实验: 他们建立了一个系统:厨师编写代码,计算机进行测试,然后给出反馈,如“程序崩溃了”或“速度太慢”。接着厨师再次尝试。
结果:

  • 场景 A(CUDA - 通用语言): 厨师被要求用 CUDA 编写代码,这是一种他们在训练数据中读过数百万次的语言。随着每一条反馈,厨师的表现越来越好。代码稳步改进。
  • 场景 B(TVM IR - 罕见语言): 厨师被要求用 TVM IR 编写代码,这是一种他们极少见过的语言(如同大海捞针)。随着每一条反馈,厨师的表现实际上变差了。他们越是试图根据反馈去修复,代码就变得越糟糕。
    类比:
  • CUDA: 你正在与母语者交谈。当他们犯错而你纠正时,他们能立即理解并修正。
  • TVM IR: 你正在与一个 barely 懂这门语言的人交谈。当他们犯错而你纠正时,他们会感到困惑,误解你的纠正,并犯下更大的错误。他们对这门语言的“先验知识”不足以理解反馈。
    结论: 只有当 AI 已经很好地掌握了该语言时,反馈才有效。如果 AI 对该主题不熟悉,反馈只会让它感到困惑并使情况恶化。

最终裁决

该论文得出结论:大语言模型并非我们期望中的“搜索引擎”或“问题解决者”。它们是“模式匹配器”。

  • 它们严重依赖已经记忆的内容(它们的“先验”)。
  • 它们不擅长独立探索新领域。
  • 如果反馈涉及它们未曾见过的事物,它们无法从中学习。

解决方案?
如果你希望 AI 优化代码或解决难题,你不能仅仅让它“聊天”并反复尝试。你需要将其包裹在一个强制其探索(如搜索算法)或检索其未见过的具体示例的系统中。你不能依赖 AI 的“代理”能力去自行搞定。

简而言之: AI 是一位博学的图书管理员,能倒背如流图书馆里的每一本书。但如果你让它写一本关于图书馆里没有的主题的书,它只会基于图书馆里确实存在的书编造一个故事,即使你要求它有所不同。当图书馆的答案耗尽时,它需要人类(或搜索工具)来引导它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →