← 最新论文
💻 computer science

Can LLMs Perform Synthesis?

该研究在多个程序合成领域对比了符号工具与大型语言模型(Qwen 和 GPT-5),发现符号工具在解决基准测试的数量和执行效率上均优于或持平于大模型,即使后者运行在更强大的硬件上。

原作者: Derek Egolf, Yuhao Zhou, Stavros Tripakis

发布于 2026-03-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Derek Egolf, Yuhao Zhou, Stavros Tripakis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一场**“传统工匠”与“超级天才”之间的编程大比武**。

为了让你轻松理解,我们可以把程序合成(Program Synthesis)想象成“根据一张极其严格的建筑图纸,自动盖出一栋完全符合要求的房子”

  • 图纸:就是形式化规范(比如 LTL、SyGuS 等),规定了房子必须有什么结构、不能有什么缺陷。
  • 目标:自动盖出这栋房子,而且保证绝对安全、不出错。

论文比较了两种“盖房者”:

  1. 传统工匠(符号工具):比如 ltlsyntcvc5。他们像老练的工程师,手里拿着计算尺和精密仪器,一步步逻辑推演,虽然慢,但保证每一步都严丝合缝,绝不犯错。
  2. 超级天才(大语言模型 LLM):比如 Qwen(开源)和 GPT-5(闭源)。他们像是有着过目不忘记忆力的天才建筑师,看一眼图纸就能凭直觉“猜”出房子该怎么盖,速度极快,但偶尔会“脑洞大开”盖出个不符合图纸的奇怪结构。

🏆 比赛项目(四个领域)

作者找了四个不同的“盖房”场景来测试:

  1. LTL 反应式合成:盖一个能实时响应外界变化的“智能交通灯系统”。
  2. 语法引导合成 (SyGuS):在规定的“积木块”范围内,拼出一个符合要求的程序。
  3. 分布式协议合成:设计一个让多个“机器人”协同工作的通信协议(比如 TLA+)。
  4. 递归程序合成:写一个能处理复杂数据(如树、列表)的“万能函数”。

⚔️ 比赛规则与过程

为了公平(虽然很难完全公平),作者设定了这样的规则:

  • 传统工匠:给他们 10 分钟,让他们用精密仪器慢慢算。
  • 超级天才
    • GPT-5:只给一次机会,10 分钟内必须交出图纸。
    • Qwen:给它一个“试错循环”。如果它第一次盖错了,验证器(就像质检员)会告诉它“错了”,然后让它再试一次。它可以一直试,直到 10 分钟用完或者盖对为止。
    • 关键点:作者没有教这些 AI 怎么改错(没有告诉它“这里错了,因为..."),只是让它不断重试。这就像让一个天才闭着眼睛蒙题,蒙对了就算赢。

📊 比赛结果:谁赢了?

1. 谁盖出的房子更多?(解决率)

  • 传统工匠(符号工具):在大多数情况下,完胜。特别是在“智能交通灯”(LTL)这种逻辑极其严密的领域,传统工匠几乎把能盖的都盖好了。
  • GPT-5(超级天才):表现非常接近传统工匠,甚至在某些很难的“积木拼图”(SyGuS)和“机器人协同”(TLA+)任务中,反杀了传统工匠,盖出了传统工匠盖不出来的房子。
  • Qwen(开源天才):表现稍弱,盖出的房子数量比传统工匠少,也比 GPT-5 少。

比喻

传统工匠像是一个严谨的数学家,只要时间够,他能把所有逻辑题都解出来。
GPT-5 像是一个直觉敏锐的艺术家,虽然偶尔会算错,但在某些需要灵感的复杂结构上,它能画出数学家想不到的完美设计。
Qwen 则像是一个很有潜力的学生,虽然努力试错,但有时候会重复犯同样的错误。

2. 谁盖得更快?(效率)

  • 传统工匠快得惊人。它们通常几秒钟就能算出答案。
  • GPT-5:比传统工匠慢很多(慢几十倍甚至上百倍)。因为它要“思考”(生成推理 token),而且运行在昂贵的云端服务器上。
  • Qwen:虽然它用了更强大的显卡(H200),但因为需要反复试错(Iterate),总耗时往往比传统工匠长,或者差不多。

比喻

传统工匠是高铁,虽然要进站安检(计算),但一旦开动,速度极快且准时。
LLM 是直升机,虽然能直接飞越障碍,但起飞、盘旋、寻找降落点(生成和验证)非常耗时,而且油耗(算力成本)极高。

3. 谁更听话?(格式与语法)

  • 传统工匠:绝对听话。它生成的代码永远符合语法,永远不会少个括号。
  • GPT-5:大部分时候很听话,能写出符合语法的代码。
  • Qwen:经常“不听话”。它经常写出语法错误的代码(比如括号没闭合、变量名写错),导致质检员直接把它扔进垃圾桶,浪费了大量时间。

比喻

传统工匠是机器人,指令是什么就做什么,绝不越雷池一步。
LLM 是人类,虽然聪明,但偶尔会写错别字,或者把“左”写成“右”,需要反复检查。


💡 核心结论与启示

  1. 没有绝对的赢家

    • 如果你需要绝对可靠、快速的解决方案,传统符号工具依然是首选。
    • 如果你遇到传统工具搞不定的死胡同GPT-5 可能会给你惊喜,帮你找到新的解法。
  2. “组合拳”才是王道
    论文建议,未来的最佳方案不是二选一,而是**“双管齐下”**。就像盖房子,既要有严谨的工程师做结构计算,也要有天才设计师提供灵感。让两者并行工作,谁先盖好就用谁的。

  3. AI 的“幻觉”问题
    LLM 最大的问题是重复犯错。在测试中,Qwen 经常反复生成同一个错误的代码,因为它不知道“刚才那个错了,换个思路”。而传统工具会保证不重复尝试已经失败的路径。

  4. 成本考量
    用 GPT-5 跑完所有测试,虽然只花了不到 50 美元,但如果是大规模工业应用,这个成本可能太高。而传统工具在普通电脑上就能跑,成本几乎为零。

🎯 一句话总结

大语言模型(LLM)已经具备了很强的“程序合成”能力,甚至在某些领域能超越传统工具,但它们目前还像是一个“天才但粗心、昂贵且偶尔犯迷糊”的助手。在追求“正确且高效”的工业级应用中,它们目前还无法完全取代严谨的“传统工匠”,最好的办法是让两者合作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →