← 最新论文
💻 computer science

Can LLMs Solve Science or Just Write Code? Evaluating Quantum Solver Generation

本文介绍了 Q-SAGE,这是一种迭代评估方法,表明虽然大语言模型可以通过优化生成成功率更高的量子求解器,但它们仍难以实现数值精度并产生显著的计算开销,从而揭示了当前在完全自动化科学量子软件开发方面的局限性。

原作者: Luciano Baresi, Domenico Bianculli, Maryse Ernzer, Livia Lestingi, Fabrizio Pastore, Seung Yeob Shin

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Luciano Baresi, Domenico Bianculli, Maryse Ernzer, Livia Lestingi, Fabrizio Pastore, Seung Yeob Shin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位才华横溢、速度极快的机器人助手,它非常擅长编写计算机代码。你让它构建一台复杂的机器来解决一道困难的物理谜题。机器人敲出了代码,机器开始运行。它没有崩溃!没有抛出错误信息!看起来完美无缺。

但问题在于:机器在运行,却给出了错误的答案。

这正是米兰理工大学和卢森堡大学的研究人员在论文《大语言模型能解决科学问题,还是仅仅会写代码?》中探讨的核心问题。他们想知道,作为 ChatGPT 等工具背后“人工智能大脑”的大语言模型(LLM),究竟能否编写出真正正确解决科学问题的代码,还是仅仅写出“看起来”正确却在数学测试中失败的代码。

"Q-SAGE"工作坊

为了查明真相,研究人员构建了一个名为Q-SAGE的测试框架。你可以将 Q-SAGE 想象为一个严格、迭代式的 AI 代码工作坊:

  1. 任务分配:AI 被赋予一个科学问题(例如,计算电子在微小磁铁中的行为,或分子如何成键)。
  2. 初稿:AI 编写一个 Python 脚本来解决该问题。
  3. 试运行:脚本在计算机上执行。
  4. 现实检验:将结果与“黄金标准”进行对比——这是一个我们已知能给出正确答案的、值得信赖的“老派”经典计算机程序。
  5. 反馈循环:如果 AI 的答案错误(或代码崩溃),工作坊不会只说“失败”。它会告诉 AI为什么失败(例如,“你犯了数学错误”或“代码崩溃了”)。随后,AI 重写代码并再次尝试。

研究人员用五种不同类型的科学问题(涵盖从量子物理到化学)和五种不同的 AI 模型(有些是开源的,有些来自大型科技公司)运行了这个工作坊。

他们的发现

1. “初稿”问题
当要求 AI 只编写一次代码(无反馈)时,它经常失败。这就像要求学生在不进行任何学习或练习的情况下参加期末考试。许多脚本立即崩溃,或者使用了错误的工具(就像用锤子去拧灯泡)。

2. “尝试、失败、修正”的魔力
当研究人员让 AI 进行迭代——让它看到自己的错误并再次尝试时,成功率急剧上升。

  • 类比:想象一位厨师尝试烤蛋糕。第一次,他忘了放鸡蛋。评委说:“没有鸡蛋。”厨师再次尝试,加了鸡蛋,但把蛋糕烤焦了。评委说:“降低温度。”到了第三或第四次尝试,厨师终于烤出了一个完美的蛋糕。
  • 结果:对于较简单的问题,AI 在大约 5 次尝试内就能非常擅长修正自己的错误。

3. “沉默杀手”:错误的数学
这是最重要的发现:随着 AI 模型变得更聪明,错误的类型发生了变化。

  • 笨拙的 AI:制造“语法”错误。代码甚至无法运行。这就像一辆车因为钥匙插错了点火孔而无法启动。
  • 聪明的 AI:代码完美运行!但数字是错的。这就像一辆车行驶平稳,却因 GPS 略有偏差而拐错了弯。
  • 教训:即使是最先进的 AI 模型,在数值准确性方面也存在困难。它们可以编写出看起来像量子物理解决方案的代码,但内部的数学计算略有偏差,导致结果在科学上毫无用处。

4. 完美的代价
让 AI 修正错误需要时间。

  • 类比:如果你让人写一份报告,需要一小时。如果你让他写一份报告,获得反馈,重写,再次获得反馈,并如此重复五次,可能需要五小时。
  • 结果:研究人员发现,虽然迭代反馈有效,但它伴随着巨大的“时间税”。获得正确答案往往比只运行一次代码花费更长的时间。对于非常复杂的问题,AI 有时会陷入不断尝试和失败的循环,消耗大量的计算机时间。

结论

该论文得出结论:虽然 AI 在编写代码方面越来越擅长,但它尚未成为可靠的科学家

  • 它能写代码吗? 是的,尤其是如果你让它修正自己的错误。
  • 它能解决科学问题吗? 不能可靠地独立解决。它经常生成能运行但给出错误数字的代码。

研究人员建议,目前,AI 是一位出色的“起草者”,能帮你完成 80% 的工作,但仍需要人类专家(或非常严格的验证系统)来检查最终的数学计算。你不能仅仅信任 AI 去做科学工作;你必须验证结果,因为一个正在运行的程序并不总是意味着答案正确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →