← 最新论文
⚡ electrical engineering

A Benchmark on LLM-Based Power Flow Computation: Do More Structured Prompts Help?

本文提出了一项基准测试,表明尽管 Gemini 2.5 Pro 在基于大语言模型的 Gauss-Seidel 潮流计算中优于其他模型,但没有任何配置能达到直接数值求解所需的可靠性,且反直觉的是,与简单的叙述性格式相比,更结构化的提示词反而可能降低准确性。

原作者: Tingwei Chen, Kaiyang Huang, Kai Sun

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Tingwei Chen, Kaiyang Huang, Kai Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有三位不同的 AI“学生”(我们称它们为 GeminiClaudeGPT-3.5),你想看看它们能否充当电网的计算器。具体来说,你要求它们解决一个经典的、分步进行的数学问题,称为“潮流计算”(Power Flow),工程师利用它来确保电力在电线网络中安全传输。

研究人员设计了一项受控实验,旨在验证两点:

  1. 这些 AI 学生真的能做数学题吗?
  2. 提问的方式(即“提示词”)会影响它们的表现吗?

以下是他们研究发现的分解,使用了简单的类比:

实验设置:三车道公路

研究人员创建了一个微小的简化电网,仅包含三个通过道路(输电线路)连接的“城市”(母线)。他们生成了 50 种不同的交通场景(随机负载和路况),并要求 AI 精确计算主发电厂(“平衡节点”)需要产生多少电力,以维持系统正常运行。

他们通过 四种不同的提问方式 对 AI 进行了测试:

  1. 故事叙述:一段描述问题的简单段落(如教科书中的问题)。
  2. 故事 + 示例:相同的故事,但在其之前加入了一个教科书中的已解示例。
  3. 检查清单:一个带编号的步骤列表,要求 AI 展示其计算过程。
  4. 电子表格:一种严格的、机器可读的格式(JSON),严格要求展示计算的每一步。

结果:谁通过了,谁失败了?

1. “过度思考者”(Gemini 2.5 Pro)

  • 令人惊讶之处:你可能会认为,给 AI 一个严格的电子表格并要求它展示每一步,会提高其准确性。事实恰恰相反。
  • 类比:想象你让一位聪明的数学学生解题。当你只说“这是问题,给我答案”时,他们答对的概率是 54%。但当你递给他们一份复杂的表格,并说“填满每一个框,逐行展示你的计算过程”时,他们会感到困惑,过度复杂化问题,其错误率翻了三倍
  • 结论:Gemini 是三者中最聪明的,但它对交流方式非常敏感。简单更好;复杂的指令实际上会损害其表现。

2. “稳健的艾迪”(Claude Sonnet 4.5)

  • 行为表现:Claude 不太在意提问的方式。无论是故事、检查清单还是电子表格,无论哪种方式,它答对的概率都保持在 38% 左右
  • 类比:把 Claude 想象成一个有特定学习习惯的学生。改变考试格式既没有帮助,也没有伤害。他们只是停留在同一个“平均”水平上。
  • 结论:添加已解示例(向他们展示已解决的问题)实际上略微帮助了 Claude,但这仍不足以使其成为可靠的计算器。

3. “挣扎的学生”(GPT-3.5 Turbo)

  • 行为表现:无论提问方式如何,该模型几乎每次都失败了。
  • 类比:想象让一个尚未学习过该材料的学生去解微积分题。无论你给他们提示、教科书还是计算器,他们答错的概率仍然高达 90% 到 96%
  • 结论:目前,它根本无法胜任这种特定类型的复杂多步数学计算。

核心启示:“更多指令” ≠ “更好结果”

这篇论文最重要的发现是对任何试图将 AI 用于数学或工程领域的人发出的警告:给 AI 提供更详细的指令、结构化数据,或要求它“展示计算过程”,并不能保证更高的准确性。

事实上,对于测试中最聪明的模型而言,使提示词变得更复杂反而使其表现变差。这就像告诉 GPS“使用特定算法重新计算路线”,而它只需要说“开车去那里”即可。额外的规则混淆了系统。

最终结论:尚未准备好承担重任

研究人员得出结论,没有任何这些 AI 模型准备好取代真正的工程计算器。

  • 即使是最好的结果(使用简单提示的 Gemini),也仅在约一半的情况下将答案控制在 5% 的误差范围内。
  • 在现实世界中,如果你正在管理电网,5% 的误差可能意味着停电或火灾。你需要 100% 的精确度。

总结:这些 AI 模型非常适合解释“什么是潮流计算”或帮助工程师构思想法,但它们尚未准备好成为实际运行电网的计算器。如果你让它们做数学题,你仍然需要人类(或传统计算机程序)来复核数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →