← 最新论文
⚡ electrical engineering

VeraGrid-Agent: Tool-Augmented LLMs for Distribution Optimal Power Flow at the Grid Edge

该论文介绍了 VeraGrid-Agent,这是一种工具增强型大语言模型,通过自主执行 VeraGrid 求解器,在最优潮流问题上实现了接近完美的准确率(97.3%–100.0%),显著优于仅依赖语言推理的模型(其得分低于 50%)。

原作者: Shivanshu Tripathi, Hamed Mohsenian-Rad, Maziar Raissi

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Shivanshu Tripathi, Hamed Mohsenian-Rad, Maziar Raissi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:VeraGrid-Agent

问题陈述

大语言模型(LLMs)在代码生成和推理方面展现了显著的能力,促使研究人员将其应用于电力系统等科学与工程领域。然而,回答有关配电网最优潮流(D-OPF)的复杂问题提出了独特的挑战。这些问题通常需要解决涉及交流功率流方程、分布式能源(DERs)和电网约束的非凸、NP-hard 数值问题。

当 LLMs 仅尝试利用参数化知识(记忆)来回答此类问题时,它们被迫进行猜测,往往产生数值错误的输出。本文认为,对于需要精确数值模拟的任务(例如确定 PV 节点的电压上升、母线容量、DER 弃载或馈线损耗),仅凭语言推理是不够的。核心问题在于如何区分科学推理中的真实计算与记忆或幻觉。

方法论

为了解决这一问题,作者提出了 VeraGrid-Agent,这是一个旨在自主解决 D-OPF 问题的工具增强型 LLM 框架。该方法涉及一个闭环工作流,其中 LLM 作为外部求解器的控制器而非依赖其内部知识。

1. 智能体工作流

该智能体在一个隔离的工作空间内运行,并遵循 ReAct(推理 + 行动)框架。对于每个查询,智能体执行以下操作:

  • 编写输入: 根据问题描述生成一个 JSON 输入文件,描述馈线图、母线、支路、负载和 DER 配置。
  • 执行求解器: 调用开源 VeraGrid 模拟器,该模拟器对 AC-OPF 问题进行数值求解。
  • 读取输出: 求解器返回执行元数据和目录,而非完整的解,以保持上下文窗口紧凑。随后,智能体进行针对性的特定行读取(例如,特定的线路潮流或母线电压)。
  • 选择答案: 解释检索到的数值数据,从而从多项选择题(MCQ)中选择正确选项。

系统被限制在最大迭代次数(TmaxT_{max})内,以防止陷入死循环,尽管大多数查询在几步之内即可解决。

2. 基准测试:VeraGrid-MCQ-150

为了评估性能,作者引入了 VeraGrid-MCQ-150,这是一个由确定性模板驱动的基准测试,包含 150 个多项选择题。

  • 生成: 问题由专家定义的模板生成,其中标准答案直接由 VeraGrid 模拟器计算得出。这确保了每个答案都是特定已求解网络记录的确定性函数。
  • 难度等级:
    • 简单(50 题): 直接检索(例如,节点电压幅值、元件数量)。
    • 中等(50 题): 单步推导(例如,标幺值转换、线路阻抗幅值、功率因数)。
    • 困难(50 题): 多步计算和跨表推理(例如,聚合支路损耗、净备用功率、热极限)。
  • 评估指标: 准确率通过预测标签 (^\hat{\ell}) 相对于标准答案 (\ell^*) 的正确百分比来衡量,将格式错误或缺失的响应视为错误。

核心贡献

本文做出了三个主要贡献:

  1. 工具增强架构: 一种新型的 D-OPF 分析框架,其中 LLM 编写模拟器输入、执行 VeraGrid 求解器并读取相关结果,确保每个答案都可追溯至求解器输出。
  2. 确定性基准: 引入了具有验证标准答案的 VeraGrid-MCQ-150 可复现测试平台,用于评估智能体从已求解网络中检索定量信息的能力,防止其依赖静态记忆。
  3. 实证研究: 在两种机制下(“无工具”——仅根据描述进行推理;以及“智能体”——工具增强型)对七种不同的 LLM 进行了全面评估。研究分析了性能增益和失效模式。

结果

作者在 8 节点放射状馈线测试案例上评估了七种模型(包括 GPT-5.2、Claude Sonnet 4.5、Gemini 3 Flash、Grok 4.3/4.5、Composer 2.5 和 Opus 4.8)。

  • 无工具机制: 在没有访问求解器的情况下,所有模型的表现都很差,总体准确率在 41.3% 到 49.3% 之间。这证实了参数化知识不足以应对这些数值任务。
  • 工具增强机制: 通过使用 VeraGrid-Agent,所有模型的准确率都大幅提升,范围在 97.3% 到 100.0% 之间。
    • Gemini 3 Flash、Grok 4.3 和 Grok 4.5 达到了 100% 的完美准确率。
    • GPT-5.2 和 Claude Sonnet 4.5 各仅错过了一道难题。
    • Opus 4.8 和 Composer 2.5 分别错失了两道和四道题。
  • 失效模式分析: 极少数的错误并非由于求解器执行失败(未发生超时或执行错误)引起的。相反,错误源于多步推理过程中的错误解释,例如在聚合单个端点的支路损耗时,或混淆了 DER 弃载与调度。
  • 工具的影响: 对于需要数值计算的问题(如馈线损耗、电压上升),提升最为显著。对于可以从提示词描述中直接回答的问题(如拓扑、线路参数),提升并不明显,因为这些特定类别的无工具基准线已经相对较高。

意义与主张

本文声称,对于像电网边缘分析这样基于事实且数值密集型的工程任务,获取外部计算工具比选择 LLM 底座模型更为关键。 一旦智能体获得了确定性求解器的访问权限,不同 LLM 之间的性能差距便基本消失。

这项工作表明,工具增强型智能体可以有效地将真实的计算与记忆及猜测区分开来。它强调,虽然当前的模型在仅依赖参数化知识进行复杂数学分析时表现挣扎,但通过配备专门的求解器,它们可以在此前 LLM 无法独立完成的任务上实现近乎完美的准确率。作者指出了一些局限性,包括使用了单一的平衡放射状馈线以及求解器执行所需的时间,并建议未来的工作将聚焦于不平衡三相系统,并利用智能体的推理轨迹对更小的模型进行微调。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →