VeraGrid-Agent: Tool-Augmented LLMs for Distribution Optimal Power Flow at the Grid Edge
该论文介绍了 VeraGrid-Agent,这是一种工具增强型大语言模型,通过自主执行 VeraGrid 求解器,在最优潮流问题上实现了接近完美的准确率(97.3%–100.0%),显著优于仅依赖语言推理的模型(其得分低于 50%)。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:VeraGrid-Agent
问题陈述
大语言模型(LLMs)在代码生成和推理方面展现了显著的能力,促使研究人员将其应用于电力系统等科学与工程领域。然而,回答有关配电网最优潮流(D-OPF)的复杂问题提出了独特的挑战。这些问题通常需要解决涉及交流功率流方程、分布式能源(DERs)和电网约束的非凸、NP-hard 数值问题。
当 LLMs 仅尝试利用参数化知识(记忆)来回答此类问题时,它们被迫进行猜测,往往产生数值错误的输出。本文认为,对于需要精确数值模拟的任务(例如确定 PV 节点的电压上升、母线容量、DER 弃载或馈线损耗),仅凭语言推理是不够的。核心问题在于如何区分科学推理中的真实计算与记忆或幻觉。
方法论
为了解决这一问题,作者提出了 VeraGrid-Agent,这是一个旨在自主解决 D-OPF 问题的工具增强型 LLM 框架。该方法涉及一个闭环工作流,其中 LLM 作为外部求解器的控制器而非依赖其内部知识。
1. 智能体工作流
该智能体在一个隔离的工作空间内运行,并遵循 ReAct(推理 + 行动)框架。对于每个查询,智能体执行以下操作:
- 编写输入: 根据问题描述生成一个 JSON 输入文件,描述馈线图、母线、支路、负载和 DER 配置。
- 执行求解器: 调用开源 VeraGrid 模拟器,该模拟器对 AC-OPF 问题进行数值求解。
- 读取输出: 求解器返回执行元数据和目录,而非完整的解,以保持上下文窗口紧凑。随后,智能体进行针对性的特定行读取(例如,特定的线路潮流或母线电压)。
- 选择答案: 解释检索到的数值数据,从而从多项选择题(MCQ)中选择正确选项。
系统被限制在最大迭代次数()内,以防止陷入死循环,尽管大多数查询在几步之内即可解决。
2. 基准测试:VeraGrid-MCQ-150
为了评估性能,作者引入了 VeraGrid-MCQ-150,这是一个由确定性模板驱动的基准测试,包含 150 个多项选择题。
- 生成: 问题由专家定义的模板生成,其中标准答案直接由 VeraGrid 模拟器计算得出。这确保了每个答案都是特定已求解网络记录的确定性函数。
- 难度等级:
- 简单(50 题): 直接检索(例如,节点电压幅值、元件数量)。
- 中等(50 题): 单步推导(例如,标幺值转换、线路阻抗幅值、功率因数)。
- 困难(50 题): 多步计算和跨表推理(例如,聚合支路损耗、净备用功率、热极限)。
- 评估指标: 准确率通过预测标签 () 相对于标准答案 () 的正确百分比来衡量,将格式错误或缺失的响应视为错误。
核心贡献
本文做出了三个主要贡献:
- 工具增强架构: 一种新型的 D-OPF 分析框架,其中 LLM 编写模拟器输入、执行 VeraGrid 求解器并读取相关结果,确保每个答案都可追溯至求解器输出。
- 确定性基准: 引入了具有验证标准答案的 VeraGrid-MCQ-150 可复现测试平台,用于评估智能体从已求解网络中检索定量信息的能力,防止其依赖静态记忆。
- 实证研究: 在两种机制下(“无工具”——仅根据描述进行推理;以及“智能体”——工具增强型)对七种不同的 LLM 进行了全面评估。研究分析了性能增益和失效模式。
结果
作者在 8 节点放射状馈线测试案例上评估了七种模型(包括 GPT-5.2、Claude Sonnet 4.5、Gemini 3 Flash、Grok 4.3/4.5、Composer 2.5 和 Opus 4.8)。
- 无工具机制: 在没有访问求解器的情况下,所有模型的表现都很差,总体准确率在 41.3% 到 49.3% 之间。这证实了参数化知识不足以应对这些数值任务。
- 工具增强机制: 通过使用 VeraGrid-Agent,所有模型的准确率都大幅提升,范围在 97.3% 到 100.0% 之间。
- Gemini 3 Flash、Grok 4.3 和 Grok 4.5 达到了 100% 的完美准确率。
- GPT-5.2 和 Claude Sonnet 4.5 各仅错过了一道难题。
- Opus 4.8 和 Composer 2.5 分别错失了两道和四道题。
- 失效模式分析: 极少数的错误并非由于求解器执行失败(未发生超时或执行错误)引起的。相反,错误源于多步推理过程中的错误解释,例如在聚合单个端点的支路损耗时,或混淆了 DER 弃载与调度。
- 工具的影响: 对于需要数值计算的问题(如馈线损耗、电压上升),提升最为显著。对于可以从提示词描述中直接回答的问题(如拓扑、线路参数),提升并不明显,因为这些特定类别的无工具基准线已经相对较高。
意义与主张
本文声称,对于像电网边缘分析这样基于事实且数值密集型的工程任务,获取外部计算工具比选择 LLM 底座模型更为关键。 一旦智能体获得了确定性求解器的访问权限,不同 LLM 之间的性能差距便基本消失。
这项工作表明,工具增强型智能体可以有效地将真实的计算与记忆及猜测区分开来。它强调,虽然当前的模型在仅依赖参数化知识进行复杂数学分析时表现挣扎,但通过配备专门的求解器,它们可以在此前 LLM 无法独立完成的任务上实现近乎完美的准确率。作者指出了一些局限性,包括使用了单一的平衡放射状馈线以及求解器执行所需的时间,并建议未来的工作将聚焦于不平衡三相系统,并利用智能体的推理轨迹对更小的模型进行微调。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。