← Nieuwste papers
⚡ electrical engineering

VeraGrid-Agent: Tool-Augmented LLMs for Distribution Optimal Power Flow at the Grid Edge

Het artikel introduceert VeraGrid-Agent, een tool-augmented groot taalmodel dat een bijna perfecte nauwkeurigheid (97,3%–100,0%) bereikt op vragen over distributie-optimale vermogensstroom door autonoom de VeraGrid-solver uit te voeren, waarmee het modellen die uitsluitend vertrouwen op linguïstische redenering, die scores onder de 50% behalen, aanzienlijk overtreft.

Oorspronkelijke auteurs: Shivanshu Tripathi, Hamed Mohsenian-Rad, Maziar Raissi

Gepubliceerd 2026-07-29
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Shivanshu Tripathi, Hamed Mohsenian-Rad, Maziar Raissi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: VeraGrid-Agent

Probleemstelling

Large Language Models (LLM's) hebben significante capaciteiten getoond in codegeneratie en redeneren, wat heeft geleid tot hun exploratie in wetenschappelijke en technische domeinen zoals elektriciteitsnetten. Het beantwoorden van complexe vragen over distributie optimal optimal power flow (D-OPF) vormt echter een unieke uitdaging. Deze vragen vereisen vaak het oplossen van niet-convexe, NP-harde numerieke problemen die betrekking hebben op AC-vermogensstroomvergelijkingen, gedistribueerde energiebronnen (DER's) en netbeperkingen.

Wanneer LLM's proberen dergelijke vragen te beantwoorden met behulp van enkel parametrische kennis (geheugen), worden ze gedwongen te gokken, wat vaak leidt tot numeriek incorrecte outputs. Het artikel stelt dat louter linguïstisch redeneren onvoldoende is voor taken die precieze numerieke simulatie vereisen, zoals het bepalen van spanningsstijgingen bij PV-nodes, buscapaciteiten, DER-afschakeling of voederverliezen. Het kernprobleem is het onderscheid maken tussen genuante computatie en het vertrouwen op memorisatie of hallucinaties bij wetenschappelijk redeneren.

Methodologie

Om dit aan te pakken, stellen de auteurs VeraGrid-Agent voor, een tool-augmented LLM-framework dat ontworpen is om D-OPF-problemen autonoom op te lossen. De methodologie omvat een closed-loop workflow waarbij de LLM fungeert als een controller voor een externe solver, in plaats van te vertrouwen op interne kennis.

1. De Agent Workflow

De agent opereert binnen een geïsoleerde werkruimte en volgt een ReAct (Reasoning + Acting) framework. Voor elke query:

  • Schrijft Input: Genereert een JSON-inputbestand dat de feeder-grafiek, bussen, takken, belastingen en DER-configuraties beschrijft op basis van de probleemomschrijving.
  • Voert Solver Uit: Roept de open-source VeraGrid simulator aan, die het AC-OPF probleem numeriek oplost.
  • Leest Output: De solver retourneert executie-metadata en een inhoudsopgave in plaats van de volledige oplossing om de context window compact te houden. De agent voert vervolgens gerichte leesacties uit van specifieke resultaatregels (bijv. specifieke lijnstromen of busspanningen).
  • Selecteert Antwoord: Interpreteert de opgehaalde numerieke gegevens om de juiste optie te selecteren uit een meerkeuzevraag (MCQ).

Het systeem wordt beperkt door een maximaal aantal iteraties (TmaxT_{max}) om oneindige loops te voorkomen, hoewel de meeste queries binnen enkele stappen worden opgelost.

2. De Benchmark: VeraGrid-MCQ-150

Om de prestaties te evalueren, introduceren de auteurs VeraGrid-MCQ-150, een deterministische, template-gestuurde benchmark bestaande uit 150 meerkeuzevragen.

  • Generatie: Vragen worden gegenereerd door door experts gedefinieerde templates waarbij de grondwaarheid (ground truth) direct wordt berekend door de VeraGrid simulator. Dit zorgt ervoor dat elk antwoord een deterministische functie is van een specifiek opgeloste netwerkrecord.
  • Moeilijkheidsgraden:
    • Easy (50 vragen): Directe extractie (bijv. node spanning magnitudes, elementaantallen).
    • Medium (50 vragen): Eénstaps-derivatie (bijv. per-unit conversie, lijnimpedantie magnitude, vermogensfactor).
    • Hard (50 vragen): Meerstaps-computatie en cross-table inferentie (bijv. geaggregeerde takverliezen, netto reservevermogen, thermische marges).
  • Evaluatiemetriek: Nauwkeurigheid wordt gemeten als het percentage correct voorspelde labels (^\hat{\ell}) tegenover de grondwaarheid (\ell^*), waarbij foutieve of ontbrekende responsen als incorrect worden behandeld.

Belangrijkste Bijdragen

Het artikel levert drie primaire bijdragen:

  1. Tool-Augmented Architectuur: Een nieuw framework voor D-OPF-analyse waarbij de LLM simulator-inputs schrijft, de VeraGrid solver uitvoert en relevante resultaten leest, wat garandeert dat elk antwoord herleidbaar is naar de solver-output.
  2. Deterministische Benchmark: De introductie van VeraGrid-MCQ-150, een reproduceerbare testomgeving met geverifieerde grondwaarheid die het vermogen van een agent evalueert om kwantitatieve informatie te extraheren uit een opgeloste netwerk, wat vertrouwen op statische memorisatie voorkomt.
  3. Empirische Studie: Een uitgebreide evaluatie van zeven verschillende LLM's onder twee regimes: "no-tool" (redeneren vanaf de beschrijving alleen) en "agent" (tool-augmented). De studie analyseert prestatiewinsten en faalmodi.

Resultaten

De auteurs evalueerden zeven modellen (waaronder GPT-5.2, Claude Sonnet 4.5, Gemini 3 Flash, Grok 4.3/4.5, Composer 2.5, en Opus 4.8) op de 8-bus radiale feeder testcase.

  • No-Tool Regime: Zonder toegang tot de solver presteerden alle modellen slecht, met algemene nauwkeurigheden variërend van 41,3% tot 49,3%. Dit bevestigt dat parametrische kennis onvoldoende is voor deze numerieke taken.
  • Tool-Augmented Regime: Met de VeraGrid-Agent verbeterde de nauwkeurigheid drastisch over alle modellen, variërend van 97,3% tot 100,0%.
    • Gemini 3 Flash, Grok 4.3, en Grok 4.5 behaalden een perfecte nauwkeurigheid van 100%.
    • GPT-5.2 en Claude Sonnet 4.5 misten slechts één moeilijke vraag elk.
    • Opus 4.8 en Composer 2.5 misten respectievelijk twee en vier vragen.
  • Faalmodus Analyse: De weinige resterende fouten waren niet te wijten aan falende solver-executie (er traden geen timeouts of executiefouten op). In plaats daarvan ontstonden fouten door verkeerde interpretaties tijdens meerstaps-redeneren, zoals het aggregeren van takverliezen bij een enkele terminal of het verwarren van DER-afschakeling met dispatch.
  • Impact van Tools: De verbetering was het meest significant voor vragen die numerieke computatie vereisten (bijv. voederverliezen, spanningsstijgingen). Vragen die uit de prompt-beschrijving alleen beantwoord konden worden (bijv. topologie, lijnparameters) vertoonden weinig verbetering, aangezien de no-tool baseline voor die specifieke categorieën al relatief hoog was.

Betekenis en Claims

Het artikel claimt dat voor gegronde, numeriek intensieve engineeringtaken zoals grid-edge analyse, toegang tot externe computationele tools belangrijker is dan de keuze van de LLM-backbone. Zodra de agent toegang heeft tot een deterministische solver, verdwijnt het prestatieverschil tussen verschillende LLM's grotendeels.

Het werk demonstreert dat tool-augmented agents effectief genuante computatie kunnen scheiden van memorisatie en gokken. Het benadrukt dat hoewel huidige modellen moeite hebben met complexe wiskundige analyse wanneer ze uitsluitend vertrouwen op parametrische kennis, het uitrusten van hen met gespecialiseerde solvers hen in staat stelt om bijna perfecte nauwkeurigheid te bereiken op taken die voorheen onoplosbaar waren voor LLM's alleen. De auteurs merken beperkingen op, waaronder het gebruik van een enkele gebalanceerde radiale feeder en de tijd die nodig is voor solver-executie, en suggereren dat toekomstig werk zich zal richten op ongebalanceerde driefasige systemen en het fine-tunen van kleinere modellen met behulp van de redeneersporen van de agent.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →