VEHBench: A Stage-Local Diagnostic Benchmark for LLM-Assisted Vibration Energy Harvester Design
Dit artikel introduceert VEHBench, een nieuwe diagnostische benchmark bestaande uit 763 op literatuur gebaseerde taken die LLM's evalueert over vier verschillende stadia van het ontwerp van trillingenergie-oogsters, waarbij wordt onthuld dat de prestaties van modellen sterk stadiumafhankelijk zijn en een workflow-bewuste aanpak voor engineering AI noodzakelijk maken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: VEHBench
Probleemstelling
Het ontwerp van trillingsenergieharvests (Vibration Energy Harvesters, VEHs) voor batterijvrije IoT-apparaten (Internet of Things) omvat nauw gekoppelde mechanisch-elektrische interacties en strikte fysieke beperkingen (bijv. trillingsspectra, vermogensdoelstellingen, afmetingslimieten, materiaaleigenschappen en veiligheidsmarges). Hoewel Large Language Models (LLMs) steeds vaker worden gebruikt als interfaces voor engineering-workflows—het vertalen van vereisten, het beoordelen van feedback en het voorstellen van ontwerpmodificaties—beoordelen bestaande engineering-benchmarks primair de validiteit van het uiteindelijke artefact. Deze eindpunt-evaluaties falen in het onthullen hoe LLM's zich gedragen over de verschillende fasen van een gekoppelde fysieke ontwerpprocess. Specifiek diagnosticeren huidige benchmarks niet of een model incompleet briefings correct sorteert, gebonden edities maakt na fysieke feedback, herstelt van gecorrumpeerde ontwerptrajecten, of zich houdt aan expliciete selectiebeleid. Dit gebrek aan fase-lokale diagnostische waarde maakt het moeilijk om specifieke workflow-fouten te identificeren (bijv. fouten in de toegangscontrol versus zoekfouten) en belemmert de selectie of routering van modellen voor specifieke engineering-rollen.
Methodologie
De auteurs introduceren VEHBench, een engineering-natuurlijke diagnostische benchmark die ontworig is om de door LLM-ondersteunde VEH-co-design te evalueren via fase-lokale, door verifiers gegronde taken.
Benchmark Constructie
- Domein: De benchmark richt zich op de vroege fase van de co-design van cantilever piezo-elektrische VEHs, een compact maar gekoppeld domein dat structurele dynamica, slimme materialen en circuitontwerp omvat.
- Databron: Taken zijn afgeleid van een literatuuraudit van 209 papers, wat resulteerde in 52 gezuiverde "design anchors" (genormaliseerde fysieke toestanden met variabelen, grenswaarden en beperkingen).
- Verificatie: Een analytische fysieke oracle (gebaseerd op de gesloten vorm van de Euler–Bernoulli balktheorie en elektromechanische koppelingsvergelijkingen) berekent haalbaarheid en objectkwaliteit. Er worden geen menselijke labels of "LLM-als-judge" gebruikt voor de scoring.
- Taakdecompositie: De workflow is gedecomponeerd in vier verschillende ontwerprollen (probes), elk met specifieke vertrouwde toestanden, toegestane acties en gevolgen van falen:
- P1 (Specificatie Triage): Het model ontvangt een ontwerpbriefing (compleet, incompleet of onhaalbaar) en moet beslissen om voor te stellen, te onthouden of ontbrekende informatie op te vragen.
- P2 (Verifier-Gestuurde Zoektocht): Gegeven een zaadontwerp en oracle-feedback, voert het model gebonden edities uit om de kandidaat te verbeteren.
- P3 (Herstel van Gecorrumpeerde Toestand): Het model wordt blootgesteld aan een gecorrumpeerd of misleidend ontwerptraject en moet resetten, herankeren of stabiliseren om de valstrik te ontsnappen.
- P4 (Beleidsgestuurde Selectie): Gegeven een pool van haalbare kandidaten, rangschikt of selecteert het model op basis van een expliciet engineering-beleid (bijv. prioriteit geven aan vermogen versus betrouwbaarheid).
Evaluatiekader
- Modellen: 12 volledige modelruns (waaronder Qwen, Gemini, DeepSeek, GPT, Hunyuan, etc.) werden geëvalueerd over alle 763 taken.
- Metrieken:
- Headline Metrieken: P1-Composite (gewogen certificeringsscore), P2 Final Feasible Power Ratio, P3-Success (uiteindelijke haalbaarheid na herstel), en P4 Kendall (rangschikkingsconsistentie).
- Diagnostische Profielen: Response-control profielen (Action Discipline, Edit Style, Feedback Conditioning, State-Reset Effort, Policy Execution) werden geëxtraheerd uit logs om falen in kaart te brengen aan gedragssignalen.
- Foutfamilies: Niet-exclusieve foutpercentages (bijv. over-actie, onhaalbare afsluiting, post-escape falen, beleidsmismatch) werden berekend om specifieke faalmodi te identificeren.
Belangrijkste Bijdragen
- Benchmark Framework (VEHBench): De eerste diagnostische benchmark voor LLM-ondersteund VEH-ontwerp die verder gaat dan de validiteit van het uiteindelijke artefact om de fase-lokale ontwerpgedrag te evalueren. Het combineert literatuur-gegronde taakconstructie, externe analytische verificatie en fase-specifieke evaluatie.
- Empirische Bevindingen & Interpretatie: De auteurs hebben huidige LLM's systematisch geëvalueerd en vastgesteld dat capaciteit sterk fase-afhankelijk is. Geen enkel model domineert de gehele workflow. Zij introduceerden een framework dat empirische resultaten koppelt aan interpreteerbare gedragskenmerken (bijv. actiediscipline, gebonden edities, toestandherstel).
- Fase-bewuste Begeleiding: Het paper demonstreert hoe fase-lokale resultaten praktische engineering-toepassingen kunnen informeren, inclus\nclusief modelselectie, routering en adaptatie. Het identificeert specifieke capaciteitsgebreken (bijv. specificatie triage, herstel van gecorrumpeerde toestanden) voor toekomstige engineering-agenten.
Experimentele Resultaten
- Fase-afhankelijke Rangschikking: Geen enkel model leidt de volledige workflow.
- P1 (Triage): qwen3-max presteerde het best door een balans te vinden tussen actiediscipline (het onderdrukken van onveilige invoer en het missen van ontbrekende informatie).
- P2 (Zoektocht): gemini-3.1-pro-preview leidde vanwege een hoge haalbare afsluiting en nuttige vermogensratio's.
- P3 (Herstel): hunyuan-hy3-preview excelleerde in het stabiliseren na het ontsnappen uit gecorrumpeerde toestanden.
- P4 (Selectie): gpt-5.4 bereikte de hoogste beleidsuitvoering en rangschikkingsconsistentie.
- Faalmodi:
- P1: Dominante fouten waren "over-actie" (voorstellen wanneer briefings onhaalbaar zijn) en "missing-info misses", in plaats van overmatige weigering.
- P2: De meeste modellen konden de outputprotocollen volgen maar faalden in het sluiten van de fysieke zoeklus (onhaalbare afsluiting) of leden aan nuttigheidsverlies.
- P3: De primaire bottleneck was niet het ontsnappen uit de valstrik, maar het stabiliseren van de toestand daarna (post-escape falen).
- P4: Falen waren primair "beleidsmismatch" (het niet uitvoeren van gestelde engineering-prioriteiten) in plaats van parseerfouten of onhaalbare kandidaat-selectie.
- Interventie & Routering:
- Toestand Interface: Het vervangen van ruwe gecorrumpeerde historie door een door een verifier geschreven toestandssamenvatting verbeterde de P3-herstelpercentages (van 50,0% naar 63,2% gemiddeld) en verminderde cascade-fouten.
- Routering: Een fase-bewuste router (die verschillende modellen selecteert voor verschillende fasen) verbeterde de gemiddelde genormaliseerde held-out score van 0,892 (beste enkele model fallback) naar 0,945, voornamelijk door de P3-specialist te wisselen.
Betekenis en Claims
Het paper claimt dat LLM-capaciteit in engineering-ontwerp rol-afhankelijk is, en dat geaggregeerde rangschikkingen minder informatief zijn dan fase-compatibiliteit. VEHBench biedt een fundament voor het evalueren, selecteren, routeren en verbeteren van verifier-gegronde engineering-LLM's door bloot te leggen waar workflow-gedrag faalt.
De auteurs benadrukken dat VEHBench niet een vervanging is voor Finite Element Method (FEM) simulaties, manufacturing reviews of hardware-certificering. In plaats daarvan dient het als een diagnostische laag om te bepalen of een LLM fysieke validiteitssignalen op de juiste wijze gebruikt in elke ontwerpfase. De benchmark is beperkt tot analytisch verifieerbare cantilever VEH co-design, waarbij de auteurs opmerken dat hetzelfde scaffold kan worden geïnstancieerd voor rijkere simulatoren en andere gekoppelde domeinen. Het werk betoogt dat voor engineering-toepassingen de focus moet verschuiven van "autonoom hardware-ontwerp" naar "fase-lokale assistentie", waarbij modellen worden geselecteerd en gerouteerd op basis van hun specifieke gedragsprofielen binnen de ontwerpprocessen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.