← Nieuwste papers
🤖 AI

Assessing the Business Process Modeling Competences of Large Language Models

Dit artikel introduceert het BEF4LLM-framework om grote taalmodellen systematisch te evalueren op BPMN-generatie over vier kwaliteitsdimensies, waarbij wordt onthuld dat hoewel LLM's uitblinken in syntactische en pragmatische aspecten, ze nog steeds iets achterlopen op menselijke experts wat betreft semantische kwaliteit en validiteit, maar toch competitief potentieel vertonen voor toekomstige business process modeling-toepassingen.

Oorspronkelijke auteurs: Chantale Lauer, Peter Pfeiffer, Alexander Rombach, Nijat Mehdiyev

Gepubliceerd 2026-01-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chantale Lauer, Peter Pfeiffer, Alexander Rombach, Nijat Mehdiyev

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een recept wilt geven aan een zeer slimme, maar enigszins letterlijke robotkok. Je wilt dat de robot een kaart tekent van hoe een bedrijf werkt (zoals een flowchart voor een fabriek of een bank) op basis van jouw geschreven instructies. Deze kaart wordt een BPMN-model genoemd.

Jarenlang was het tekenen van deze kaarten een taak voor dure experts die zowel de business als de strikte regels van de tekenstaal kenden. Maar nu hebben we Large Language Models (LLM's)—dezelfde soort AI die e-mails en verhalen schrijft. De grote vraag is: Kunnen deze AI-chefs deze complexe zakelijke kaarten net zo goed tekenen als menselijke experts?

Dit paper is een enorme "kookwedstrijd" om dit uit te zoeken. Dit is wat ze hebben gedaan en wat ze hebben gevonden, eenvoudig uitgelegd.

De Wedstrijd: Het BEF4LLM Framework

De onderzoekers hebben een nieuw scoresysteem gebouwd genaamd BEF4LLM. Zie dit als een scorekaart van een rechter met vier specifieke categorieën:

  1. Validiteit (De "Is het echt?" check): Heeft de AI daadwerkelijk een bestand geproduceerd dat de computer kan openen en lezen? Als de AI wartaal schrijft of het bestandsformaat breekt, krijgt het hier een nul. Dit is de meest basale hindernis.
  2. Syntactische Kwaliteit (De "Grammatica" check): Heeft de AI de strikte regels van de tekenstaal gevolgd? (bijv. "Elke lus moet een begin en een eind hebben," "Pijlen moeten de juiste kant op wijzen").
  3. Pragmatische Kwaliteit (De "Leesbaarheid" check): Is de kaart gemakkelijk voor een mens om naar te kijken en te begrijpen? Is het te rommelig? Liggen de lijnen overal door elkaar? Een kaart met perfecte grammatica die eruitziet als een spinnenweb, is nutteloos.
  4. Semantische Kwaliteit (De "Betekenis" check): Vertelt de kaart daadwerkelijk het juiste verhaal? Als je zei "De klant betaalt, en dan wordt het artikel verzonden," laat de kaart dan die volgorde zien, of raakte de AI in de war en draaide ze om?

De Deelnemers

Ze hebben 17 verschillende open-source AI-modellen van diverse groottes getest.

  • Kleine modellen: Zoals een slimme rekenmachine.
  • Medium modellen: Zoals een goed geïnformeerde bibliothecaris.
  • Grote modellen: Zoals een supercomputer met een gigantisch brein.

Ze gaven deze AI's 105 verschillende zakelijke beschrijvingen (zoals "Een klant bestelt een pizza, betaalt, en wacht op levering") en vroegen hen de kaarten te tekenen.

De Grote Verrassingen (De Resultaten)

1. Groter is niet altijd beter.
Je zou denken dat de grootste, duurste AI elke keer zou winnen. Maar het paper vond dat grotere modellen niet noodzakelijkerwijs betere kaarten maakten.

  • De Analogie: Stel je een enorme, enthousiaste chef voor (de grote AI) die zoveel extra ingrediënten en stappen aan het recept toevoegt dat het gerecht een rommeltje wordt, zelfs als de smaken technisch gezien correct zijn. Soms maakte een kleinere, meer gefocuste chef (een medium AI) een schonere, makkelijker leesbare kaart.
  • De Haken en ogen: De grootste modellen waren beter in het volgen van de strikte regels (Grammatica) en het krijgen van het juiste verhaal (Betekenis), maar ze maakten de kaarten vaak te ingewikkeld om te lezen (Leesbaarheid).

2. Het "Geldig Bestand" Probleem.
Dit was de grootste hindernis. Veel AI's, vooral de kleinere, slaagden er niet in om een bestand te produceren dat de computer daadwerkelijk kon openen.

  • De Analogie: Het is alsof de AI een prachtige brief heeft geschreven, maar vergeten heeft deze in een envelop te doen, of de envelop is verzegeld met lijm die de postbode niet kan openen. Zelfs als de brief binnenin perfect is, is hij nutteloos als hij niet geleverd kan worden. Slechts enkele topmodellen konden consequent "openbare" bestanden produceren.

3. AI versus Menselijke Experts.
De onderzoekers lieten menselijke experts ook kaarten tekenen voor dezelfde beschrijvingen.

  • Het Resultaat: De AI en de mensen kwamen qua algemeen niveau verrassend dicht bij elkaar.
    • Sterktes van de AI: De AI was eigenlijk beter in het volgen van de strikte grammaticaregels en het maken van nette en georganiseerde kaarten.
    • Sterktes van de Mens: Mensen waren iets beter in het vastleggen van de diepe betekenis en logica van het verhaal.
    • Het Oordeel: De AI is geen onhandige beginner meer; het heeft een niveau bereikt waarop het kan concurreren met een menselijke professional, hoewel het nog steeds worstelt met de diepste nuances van het verhaal.

4. De "Verfijnings"-lus.
De onderzoekers gaven de AI een tweede kans. Als de AI een fout maakte, zeiden ze: "Hé, je bestand is kapot, herstel het," en lieten ze het opnieuw proberen. Dit hielp veel, maar het was geen wondermiddel.

De Kernboodschap

Dit paper vertelt ons dat AI klaar is om te helpen bij het modelleren van bedrijfsprocessen, maar we moeten voorzichtig zijn met welke AI we kiezen.

  • Kies niet alleen het grootste model: Soms is een medium-groot model de "Goldilocks"-keuze—precies goed voor de klus.
  • Validiteit is essentieel: Als de AI niet eens een bestand kan genereren dat opent, maakt het niet uit hoe slim de kaart binnenin is.
  • De Toekomst: We moeten deze AI's leren om consistenter te zijn en het "verhaal" achter het bedrijfsproces beter te begrijpen.

Kortom, de AI is een zeer getalenteerde leerling die de regels perfect kent en nette lijnen trekt, maar er is nog steeds een menselijke supervisor nodig om er zeker van te zijn dat het verhaal dat het vertelt ook echt ergens op slaat.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →