← Nieuwste papers
🤖 AI

(How) Do Large Language Models Understand High-Level Message Sequence Charts?

Dit artikel evalueert het vermogen van drie grote taalmodellen om de formele semantiek van High-Level Message Sequence Charts (HMSC's) te begrijpen en onthult dat, hoewel ze een sterk begrip van basisconcepten tonen, hun algehele nauwkeurigheid bescheiden is (ongeveer 52%) vanwege aanzienlijke moeite met complexe semantische redenering die abstractie, compositie en causale afhankelijkheden omvat.

Oorspronkelijke auteurs: Mohammad Reza Mousavi

Gepubliceerd 2026-05-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mohammad Reza Mousavi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed gelezen robot hebt die bijna elk boek, elke handleiding en elk diagram dat ooit is geschreven, heeft gelezen. Je vraagt het om te kijken naar een specifiek type blauwdruk dat een High-Level Message Sequence Chart (HMSC) wordt genoemd. Denk aan deze diagrammen als een stripverhaal voor software: ze tonen verschillende personages (computersystemen) die notities (berichten) in een specifieke volgorde aan elkaar doorgeven.

De grote vraag die dit artikel stelt is: Begrijpt deze robot de regels van het stripverhaal daadwerkelijk, of raadt hij alleen op basis van hoe de afbeeldingen eruitzien?

Hier is een uiteenzetting van wat de onderzoekers hebben gevonden, met gebruikmaking van eenvoudige analogieën:

1. De Opzet: De "Stripverhaal"-test

De onderzoekers namen 129 verschillende taken met betrekking tot deze blauwdrukken. Ze vroegen drie verschillende "superhersenen" (AI-modellen genaamd Gemini, GPT en Qwen) om dingen te doen zoals:

  • De basis opsporen: "Wie heeft een notitie aan wie gestuurd?"
  • De regels volgen: "Als Personage A een notitie stuurt, kan Personage B deze dan ontvangen voordat deze is verzonden?"
  • Het verhaal bewerken: "Wat gebeurt er als we deze notitie verwijderen? Is het verhaal dan nog steeds logisch?"
  • Het script herschrijven: "Zet dit stripverhaal om in een lijst met elke mogelijke manier waarop het verhaal kan uitrollen."

2. De Resultaten: Goed in lezen, slecht in logica

De totale score voor deze AI-modellen was ongeveer 52%. Dat is nauwelijks een voldoende. De score was echter niet hetzelfde voor elk type taak.

🟢 Het Makkelijke Deel: "Ik zie de stippen" (88% Nauwkeurigheid)

Wanneer de taak er alleen uit bestond om de personages en de notities die ze stuurden aan te wijzen, waren de AI's uitstekend.

  • Analogie: Als je een robot een foto van een kat laat zien en vraagt: "Is dat een kat?", zegt het bijna perfect "Ja".
  • Waarom: De AI's zijn geweldig in het herkennen van visuele patronen. Ze kunnen de lijnen en pijlen zien en zeggen: "Oké, deze lijn gaat van hier naar daar."

🔴 Het Moeilijke Deel: "Het Logische Gat" (36–42% Nauwkeurigheid)

Wanneer de onderzoekers de AI's vroegen dingen te doen die begrip vereisten van de regels van tijd en oorzaak-en-gevolg, begonnen de AI's vreselijk te falen.

  • Het "Parallel Spelen"-Probleem (Co-regio's):
    Stel je twee kinderen voor die in aparte kamers spelen. Ze doen dingen tegelijkertijd, maar niemand wacht op de ander.
    • De AI-Fout: De AI's bleven volhouden dat één kind zijn actie moest afronden voordat de ander begon, zelfs hoewel de blauwdruk aangaf dat ze gelijktijdig plaatsvonden. Ze konden het concept niet begrijpen van "dingen tegelijkertijd doen zonder te interfereren".
  • Het "Bewerk"-Probleem (Abstractie):
    Stel je voor dat je een notitie uit een verhaal haalt. Als die notitie de reden was dat een personage op een ander wachtte, zou het verwijderen ervan de wachtregels moeten veranderen.
    • De AI-Fout: De AI's zouden de notitie verwijderen, maar vergeten de wachtregels bij te werken. Ze lieten "spookregels" achter, waardoor het verhaal verwarrend of onmogelijk werd.
  • Het "Script"-Probleem (Traces & LTS):
    Dit is als je de AI vraagt om elke mogelijke manier op te schrijven waarop het stripverhaal van begin tot eind kan worden gelezen.
    • De AI-Fout: Ze misten vaak hele takken van het verhaal of verzonnen nieuwe, neppe paden die niet door de oorspronkelijke regels werden toegestaan.

3. De "Cheatsleutel"-Ontdekking

Interessant genoeg, wanneer de AI's de moeilijke logische vragen toch goed beantwoordden, deden ze dit vaak niet in hun hoofd.

  • De Analogie: In plaats van een complex wiskundig probleem in hun hoofd op te lossen, schreven ze een Python-computerprogramma om het voor hen op te lossen, draaiden de code en lazen vervolgens het antwoord.
  • De Conclusie: De AI's zijn beter in het schrijven van instructies voor een rekenmachine dan ze zijn in het zelf uitvoeren van de berekening.

4. De Conclusie

Het artikel concludeert dat hoewel deze AI-modellen zeer goed zijn in het bekijken van architectuurdiagrammen en het herkennen van de onderdelen, ze momenteel niet betrouwbaar zijn in het begrijpen van de diepe, formele logica erachter.

  • Ze kunnen je vertellen wat er in de afbeelding staat.
  • Ze worstelen om je te vertellen waarom het zo werkt of hoe je het kunt veranderen zonder de regels te breken.

De onderzoekers suggereren dat als we deze AI's willen gebruiken voor serieus softwareontwerp, we ze niet alleen moeten vragen om na te denken. In plaats daarvan moeten we ze code laten schrijven die de regels voor ons controleert, dienend als een brug tussen de patroonherkenning van de AI en een strikt, logisch computerprogramma.

Kortom: De AI is een geweldig kunstcriticus die een schilderij perfect kan beschrijven, maar als je vraagt om het perspectief van het schilderij te corrigeren of de tijdslijn van het verhaal te veranderen, zal het waarschijnlijk de logica verstoren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →