← Nieuwste papers
💻 computer science

NL2Scratch: An Executable Benchmark and Evaluation for Block-Based Programming

Dit artikel introduceert NL2Scratch, een grootschalige uitvoerbare benchmark en de Semantic Alignment Consistency (SAC) metriek om de beperkingen van conventionele NL2Code-evaluatie in blokgebaseerde programmering aan te pakken, waarbij wordt onthuld dat huidige LLM's vaak een hoge lexicale gelijkenis bereiken terwijl ze er niet in slagen de noodzakelijke semantische uitlijning vast te leggen voor het genereren van correcte Scratch-programma's.

Oorspronkelijke auteurs: Heejin Do, Alexandre Ballenghien, Yang Wu, April Yi Wang

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Heejin Do, Alexandre Ballenghien, Yang Wu, April Yi Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om een tekening te maken op basis van jouw gesproken instructies. Als je zegt: "Teken een rode cirkel," moet de robot precies begrijpen wat "rood" en "cirkel" betekenen en hoe hij die twee combineert.

Dit artikel gaat over een nieuwe test genaamd NL2Scratch, ontworpen om te zien hoe goed AI dit kan, maar met een twist: in plaats van tekstuele code te schrijven (zoals Python), moet de AI programma's bouwen met behulp van Scratch-blokken. Scratch is de kleurrijke, drag-and-drop programmeertaal die kinderen gebruiken om games en animaties te maken.

Hier is de opbouw van het verhaal uit het artikel, met behulp van eenvoudige analogieën:

1. Het Probleem: De "Het ziet er goed uit"-valstrik

Jarenlang hebben onderzoekers AI getest op tekstgebaseerde codering. Ze controleren of het antwoord van de AI lijkt op het juiste antwoord (zoals controleren of twee zinnen dezelfde woorden delen).

Maar Scratch is anders. Het is als een Lego-set.

  • In tekstgebaseerde codering kan het hele zin breken als je een komma mist.
  • In Scratch kun je de juiste soorten blokken hebben (een "beweeg"-blok, een "herhaal"-blok) en de juiste woorden erin, maar als je ze in de verkeerde volgorde zet of aan de verkeerde trigger koppelt, werkt het spel niet.

Het artikel stelt dat huidige AI-tests lijken op het beoordelen van een Lego-kasteel door alleen de stenen te tellen. Als de AI het juiste aantal rode en blauwe stenen gebruikt, zegt de test: "Goed gedaan!", zelfs als het kasteel omvalt omdat de stenen ondersteboven zijn gestapeld.

2. De Oplossing: Een Nieuwe Test en een Nieuwe Meetlat

De auteurs hebben NL2Scratch gebouwd, een enorme bibliotheek van 311.000 voorbeelden.

  • De Bron: Ze hebben echte Scratch-projecten genomen die door mensen zijn gemaakt.
  • De Vertaling: Ze hebben AI gebruikt om natuurlijke Engelse beschrijvingen voor deze projecten te schrijven (bijv. "Wanneer de groene vlag wordt aangeklikt, laat de kat 10 stappen bewegen").
  • De Filter: Ze hebben ervoor gezorgd dat elk enkel voorbeeld daadwerkelijk werkt in de Scratch-engine.

De Nieuwe Meetlat (SAC):
In plaats van alleen woorden te tellen die overeenkomen, hebben ze een nieuwe meetlat uitgevonden genaamd Semantic Alignment Consistency (SAC).

  • Denk aan een checklist.
  • Noemt de beschrijving de juiste trigger (zoals de groene vlag)?
  • Noemt het de juiste actie (zo het bewegen)?
  • Bevat het de juiste getallen (zoals 10 stappen)?
  • SAC controleert elk item op deze lijst. Als de AI de "trigger" goed heeft maar het "getal" fout, laat de checklist een rood kruis zien, zelfs als de rest van de zin perfect is.

3. De Grote Ontdekking: AI is Goed in Nabootsen, Slecht in Betekenis

De onderzoekers testten verschillende slimme AI-modellen (zoals GPT-4 en open-source modellen) op deze nieuwe test. Dit is wat ze vonden:

  • De Illusie van Succes: Wanneer ze oude tests gebruikten (het tellen van woorden), zag de AI er geweldig uit. Het kreeg 93% tot 97% van de woorden goed. Het klonk alsof het precies wist wat het moest doen.
  • De Realiteitstoets: Toen ze de nieuwe SAC-checklist gebruikten, daalde de score van de AI drastisch. Slechts ongeveer 18% van de antwoorden van de AI was perfect correct qua betekenis.
  • Het "Lange Spel"-probleem: Hoe langer en complexer het Scratch-project werd, hoe slechter de AI werd in het krijgen van de details goed, ook al klonk het nog steeds erg vergelijkbaar met het juiste antwoord.

Waar faalde de AI?
De AI was goed in het "grote plaatje" (weten dat het een "loop" of een "variabele" nodig heeft). Maar de AI bleef de operationele details verprutsen:

  • Het zou zeggen "beweeg naar voren" terwijl het "beweeg naar achteren" moest zeggen.
  • Het zou zeggen "herhaal 10 keer" terwijl het "herhaal 5 keer" moest zeggen.
  • Het kreeg de conditie fout (bijv. "als het de muur raakt" versus "als het de kat raakt").

Het is als een student die de woordenlijst perfect heeft uit het hoofd geleerd, maar de wiskundige som niet kon oplossen omdat hij optelde in plaats van aftrok.

4. De Oplossing: Een "Tweede Mening"

Het artikel liet ook zien dat je deze nieuwe checklist (SAC) kunt gebruiken om de fouten van de AI te herstellen nadat deze een antwoord heeft gegenereerd.

  • Stel je voor dat de AI 10 verschillende versies van het programma schrijft.
  • In plaats van alleen de eerste te kiezen, haal je alle 10 door de SAC-checklist.
  • Je kiest de versie die het beste bij de checklist past.
  • Resultaat: Deze eenvoudige stap verbeterde de nauwkeurigheid van de AI aanzienlijk, zonder dat de AI opnieuw getraind of iets nieuws hoefde te leren.

Samenvatting

Het artikel concludeert dat voor blokgebaseerde programmering (zoals Scratch), lijken op de juiste code niet genoeg is. Een AI kan klinken als een programmeur zonder daadwerkelijk een programmeur te zijn. Om AI in dit vakgebied echt te evalueren, moeten we de "tandwielen en wieltjes" controleren (de specifieke acties en getallen), en niet alleen de "laklaag" (de woorden). Ze hebben de instrumenten gebouwd om precies dat te doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →