← Nieuwste papers
💻 computer science

Hallucination Inspector: A Fact-Checking Judge for API Migration

Dit paper introduceert Hallucination Inspector, een statische analysetool die 'Scaffolding Hallucination' detecteert in door LLM's gegenereerde code tijdens API-migraties door gegenereerde symbolen te verifiëren tegen API-documentatie, waardoor onnauwkeurigheden worden opgespoord die standaardmetrieken missen.

Oorspronkelijke auteurs: Marcos Tileria, Santanu Kumar Dash, Profir-Petru Pârţachi, Earl T. Barr

Gepubliceerd 2026-04-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Marcos Tileria, Santanu Kumar Dash, Profir-Petru Pârţachi, Earl T. Barr

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een oude, verouderde machine hebt (zoals een oude radio) en je wilt hem upgraden naar een modern, slim apparaat (zoals een slimme speaker). Je vraagt een super-intelligente, maar soms dromerige assistent (een AI) om de handleiding te schrijven voor deze upgrade.

Deze assistent is geweldig in het vinden van de nieuwe onderdelen, maar hij heeft een rare gewoonte: hij verzonnen soms onderdelen die er helemaal niet zijn. Hij zegt: "Gebruik de 'Blauwe Knop van de Toekomst'!" terwijl die knop in de echte handleiding niet bestaat. Als je die knop probeert te gebruiken, gaat de machine kapot.

Dit is precies het probleem dat dit paper beschrijft, en hoe de auteurs een oplossing hebben bedacht. Hier is de uitleg in gewoon Nederlands:

1. Het Probleem: De "Dromerige" AI

In de softwarewereld moeten programmeurs vaak oude code vervangen door nieuwe code (dit heet API-migratie). Ze gebruiken nu steeds vaker AI (zoals Large Language Models) om dit werk voor hen te doen.

De AI is slim, maar ze hallucineert. Dat betekent dat ze dingen bedenkt die er niet zijn. De auteurs noemen dit "Scaffolding Hallucination" (een soort "dromerige steigerbouw").

  • De metafoor: Stel je voor dat de AI een brug bouwt. Ze weet dat er een brug nodig is, maar ze gebruikt in haar ontwerp een steunpilaar die in de echte wereld niet bestaat. De brug ziet er perfect uit op papier, maar als je eroverheen loopt, stort hij in.
  • Het gevaar: De AI bedenkt bijvoorbeeld een import, een constante of een methode die niet in de officiële documentatie staat. De code ziet er goed uit, maar werkt niet.

2. Waarom bestaande controles falen

Tot nu toe keken mensen of computers naar de code en vroegen: "Lijkt dit op de juiste oplossing?"

  • De metafoor: Het is alsof je een nepbankje bekijkt en zegt: "Het lijkt wel echt, want het heeft dezelfde kleur hout en dezelfde vorm als het echte bankje." Je kijkt niet of het hout wel stevig is.
  • Het probleem: De AI maakt vaak code die er bijna hetzelfde uitziet als de echte code (hoge "CodeBLEU"-score), maar met die ene verzonnen, dodelijke fout. Bestaande meetinstrumenten zien dit niet, omdat ze alleen kijken naar de oppervlakte, niet naar de inhoud.

3. De Oplossing: De "Hallucination Inspector"

De auteurs hebben een nieuw gereedschap bedacht: de Hallucination Inspector.

  • De metafoor: Stel je voor dat je een fact-checker of een strenge inspecteur hebt die een boekje met de officiële fabrieksspecificaties bij zich heeft.
  • Hoe het werkt:
    1. De AI schrijft een stukje code.
    2. De Inspector pakt dit stukje code en kijkt er niet naar of het "leuk" of "soepel" oogt.
    3. De Inspector kijkt elk woord in de code na in het officiële boekje (de API-documentatie).
    4. Vindt hij een woord (een symbool) dat niet in het boekje staat? Dan roept hij: "STOP! Dit is een droom! Dit bestaat niet!"

Ze noemen deze verzonnen woorden "Phantom Symbols" (spooksymboolen). De Inspector is als een detective die zegt: "Je zegt dat je de 'Blauwe Knop van de Toekomst' gebruikt, maar in het boekje staat dat die knop niet bestaat. Je hebt het verkeerd."

4. Twee soorten fouten

De Inspector kan twee soorten fouten vinden:

  1. De "Spook-Objecten" (Atomic Hallucinations): De AI bedenkt een hele nieuwe knop of variabele die er niet is. (Bijvoorbeeld: "Gebruik CONTENT_TYPE_STREAM" terwijl die niet bestaat).
  2. De "Verkeerde Bestemming" (Scope-bound Hallucinations): De AI gebruikt een bestaande knop, maar op het verkeerde object. (Bijvoorbeeld: Je probeert een knop van de "Radio" te gebruiken op de "TV". De knop bestaat, maar niet op dat apparaat).

5. Wat zeggen de resultaten?

De auteurs hebben dit getest op Android-apps.

  • De oude manier (meten of het lijkt): De AI kreeg vaak een hoge score, terwijl de code kapot was.
  • De nieuwe manier (de Inspector): De Inspector zag elke fout. Hij was 100% zeker van zijn zaak (geen valse alarmen).
  • Vergelijking met een andere AI: Zelfs als je een andere, zeer slimme AI vraagt om te controleren of de code goed is, faalt die vaak. Die andere AI is ook een dromer en denkt: "Oh, het klinkt wel logisch," terwijl het niet klopt. De Inspector is niet een dromer; hij kijkt alleen naar de feiten in het boekje.

Conclusie

Kortom: AI is geweldig om code te schrijven, maar het is een slechte controleur omdat het soms dingen verzonnt die er niet zijn. De Hallucination Inspector is een simpele, strenge controleur die de code vergelijkt met de officiële handleiding. Hij zorgt ervoor dat we geen "dromerige" code in onze software stoppen, waardoor apps minder vaak crashen en beter werken.

Het is als het hebben van een strenge bouwkundige die elke steen van je muur controleert tegen de blauwdruk, in plaats van iemand die alleen zegt: "Die muur ziet er wel mooi uit."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →