← Nieuwste papers
💬 NLP

BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation

Deze paper introduceert een benchmark en een tweestaps-mitigatiestrategie met de tool clibib om de frequent voorkomende hallucinaties in BibTeX-citaties door zoekgerichte AI-modellen in wetenschappelijke publicaties aanzienlijk te verminderen.

Oorspronkelijke auteurs: Delip Rao, Chris Callison-Burch

Gepubliceerd 2026-04-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Delip Rao, Chris Callison-Burch

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De "Hallucinerende Bibliograaf": Waarom AI Citaten Verzonnen en Hoe We Dat Oplossen

Stel je voor dat je een zeer slimme, maar soms een beetje dromerige assistent hebt. Deze assistent is een kunstmatige intelligentie (AI) die alles over wetenschap weet. Je vraagt hem: "Geef me de volledige gegevens van dat beroemde artikel over quantumcomputers."

De assistent schrijft snel een lijstje op met de titel, de auteurs, het jaar en een link naar het artikel. Het ziet er perfect uit. Maar als je die link aanklikt, blijkt het een heel ander artikel te zijn, of misschien bestaat het zelfs niet. De assistent heeft gehallucineerd. Hij heeft de gegevens niet opgezocht, maar uit zijn "hoofd" (zijn trainingsdata) verzonnen, omdat hij dacht dat hij het wel wist.

Dit is precies wat deze nieuwe studie onderzoekt: Waarom AI's fouten maken bij het opschrijven van wetenschappelijke bronnen, en hoe we dat kunnen fixen.

1. Het Probleem: De "Geheugen-Val"

De onderzoekers hebben gekeken naar drie van de slimste AI's die er vandaag zijn (van OpenAI, Anthropic en Google). Ze hebben ze gevraagd om citaten te maken voor 931 wetenschappelijke artikelen.

Ze ontdekten iets verrassends:

  • Bekende artikelen: Als het om een heel beroemd, oud artikel gaat (zoals een klassieker), doet de AI het best. Hij "onthoudt" deze uit zijn training.
  • Nieuwe artikelen: Zodra het om een artikel gaat dat gisteren is gepubliceerd (na de kennis van de AI), gaat het mis. De AI probeert het dan toch te "onthouden" of zoekt het op, maar maakt dan vaak fouten.
  • Het resultaat: Hoewel de AI's 83% van de losse gegevens (zoals de auteursnaam) goed hadden, was maar de helft van de volledige lijsten helemaal foutloos.

De Analogie:
Stel je voor dat je een vriend vraagt om de adresgegevens van een beroemd restaurant te geven.

  • Als het restaurant al 20 jaar open is, kent je vriend het uit zijn hoofd.
  • Als het restaurant gisteren geopend is, probeert je vriend het adres te raden op basis van hoe andere restaurants eruitzien. Hij noemt misschien de juiste straat, maar het huisnummer is verkeerd, of hij verliest het adres helemaal.

2. De Twee Manieren waarop het misgaat

De studie ontdekte dat er twee soorten fouten zijn:

  1. De "Verkeerde Boek" Fout (Wholesale Substitution):
    De AI denkt dat hij het juiste artikel heeft gevonden, maar het is eigenlijk een heel ander artikel. Hij schrijft dan de verkeerde auteurs, de verkeerde titel en het verkeerde jaar op. Het is alsof je iemand vraagt om het adres van De Eiffeltoren, en hij geeft je het adres van De Big Ben in Londen, maar zegt dat het in Parijs staat.
  2. De "Kleine Typfout" Fout (Isolated Error):
    De AI heeft het juiste artikel gevonden, maar maakt een klein foutje. Bijvoorbeeld: hij schrijft het verkeerde paginanummer of vergeet een komma in de auteurslijst.

3. De Oplossing: De "Digitale Bibliothecaris" (clibib)

De onderzoekers dachten: "Waarom laten we de AI het adres uit zijn hoofd halen als we een perfecte database hebben?"

Ze bouwden een gratis tool genaamd clibib. Dit is geen AI die denkt; het is een digitale bibliothecaris die direct naar de officiële bronnen (zoals de uitgevers van tijdschriften) kijkt.

Hoe werkt de oplossing?
Ze testten twee manieren om dit te gebruiken:

  • Manier A (De "Doe het zelf" AI): De AI zoekt het op internet, en als hij een link vindt, vraagt hij de bibliothecaris (clibib) om te controleren.
    • Resultaat: Beter, maar de AI maakt soms nog fouten omdat hij de instructies niet goed volgt.
  • Manier B (De "Twee-staps" Methode - De Winnaar):
    1. De AI schrijft eerst zijn versie op (zoals een student die een verslag maakt).
    2. De digitale bibliothecaris (clibib) haalt de perfecte, officiële gegevens op.
    3. De AI krijgt dan de opdracht: "Kijk naar je versie en de officiële versie. Als de titels overeenkomen, vervang dan al je gegevens door de officiële gegevens."
    • Resultaat: Dit werkt fantastisch! De fouten verdwijnen bijna volledig. De nauwkeurigheid springt van 83% naar 91,5%.

De Analogie:
Stel je voor dat je een verslag schrijft over een gebeurtenis.

  • Slecht: Je schrijft het op basis van je geheugen, en hoopt dat het klopt.
  • Middelmatig: Je zoekt het op Google, maar schrijft het dan zelf over. Je kunt nog steeds een cijfer verkeerd schrijven.
  • Goed (De Twee-staps methode): Je schrijft je versie op. Dan laat je een professionele redacteur (de bibliothecaris) de officiële bron raadplegen. Die redacteur zegt: "Je had het juiste onderwerp, maar hier zijn de exacte cijfers. Gebruik deze." Jij plakt de officiële cijfers in je verslag. Klaar!

4. Waarom is dit belangrijk?

In de wetenschap zijn citaten heilig. Als een AI een verkeerd citaat in een artikel zet, kan dat leiden tot:

  • Verkeerde conclusies in nieuw onderzoek.
  • Mensen die niet kunnen vinden waar de informatie vandaan komt.
  • Een "domino-effect" van fouten in de wetenschappelijke wereld.

De boodschap van dit onderzoek is simpel: Vertrouw niet blind op AI voor het opschrijven van bronnen. Gebruik AI om het werk te doen, maar laat een betrouwbare, digitale bibliothecaris de feiten controleren voordat je het publiceert.

Kort samengevat:
AI's zijn slim, maar ze zijn niet perfect in het onthouden van feiten. Door ze te laten samenwerken met een tool die direct naar de officiële bronnen kijkt (en dit in twee stappen te doen), kunnen we de fouten bijna volledig elimineren. Het is als het hebben van een slimme assistent die een perfecte controleur naast zich heeft staan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →