← Nieuwste papers
💬 NLP

Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Language Models

Deze survey analyseert 134 papers en introduceert een uniforme taxonomie voor evidence-based tekstgeneratie met grote taalmodellen, met als doel de versnippering in terminologie en evaluatie te overbruggen en toekomstige richtingen voor betrouwbaarheid en traceerbaarheid aan te geven.

Oorspronkelijke auteurs: Tobias Schreieder, Tim Schopf, Michael Färber

Gepubliceerd 2026-04-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tobias Schreieder, Tim Schopf, Michael Färber

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar soms wat dromerige robot hebt die alles kan schrijven. Je vraagt hem: "Wie was de eerste president van de Verenigde Staten?" en hij antwoordt: "George Washington." Dat is goed. Maar als je vraagt: "Wat is de exacte datum van zijn verjaardag?" en hij zegt: "1732," zonder te weten waar hij dat vandaan heeft, dan is dat gevaarlijk. De robot kan namelijk ook zomaar iets verzonnen. Dit noemen we in de tech-wereld "hallucineren".

Deze paper, geschreven door Tobias, Tim en Michael, is als een grote inventarisatie van hoe we die robot kunnen dwingen om altijd zijn bronnen te noemen. Het is alsof we de robot een "werkboek" geven waarin hij elke keer dat hij een feit schrijft, ook de pagina van het boek moet aangeven waar hij het vandaan heeft.

Hier is een simpele uitleg van wat ze hebben ontdekt, met behulp van alledaagse vergelijkingen:

1. Het Probleem: De "Dromerige" Robot

Grote taalmodellen (zoals ChatGPT) zijn geweldig in het schrijven van verhalen, maar ze zijn soms te zelfverzekerd. Ze kunnen feiten verdraaien of zomaar dingen uit hun duim zuigen. Om mensen te vertrouwen, moeten we kunnen zien: "Waar heb je dit vandaan?"

De auteurs hebben 134 verschillende onderzoeken bestudeerd om te kijken hoe wetenschappers proberen deze robots "eerlijk" te maken door bronvermelding (citaties, verwijzingen) in te bouwen.

2. De Drie Manieren om Bronnen te Nemen

De paper beschrijft drie manieren waarop robots hun bronnen tonen, net als drie verschillende manieren om een verslag te maken:

  • Citaties (De Voetnoot): De robot schrijft een zin en plaatst er direct een klein getal achter, zoals [1]. Aan het einde van het stuk staat dan een lijstje met de bronnen. Dit is de meest gebruikte methode (zoals in een schoolopdracht).
  • Attributie (De Verwijzing): De robot zegt niet alleen "dit staat in boek X", maar koppelt de hele zin direct aan de bron. Het is alsof hij zegt: "Volgens de krant van gisteren..."
  • Quotaties (Het Directe Citaat): De robot plakt letterlijk een stukje tekst uit de bron in zijn antwoord, tussen aanhalingstekens. Dit is het meest eerlijke, maar ook het minst flexibele.

3. De Twee Grote Strategieën: "Vanbinnen" vs. "Vanbuiten"

De onderzoekers hebben ontdekt dat er twee hoofdstijlen zijn om deze robots bronnen te laten gebruiken:

  • De "Geheugen" Methode (Parametrisch): De robot probeert het antwoord uit zijn eigen hoofd te halen. Hij heeft de feiten al "ingebouwd" tijdens zijn training.
    • Vergelijking: Het is alsof je een student laat examen doen zonder naslagwerk. Hij moet het uit zijn hoofd weten. Dit werkt goed voor algemene kennis, maar als hij een fout maakt, kun je het niet controleren.
  • De "Boek" Methode (Niet-parametrisch): De robot zoekt eerst in een bibliotheek (internet of documenten) naar het antwoord en schrijft het pas daarna op.
    • Vergelijking: Dit is als een student die tijdens het examen mag naslaan in een boek. Hij pakt het boek, zoekt het op, en schrijft het op met de pagina erbij. Dit is momenteel de meest populaire en betrouwbare methode.

4. Wat Werkt Het Best? (De Grote Ontdekkingen)

De auteurs hebben een enorme lijst gemaakt van alle methoden die er zijn. Hier zijn de belangrijkste conclusies, vertaald naar gewoon Nederlands:

  • Tekst is Koning: 96% van de robots gebruikt alleen tekst als bron. Ze kijken nog bijna nooit naar plaatjes, grafieken of tabellen. Het is alsof we een kok die alleen met groenten werkt, maar we hem vragen om ook vis te koken. Dat moet nog veel beter.
  • Zoekmachine is de Baas: De meeste succesvolle systemen werken als een zoekmachine: eerst zoeken, dan schrijven. Dit heet "Retrieval-Augmented Generation" (RAG). Het is de huidige standaard.
  • De "Jury" is nog niet klaar: Om te testen of een robot goed werkt, gebruiken wetenschappers veel verschillende meetlatjes. Maar er is nog geen enkele "standaard meetlat" die iedereen gebruikt. Het is alsof elke school zijn eigen cijfersysteem heeft; dat maakt vergelijken lastig.
  • Mensen vs. Robots: Om te checken of een antwoord waar is, gebruiken we vaak nog steeds mensen (een jury). Robots die andere robots beoordelen ("LLM-as-a-judge") zijn in opkomst, maar zijn nog niet perfect.

5. De Toekomst: Wat Moeten We Nog Leren?

De paper sluit af met een aantal wensen voor de toekomst:

  1. Meer dan alleen tekst: Robots moeten leren om ook naar plaatjes en grafieken te kijken en die correct te citeren.
  2. Betere meetlatjes: We hebben één grote, eerlijke test nodig om te zien welke robot het beste bronnen gebruikt.
  3. Uitleggen waarom: Het is niet genoeg om alleen een bron te noemen. De robot moet ook kunnen uitleggen waarom hij die bron heeft gekozen. (Bijvoorbeeld: "Ik koos dit artikel omdat het de meest recente data heeft.")

Samenvatting in één zin

Deze paper is een gids voor het bouwen van betrouwbare robots: het laat zien dat we robots moeten dwingen om hun "werkboek" (bronnen) open te houden, dat we dit momenteel het beste doen door ze eerst te laten zoeken en dan te laten schrijven, en dat we nog veel moeten leren over hoe we dit allemaal eerlijk kunnen testen.

Het is een stap in de richting van een internet waar je kunt zeggen: "Ik geloof je, want ik zie precies waar je het vandaan hebt."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →