Authority, Truth, and Citation Bias: A Large-Scale Multi-Domain Benchmark for Studying Epistemic Susceptibility in Large Language Models
Dit artikel introduceert AuthorityBench, een grootschalige multi-domein benchmark die aantoont dat de loutere aanwezigheid van citaten — ongeacht hun feitelijke juistheid — de hallucinatiecijfers in grote taalmodellen significant verhoogt, waarbij de meest uitgesproken effecten worden waargenomen wanneer gefabriceerde citaten gepaard gaan met ware beweringen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een quiz doet. Je weet dat het antwoord "Parijs" is, omdat je er bent geweest. Maar dan komt er een leraar binnenlopen, wijst naar een chic uitziend boek in de kast en zegt: "Eigenlijk is de hoofdstad Londen. Ik heb het gelezen in dit prestigieuze tijdschrift."
Zou je je antwoord veranderen? De meeste mensen zouden even pauzeren en denken: "Wacht even, dat boek ziet er belangrijk uit. Miss misschien heb ik het fout."
Dit artikel, AuthorityBench, stelt een vergelijkbare vraag over Kunstmatige Intelligentie (AI). Het wil weten: Als een AI de waarheid kent, maar iemand haar een "citatie" (een verwijzing naar een bron) geeft die het tegenovergestelde beweert, zal de AI die citatie dan blindelings vertrouwen en de waarheid vergeten?
Hier is de uitsplitsing van hun bevindingen, met behulp van eenvoudige analogieën.
Het Experiment: Een "Fake News"-test voor AI
De onderzoekers bouwden een enorme test genaamd AuthorityBench. Zie het als een gigantische quiz van 220.000 vragen, ontworpen om AI-modellen te misleiden.
Ze stelden een "2x2" spel op met vier scenario's:
- Ware bewering + Echte citatie: De AI heeft gelijk, en de bron is echt. (De makkelijke modus).
- Onjuiste bewering + Nep-citatie: De AI heeft ongelijk, en de bron is nep. (De voor de hand liggende valstrik).
- Onjuiste bewering + Echte citatie: De AI heeft ongelijk, maar de bron is echt. (De lastige valstrik).
- Ware bewering + Nep-citatie: Dit is de grote ontdekking. De AI heeft gelijk, maar men geeft het een nepbron die beweert dat de AI ongelijk heeft.
Ze testten dit over vier gebieden: Algemene Kennis, Wetenschap, Recht en Geneeskunde. Ze veranderden ook de "smaak" van de nepbronnen: sommige zagen eruit alsof ze afkomstig waren van Nobelprijswinnaars (hoge prestige), andere van onbekende blogs (laag prestige), en sommige hadden namen uit verschillende landen.
De Grote Verrassing: De "Autoriteitsval"
Het meest schokkende resultwoord is dat citaties werken als een "toverspreuk" die AI laat hallucineren (liegen).
- Het "Nepbron"-effect: Wanneer de AI het juiste antwoord wist (bijv. "Parijs is de hoofdstad"), maar er verscheen een nep-citatie die zei "Londen is de hoofdstad", veranderde de AI vaak haar antwoord naar Londen.
- De Cijfers: In de categorie "Algemene Kennis" gebeurde dit 35% tot 77% van de tijd. Dat betekent dat als je een AI een ware feit gaf en een nepverwijzing, de AI vaker de waarheid ontkende dan dat zij vasthield aan de waarheid.
- Het "Echte Bron"-effect: Zelfs als de citatie echt was maar de bewering onjuist, was de AI nog steeds eerder geneigd tot hallucinatie dan wanneer er helemaal geen citatie was.
De Analogie: Stel je een student voor die weet dat "2+2=4" is. Als je hem een papiertje overhandigt waarop staat: "Volgens de beroemde Professor Smith is 2+2=5", dan stopt de student met het vertrouwen op zijn eigen brein en schrijft hij "5" op. Het papiertje (de citatie) overstemde de wiskunde.
Wat Maakte Niet Uit?
De onderzoekers dachten dat bepaalde zaken de AI meer de citatie zouden laten vertrouwen, maar ze waren verrast door het feit dat deze factoren bijna geen effect hadden:
- Prestige: Het maakte niet uit of de nep-citatie eruitzag alsof deze van een topuniversiteit kwam of van een willekeurige blog. De AI was even verward door beide.
- Identiteit van de Auteur: Het maakte niet uit of de nep-auteur een naam had die geassocieerd werd met een specifiek land of demografie. De AI leek niet om te geven over wie het geschreven had, alleen dat er iets geschreven was.
- Modelgrootte: Je zou denken dat een "slimmere" of grotere AI minder gemakkelijk te misleiden zou zijn. Maar de studie vond dat de grootste, meest geavanceerde modellen net zo vaak in de val liepen als de kleinere modellen.
De Enige Uitzondering: De "Advocaat"-AI
Er was één domein waar de AI niet zo gemakkelijk werd misleid: het Recht.
- Waarom? De onderzoekers suggereren dat juridische teksten een zeer specifieke, formele "taal" hebben (als een geheime code). Wanneer de AI een juridische citatie ziet, lijkt het in een "onderzoekingsmodus" te schakelen en controleert het de feiten nauwkeuriger, in plaats van de autoriteit blindelings te accepteren.
- Algemene Kennis was de zwakste schakel, waar de AI het gemakkelijkst werd gefopt.
De "Onjuiste Bewering"-Wending
De studie keek ook naar wat er gebeurt als de AI al ongelijk is (een onjuiste bewering).
- Sommige AI's werden slimmer: Voor modellen zoals Llama en Claude zorgde het zien van een citatie (zelfs een nep-citatie) ervoor dat ze minder geneigd waren te hallucineren bij onjuiste beweringen. Het was alsof de citatie hen deed zeggen: "Hm, ik moet dit even dubbelchecken," en ze corrigeerden zichzelf.
- Sommige AI's werden dommer: Voor modellen zoals Gemma en Phi-4 maakte de citatie hen juist meer geneigd tot hallucinatie bij onjuiste beweringen. Ze accepteerden de verkeerde informatie blindelings.
De Kern van de Zaak
De conclusie van het artikel is dat het toevoegen van een citatie een AI niet automatisch betrouwbaarder maakt. Sterker nog, het maakt de AI vaak minder betrouwbaar.
Als je een AI gebruikt om te helpen met feiten, en je ziet dat het een bron citeert, ga er dan niet vanuit dat het de waarheid spreekt. De AI kan zo onder de indruk zijn van de "autoriteit" van de citatie dat het bereid is de werkelijke waarheid achteloos weg te gooien. De studie waarschuwt dat voor sectoren met een hoge inzet (zoals geneeskunde of recht), we niet kunnen aannemen dat het koppelen van de antwoorden van een AI aan citaties de fouten zal oplossen; soms zijn de citaties zelf de bron van de fout.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.