Detecting and Correcting Reference Hallucinations in Commercial LLMs and Deep Research Agents
Dit onderzoek toont aan dat commerciële taalmodellen en diepe onderzoeksagenten vaak hallucinerende of niet-werkende citatie-URL's genereren, maar dat het open-source hulpmiddel `urlhealth` deze fouten effectief kan detecteren en corrigeren door gebruik te maken van de Wayback Machine.
Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme, maar soms een beetje overdreven enthousiaste assistent hebt. Deze assistent kan prachtige rapporten schrijven, complexe vragen beantwoorden en zelfs diepe onderzoeken doen voor je. Maar er is een klein probleem: deze assistent is dol op het uitvinden van bronnen.
Stel je voor dat je vraagt: "Wat is de beste koffie in Amsterdam?"
De assistent schrijft een prachtig antwoord en plakt er direct een link bij: "Kijk hier voor meer info: www.de-beste-koffie-amsterdam-2024.nl".
Jij klikt erop, maar de pagina bestaat niet. De link is dood. Of erger: de assistent heeft die link gewoon bedacht, alsof het een sprookje is.
Dit is precies waar dit wetenschappelijke onderzoek over gaat. De auteurs hebben gekeken naar de "grote slimme computers" (zoals die van Google, OpenAI en Anthropic) en hebben gecheckt: hoe vaak liegen ze over de links die ze geven?
Hier is de samenvatting in gewone taal, met een paar creatieve vergelijkingen:
1. Het "Geestelijke" Probleem (Hallucinaties)
De onderzoekers hebben 10 verschillende AI-modellen getest. Ze ontdekten dat tussen de 3% en 13% van de links die deze AI's geven, volledig verzonnen zijn.
- De analogie: Het is alsof je een reisgids koopt die je vertelt dat er een prachtig hotel bestaat in een dorpje, maar als je erheen gaat, staat er alleen een veld met paarden. De AI heeft het hotel niet gevonden; het heeft het gewoon bedacht in zijn hoofd. Dit noemen ze "hallucinaties".
2. De "Diepe Onderzoekers" zijn de ergste leugenaars
Er zijn twee soorten AI-assistenten:
- De snelle zoekers: Die doen één zoekopdracht en geven een kort antwoord.
- De "Deep Research" agents: Dit zijn de super-krachten. Ze doen urenlang onderzoek, lezen tientallen pagina's en schrijven lange rapporten. Je zou denken dat ze het beste zijn, maar...
- De verrassing: Deze "Deep Research" agents maken veel meer fouten met hun links dan de gewone zoekers. Omdat ze zo veel links proberen te genereren (soms honderden per vraag), vinden ze er ook veel meer die niet bestaan.
- De les: Hoe meer links je geeft, hoe groter de kans dat je er een paar verzonnen bijmixt. Kwaliteit gaat niet automatisch samen met kwantiteit.
3. Het Verschil tussen "Dood" en "Verzonnen"
Niet alle dode links zijn leugens. De onderzoekers maakten een belangrijk onderscheid:
- Stale URLs (Verouderd): De link bestond vroeger, maar de website is nu gesloten of verhuisd. Dit is als een oude krant die je in de prullenbak hebt gegooid. De informatie was ooit waar, maar is nu "link rot" (linkrot).
- Hallucinated URLs (Verzonnen): Deze link heeft nooit bestaan. Er is geen enkele archiefkopie van. Dit is als een adres dat de AI uit zijn duim zuigt.
- De bevinding: Sommige AI's (zoals die van Google) maken vooral "verouderde" fouten (ze vinden wel iets, maar het is weg). Andere AI's (zoals sommige OpenAI-modellen) maken bijna alleen maar "verzonnen" fouten. Als ze een link geven die niet werkt, is die in die gevallen 100% verzonnen.
4. Het Onderwerp maakt uit
Sommige vakgebieden zijn lastiger dan anderen.
- Zakelijk & Techniek: Hier werken de AI's het beste. De websites zijn stabiel en makkelijk te vinden.
- Theologie & Gezondheidszorg: Hier gaat het vaak mis. Waarom? Omdat deze websites vaak veranderen, moeilijk te vinden zijn of zeer specifiek zijn. Het is alsof je probeert een speld te vinden in een hooiberg die voortdurend van vorm verandert.
5. De Oplossing: De "Link-Check" Tool
De onderzoekers hebben niet alleen gekeken naar het probleem, maar ook een oplossing bedacht. Ze hebben een gratis, open-source tool gemaakt die urlhealth heet.
- Hoe het werkt: Stel je voor dat je een assistent hebt die zijn werk controleert voordat hij het aan jou geeft. Deze tool kijkt naar elke link die de AI heeft gemaakt en zegt: "Hee, deze bestaat niet!" of "Deze is dood, zoek een nieuwe!".
- Het resultaat: Als je deze tool gebruikt als een "controleur" voor de AI, daalt het aantal dode of verzonnen links met 6 tot 79 keer. De AI wordt dan bijna perfect betrouwbaar.
- De voorwaarde: De AI moet wel slim genoeg zijn om naar de controleur te luisteren. Sommige kleinere AI's proberen de controleur te negeren en blijven maar dezelfde foute links aanvoeren.
Conclusie
Dit onderzoek zegt ons twee belangrijke dingen:
- Wees kritisch: Als een AI je een link geeft, ga er niet blind op af. De kans is groot dat de link niet werkt of verzonnen is, vooral als de AI een heel lang rapport heeft geschreven.
- Er is hoop: We kunnen AI's veel betrouwbaarder maken door ze een "link-checker" te geven. Het is niet de schuld van de AI dat ze liegen; het is een gebrek aan controle. Met de juiste hulpmiddelen kunnen we zorgen dat de informatie die we krijgen, echt bestaat.
Kortom: De AI is een briljante schrijver, maar soms een slechte bibliograaf. Geef haar een goede controleur, en dan is ze onverslaanbaar.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.