HalluHard: A Hard Multi-Turn Hallucination Benchmark
Het artikel introduceert HalluHard, een uitdagende multi-turn hallucinatie-benchmark over vier hoogwaardige domeinen die gebruikmaakt van een geautomatiseerde, op webzoekopdrachten gebaseerde beoordelingspijplijn om te onthullen dat zelfs de meest geavanceerde taalmodellen doorgaan met het produceren van significante ongegronde feitelijke beweringen, met name in complexe dialooginstellingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante, snelle onderzoeksassistent inhuurt om je te helpen complexe problemen op te lossen. Je stelt de assistent een vraag, hij geeft een antwoord met een lijst met bronnen, en je stelt een vervolgvraag. Hij blijft praten en bouwt voort op wat hij net heeft gezegd.
Het probleem? Deze assistent is een meester in zelfverzekerde fabricage. Ze klinken ongelooflijk overtuigend, maar ze verzinnen vaak feiten, creëren verzonnen bronnen of verdraaien de waarheid om hun verhaal te laten passen. Dit wordt "hallucinatie" genoemd.
Hier is de uitsplitsing van wat ze hebben gedaan en gevonden, met behulp van eenvoudige analogieën:
1. Het Probleem: De "Zelfverzekerde Leugenaar"
Eerdere tests waren als het vragen aan de assistent: "Wat is de hoofdstad van Frankrijk?" Als ze het goed wisten, slaagden ze. Maar in de echte wereld zijn gesprekken rommelig. Je stelt een vraag, zij geven antwoord, jij vraagt "Waarom?", zij geven weer antwoord.
- Het Probleem: Naarmate het gesprek langer wordt, raakt de assistent in de war. Ze kunnen een kleine fout maken in de eerste beurt, en in de tweede beurt bouwen ze hun hele nieuwe antwoord op die fout voort. Het is als een spelletje "Telefoontje" waarbij de boodschap vervormd raakt, maar de assistent volhardt dat de vervormde versie de waarheid is.
- Het Gat: Oude tests waren te makkelijk. Ze vingen deze "langlopende leugens" niet op.
2. De Oplossing: De "HALLUHARD" Test
De onderzoekers bouwden een nieuwe, brute examen met 950 moeilijke vragen in vier gebieden met hoge inzet:
- Juridisch: "Is deze getuigenverklaring toelaatbaar?"
- Onderzoek: "Hoe gaat deze specifieke medische studie om met gegevens?"
- Medisch: "Wat zeggen de richtlijnen over dit medicijn?"
- Coderen: "Schrijf code om X te doen."
De Twist: De assistent moet een citatie (een bron) leveren voor elk feit dat ze beweren.
- De Catch: De onderzoekers controleerden niet alleen of de citatie er echt uitzag. Ze bouwden een speciale "Judge Robot" die daadwerkelijk op pad gaat, het volledige document (zelfs PDF's!) vindt, het leest en controleert: Zei de bron echt wat de assistent beweerde?
3. De "Judge Robot" (Het Nieuwe Gereedschap)
Stel je een bibliothecaris voor die niet alleen naar de cover van het boek of een samenvatting kijkt.
- Oude Rechters: Zij keken naar een kort fragment (zoals een Google-zoekresultaat preview). Als het fragment vaag overeenkwam, zeiden ze: "Ziet er goed uit!"
- De HALLUHARD Judge: Deze opent het volledige boek, leest het specifieke hoofdstuk en controleert de kleine lettertjes.
- Scenario: De assistent zegt: "Pagina 45 zegt X." De Judge opent de PDF, gaat naar Pagina 45 en ziet dat de tekst eigenlijk "Y" zegt.
- Resultaat: De assistent wordt betrapt op liegen, ook al citeerden ze een echt boek.
4. Wat Ze Vonden (De Resultaten)
Ze testten de slimste AI-modellen die beschikbaar zijn (zoals GPT-5, Claude Opus, etc.). Hier is het slechte nieuws: Zelfs de slimste modellen liegen nog veel.
De "Web Search" Mythe: Mensen dachten: "Als we de AI internetonderzoek laten gebruiken, zal het stoppen met liegen."
- Realiteit: Zelfs met webonderzoek hallucineerden de beste modellen nog steeds ongeveer 30% van de tijd. Zonder zoekopdracht was het 60%.
- Waarom? De AI vindt het juiste boek, maar leest nog steeds de specifieke paragraaf erin verkeerd. Het is also als het vinden van het juiste tekstboek, maar de verkeerde pagina onthouden.
De "Lange Gesprek" Valstrik:
- In de eerste beurt is de AI oké.
- Tegen de derde beurt gaat het hallucinatiepercentage omhoog. De AI begint te "conditioneren" op zijn eigen eerdere fouten. Het is als een detective die een misdaad oplost, de verdachte fout heeft, en vervolgens de rest van het onderzoek besteedt aan het bewijzen dat die foutieve verdachte schuldig is.
Denken Helpt, Maar Is Geen Magie:
- Modellen die "denken" voordat ze antwoorden (tragere, voorzichtigere modellen) hallucineren minder.
- Echter, ze simpelweg "harder laten denken" lost niet alles op. Soms leidt te veel denken juist tot langere, meer gedetailleerde leugens.
Het "Niche" Probleen:
- Als je iets vraagt over iets dat totaal verzonnen is (zoals een nepberg), geeft de AI vaak toe: "Ik weet het niet."
- Maar als je iets vraagt over iets dat echt maar obscuur is (een paper met slechts 10 citaties), probeert de AI te gokken en liegt hij zelfverzekerd. Ze bevinden zich in een "gevarenzone" waar ze denken dat ze het misschien weten, dus verzinnen ze het maar.
5. Het Verdict
Het paper concludeert dat we deze AI-modellen nog niet simpelweg kunnen vertrouwen als factcheckers.
- Capaciteit is niet genoeg: Grotere, slimmere modellen liegen nog steeds.
- Tools zijn geen wondermiddel: Het geven van een zoekmachine helpt, maar ze worstelen nog steeds met het correct lezen van de volledige tekst.
- De Toekomst: We hebben AI nodig die weet wanneer het iets niet weet. Momenteel zijn ze te gretig om te gokken, vooral wanneer de feiten moeilijk te vinden zijn.
Kortom: HALLUHARD is een stresstest die laat zien dat onze meest geavanceerde AI-assistenten nog steeds gevoelig zijn voor het verzinnen van feiten, vooral in lange gesprekken, en dat simpelweg "dingen opzoeken" niet genoeg is om te voorkomen dat ze de details verkeerd krijgen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.