Popular but Wrong: Understanding and Mitigating LLM Overconfidence through Knowledge Popularity
Dit artikel onthult dat grote taalmodellen overmoed vertonen bij onjuiste antwoorden wanneer die antwoorden zeer populair zijn of vaak samen voorkomen met de zoekopdracht, en demonstreert dat het opnemen van signalen over de populariteit van kennis de overmoed effectief vermindert terwijl de nauwkeurigheid van de vertrouwensinschatting aanzienlijk wordt verbeterd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de stille brom van een serverpark is een nieuw soort intelligentie opgekomen, een die poëzie kan schrijven, vergelijkingen kan oplossen en vragen kan beantwoorden met een vloeiendheid die bijna menselijk aanvoelt. Deze grote taalmodellen zijn getraind op enorme oceanen van tekst, waarbij ze leren om het volgende woord in een zin te voorspellen door patronen in menselijke kennis te herkennen. Maar er is een addertje onder het gras: deze machines "weten" feiten niet echt zoals wij dat doen. Ze hebben geen geheugen van de wereld, alleen een statistisch besef van welke woorden gewoonlijk samen voorkomen. Wanneer ze het niet zeker weten, geven ze dat vaak niet toe. In plaats daarvan produceren ze regelmatig onjuiste antwoorden met absolute zekerheid, een fenomeen dat onderzoekers overmoed noemen. Dit is een kritiek probleem voor iedereen die op deze hulpmiddelen vertrouwt voor veiligheid, geneeskunde of financiën, omdat een zelfverzekerde leugen veel gevaarlijker is dan een aarzelende waarheid. De kernvraag voor wetenschappers is geweest waarom deze modellen hun eigen fouten zo diep vertrouwen. Is het een willekeurige glitch, of is er een verborgen patroon in hoe ze leren dat hen zeker maakt van de verkeerde dingen?
Een team van onderzoekers ging op zoek naar het antwoord op dit mysterie door te kijken naar het concept van populariteit. Ze vroegen zich af of de modellen simpelweg de voorkeur gaven aan antwoorden die beroemd of veel voorkomend waren in hun trainingsdata, zelfs wanneer die antwoorden onjuist waren voor de specifieke vraag die gesteld werd. Om dit te testen, richtten ze zich op een specifiek type taak: feitelijke vragen over entiteiten uit de echte wereld, zoals vragen wie een specifieke film heeft geregisseerd of waar een basketballer is geboren. Ze verzamelden duizenden van deze vragen en vergeleken de juiste antwoorden met de onjuiste antwoorden die de modellen genereerden. Ze maten de "populariteit" van de betrokken personen en plaatsen door te tellen hoe vaak links naar hen wezen op het internet en hoe vaak zij samen in geschreven documenten voorkwamen. Deze aanpak stelde hen in staat om te zien of de modellen naar de meest bekende namen neigden in plaats van naar de juiste.
De onderzoekers ontdekten dat wanneer deze modellen fouten maken, hun fouten verre van willekeurig zijn. In plaats van obscure of onwaarschijnlijke namen te raden, hebben de modellen de neiging om antwoorden te hallucineren die populairder zijn dan de correcte feiten. Als een model bijvoorbeeld niet weet wie de regisseur van een minder bekende film is, is het eerder geneigd om met veel zelfvertrouwen een beroemde regisseur te noemen die het vele malen heeft gezien, in plaats van een willekeurige onbekende. Bovendien kiezen de modellen vaak voor antwoorden die vaak in dezelfde zinnen voorkomen als de vraag, zelfs als die connectie onjuist is. Een model kan een vraag over een filmregisseur beantwoorden door de producent te noemen, simpelweg omdat die twee rollen vaak samen worden genoemd in artikelen. De studie vond dat deze populaire maar onjuiste alternatieven niet alleen algemeen voorkomen, maar ook degenen zijn die het model het meest vertrouwt. Zelfs wanneer het antwoord onjuist is, kent het model een hoger niveau van vertrouwen toe aan het populaire, bekend klinkende antwoord dan aan een minder beroemd, correct antwoord.
Dit patroon houdt stand bij verschillende soorten vragen en verschillende groottes van modellen, wat wijst op een fundamenteel gebrek in de manier waarop deze systemen kennis verwerken. De onderzoekers ontdekten dat hoe vaker een stuk informatie wordt herhaald in de trainingsdata, hoe groter de kans dat het model dit genereert en hoe zekerder het model zal zijn, ongeacht of het het juiste antwoord is voor de specifieke query. Dit creëert een gevaarlijke feedbackloop waarbij het meest bekende onjuiste antwoord wordt behandeld als de meest waarschijnlijke waarheid. De studie benadrukt dat aanzienlijke hiaten in domeinkennis gepaard gaan met een nog sterkere populariteits-gebiaste generatie, wat betekent dat wanneer modellen minder weten over een specifiek onderwerp, ze eerder vertrouwen op bekende maar onjuiste associaties. De bevindingen onthullen sterke systematische associaties tussen populariteit en overmoed, hoewel de onderzoekers opmerken dat dit correlaties zijn en geen causaliteiten, wat betekent dat ze een duidelijke link laten zien zonder te bewijzen dat populariteit alleen de overmoedige voorspellingen veroorzaakt.
Om dit aan te pakken, ontwikkelden de onderzoekers een methode om de modellen te helpen herkennen wanneer hun vertrouwen mogelijk onterecht is. Ze creëerden een systeem dat kijkt naar de populariteit van het antwoord en de relatie tussen de vraag en het antwoord voordat het de vertrouwensscore van het model accepteert. Door mee te wegen hoe populair het antwoord is en hoe vaak het met de vraag voorkomt, kan het systeem het vertrouwen van het model naar beneden bijstellen wanneer het te zeker is van een populair maar waarschijnlijk onjuist antwoord. Toen ze deze aanpak testten op zes verschillende modellen, waren de resultaten opmerkelijk. Het gemiddelde vertrouwen dat de modellen aan hun onjuiste antwoorden hechtten, daalde drastisch, van een hoge 0,765 naar 0,254. Tegelijkertijd verbeterde de algehele nauwkeurigheid van het vertrouwen van het model aanzienlijk, wat betekent dat het model veel beter werd in weten wanneer het gelijk had en wanneer het ongelijk had.
De studie concludeert dat populariteit een belangrijke drijfveer is van overmoed in kunstmatige intelligentie. De modellen raden niet alleen; ze volgen een pad van de minste weerstand naar de meest bekende namen en associaties. Door dit vooroordeel te begrijpen, is het mogelijk om betere waarborgen te bouwen die voorkomen dat deze systemen autoritair klinken wanneer ze eigenlijk onjuist zijn. De onderzoekers merkten op dat hoewel hun werk zich richtte op feitelijke vragen over specifieke entiteiten, het principe waarschijnlijk zich uitstrekt naar andere gebieden waar de modellen mogelijk voorkeurs patronen boven specifieke waarheden verkiezen. Ze erkenden ook dat hun maten van populariteit gebaseerd waren op publieke internetdata, wat dient als een proxy voor wat de modellen tijdens hun training zagen, en dat de relatie die ze vonden een sterke correlatie is en geen bewezen oorzaak-gevolgrelatie. Desalniettemin biedt het vermogen om deze populariteitssignalen te gebruiken om de overmoed van de machine te temperen een praktische stap naar het betrouwbaarder en vertrouwwaardiger maken van deze krachtige hulpmiddelen voor dagelijks gebruik.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.