Can Humans Dream of Electric Sheep? Human-Written Samples for Fine-Grained Vision-and-Language Hallucination Benchmarking
Dit artikel introduceert een fijnmazige, meertalige benchmark voor het detecteren van hallucinaties in visie-en-taal, waarbij wordt aangetoond dat door mensen geschreven monsters dienen als een levensvatbaar, model-agnostisch alternatief voor door modellen gegenereerde data door een hogere annotatieovereenstemming en betere controle te bieden terwijl de distributionele gelijkenis behouden blijft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat het internet een enorme, drukke bibliotheek is waar zojuist een nieuw soort bibliothecaris is gearriveerd. Deze bibliothecarissen zijn kunstmatige intelligentie (AI)-modellen, specifiek van die modellen die afbeeldingen kunnen "zien" en ze in zinnen kunnen "voorlezen". Ze zijn ongelooflijk snel en getalenteerd, maar ze hebben een vreemde gewoonte: soms beschrijven ze met vol vertrouwen dingen die er helemaal niet zijn. In de wereld van computerwetenschappen wordt dit een "hallucinatie" genoemd. Het is alsof een bibliothecaris naar een foto van een kat kijkt en er met vol overtuiging op staat dat de kat een klein hoedje draagt en een kopje koffie vasthoudt, terwijl de foto in werkelijkheid niets anders laat zien.
Dit is een groot probleem, want als we de AI-bibliothecarissen niet kunnen vertrouwen in wat ze zeggen, kunnen we ze ook niet gebruiken om ons te helpen echte informatie te vinden. Om dit op te lossen, moeten wetenschappers een manier vinden om te testen of hun "hallucinatie-detectors" (programma's ontworpen om deze leugens te ontdekken) daadwerkelijk werken. Maar hier zit de crux: de meeste tests zijn gebouwd met voorbeelden die gegenereerd zijn door precies die AI-modellen die ze proberen te testen. Het is alsof je probeert een student te leren nepnieuws te herkennen door alleen maar nepnieuws te laten zien dat geschreven is door andere studenten die misschien wel grapjes uithalen. De test kan dan eindigen met het meten van hoe goed de detector de specifieke trucjes van één specifieke student herkent, in plaats van hoe goed hij algemene leugens opspoort. Omdat AI-modellen elke paar maanden veranderen en slimmer worden, worden deze oude tests nutteloos, zoals het testen van een nieuwe automotor met een kaart van tien jaar geleden.
Dit is waar het artikel "Can Humans Dream of Electric Sheep?" om de hoek komt kijken. De onderzoekers stelden een eenvoudige, gedurfde vraag: Wat als we stoppen met het gebruik van AI om de testvragen te maken en in plaats daarvan mensen vragen om de valse verhalen te schrijven? Ze wilden weten of een mens een hallucinatie kon verzinnen die precies lijkt op een fout van een AI, maar zonder de bagage van afhankelijkheid van een specifiek, snel veranderend computerprogramma.
Om dit te onderzoeken, bouwde het team een enorme collectie testgevallen genaamd SHEEP (wat staat voor Set for Human-written and Electronic Erroneous Productions). Ze verzamelden in totaal 20.000 monsters. Ongeveer 18.400 hiervan werden gegenereerd door vijf verschillende AI-modellen die naar diverse afbeeldingen keken. De resterende 1.600 monsters werden geschreven door mensen die dezelfde afbeeldingen kregen en de opdracht kregen om doelbewust leugens over hen te verzinnen, waarbij ze de soorten fouten nabootsten die AI maakt. Ze dekten vier talen: Engels, Chinees, Frans en Italiaans.
De onderzoekers onderwierpen deze monsters vervolgens aan de test. Ze lieten menselijke experts naar alle 20.000 items kijken en markeerden exact waar de leugens zaten. Ze ontdekten dat wanneer mensen de hallucinaties schreven, de experts veel vaker het eens waren over wat een leugen was en wat niet, vergeleken met wanneer zij AI-gegenereerde monsters beoordeelden. Het lijkt erop dat wanneer mensen opzettelijk een fout maken, ze dat op een zeer duidelijke, consistente manier doen. In tegenstelling hiermee waren de AI-gegenereerde monsters wat rommeliger, waarbij experts vaker van mening verschilden over of een specifieke zin daadwerkelijk een hallucinatie was of slechts een vreemde formulering.
Cruciaal is dat de studie suggereert dat deze door mensen geschreven monsters een levensvatbaar substituut zijn voor de door AI gegenereerde exemplaren. Hoewel de mensen de leugens schreven, was de "smaak" van de fouten statistisch gezien vergelijkbaar met de fouten gemaakt door de AI-modellen. Wanneer de onderzoekers hun hallucinatie-detectors testten op de door mensen geschreven data, waren de resultaten zeer vergelijkbaar met de resultaten die ze kregen bij het testen op de AI-data. Dit suggereert dat we niet langer afhankelijk hoeven te zijn van een specifiek AI-model om onze tests te creëren.
Het artikel betoogt dat het gebruik van door mensen geschreven monsters een slimme zet is omdat het de tests stabieler maakt. Omdat mensen niet elke paar maanden hun schrijfstijl veranderen zoals AI-modellen dat doen, zullen deze tests niet zo snel verouderd raken. Het is alsof je de remmen van een auto test op een circuit dat elke week verandert, versus het testen op een weg die hetzelfde blijft. De onderzoekers ontdekten dat hoewel menselijke monsters qua stijl iets verschillen van AI-monsters, dit verschil niet groter is dan de natuurlijke verschillen die je ziet tussen verschillende AI-modellen zelf.
Kortom, het artikel suggereert dat we menselijke voorbeelden kunnen vertrouwen om betere detectoren voor AI-leugens te bouwen. Het is een manier om ervoor te zorgen dat we de capaciteit van de AI testen om de waarheid te spreken, in plaats van alleen te testen hoe goed hij een specifieke, verouderde test kan slim af zijn. Hoewel de studie niet beweert dat dit de perfecte, definitieve oplossing is, wijst het bewijs er sterk op dat door mensen geschreven data een betrouwbaar, langdurig hulpmiddel zijn om de AI-bibliothecarissen eerlijk te houden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.