Customized large language models can outperform Community Notes in correcting misinformation
Het artikel introduceert MUSE, een op maat gemaakt framework voor grote taalmodellen dat vertrouwensbewuste retrieval en multimodale redenering integreert om Community Notes te overtreffen in het identificeren en corrigeren van misinformatie over diverse soorten inhoud, waardoor zowel de kwaliteit van de respons als de herkenning van valse informatie door gebruikers wordt verbeterd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het digitale publieke plein is overvol met een hardnekkig probleem: valse informatie die sneller verspreidt dan de waarheid. Op sociale media kan een enkele misleidende post miljoenen mensen bereiken voordat iemand de kans krijgt om het te verifiëren. Jarenlang was de primaire verdediging hiertegen menselijke inspanning. Crowdsourced systemen, waarbij vrijwilligers aantekeningen schrijven om valse claims te corrigeren, zijn een standaardinstrument voor platforms geworden. Deze aantekeningen zijn waardevol omdat ze worden geschreven door mensen die kunnen bijdragen met context en nuance, maar ze hebben een aanzienlijk zwak punt: ze zijn traag. Tegen de tijd dat een vrijwilliger een correctie heeft geschreven, kan de misleidende post al schade hebben aangericht. Bovendien kunnen menselijke vrijwilligers niet elke post controleren, waardoor grote hoeveelheden misinformatie ongecontroleerd blijven.
Wetenschappers kijken al lang naar kunstmatige intelligentie om dit gat op te vullen, in de hoop dat machines leugens net zo snel kunnen opsporen als ze zich verspreiden. Standaard AI-modellen worstelen echter vaak met deze taak. Ze zijn getraind op oude gegevens en kunnen gebeurtenissen die nú plaatsvinden niet zien. Ze kunnen ook "hallucineren", door feiten te verzinnen of bronnen aan te halen die niet bestaan. De uitdaging is niet alleen om een machine te bouwen die kan lezen, maar om een machine te bouwen die kan verifiëren, kan redeneren over verschillende soorten media zoals tekst en afbeeldingen, en dat te doen zonder nieuwe fouten of vooroordelen te introduceren. Het doel is een systeem dat fungeert als een onvermoeibare, onpartijdige factchecker, klaar om te reageren op het moment dat een verdachte post verschijnt.
Een team onderzoekers aan de University of Washington heeft een nieuw systeem ontwikkeld genaamd MUSE om precies dit probleem aan te pakken. MUSE is een op maat gemaakt kunstmatige intelligentie-framework ontworpen om misinformatie in realtime te identificeren en te corrigeren. In tegen tegenstelling tot oudere modellen die uitsluitend vertrouwen op wat ze in het verleden hebben geleerd, is MUSE uitgerust met een mechanisme om het live web te doorzoeken naar actuele bewijslast. Wanneer het een social media-post tegenkomt, raadt het niet alleen iets; het breekt de inhoud af, zoekt naar geloofwaardige informatie om de claims te ondersteunen of te weerleggen, en schrijft vervolgens een correctie die gebaseerd is op dat bewijs. Het systeem is ontworpen om complexe posts te verwerken die tekst met afbeeldingen mengen, waardoor het alles kan verifiëren van een bijschrift tot een foto.
Om te testen of deze aanpak daadwerkelijk werkt, vergeleken de onderzoekers MUSE met de beste door mensen geschreven correcties die momenteel beschikbaar zijn op het platform X, voorheen bekend als Twitter. Ze verzamelden honderden echte posts, sommige met duidelijke leugens, andere met subtiele misleidende details, en sommige die volledig accuraat waren. Voor elke post zetten ze de reactie van de AI af tegen hoogwaardige aantekeningen geschreven door menselijke vrijwilligers en gemiddelde aantekeningen geschreven door minder ervaren gebruikers. De evaluatie was rigoureus en omvatte een panel van professionele factcheckers die de reacties scoorden op dertien verschillende criteria. Deze experts keken naar de vraag of het systeem de onjuiste delen correct identificeerde, of de uitleg logisch was en of de geciteerde bronnen betrouwbaar waren en daadwerkelijk bestonden.
De resultaten toonden een duidelijk voordeel voor het nieuwe systeem. MUSE produceerde reacties die door experts als aanzienlijk kwalitatief beter werden beoordeeld dan zelfs de beste door mensen geschreven aantekeningen. Op een schaal van tien scoorde de AI gemiddeld een 8,1, terwijl de best beoordeelde menselijke aantekeningen gemiddeld een 6,3 scoorden. Dit verschil was niet slechts een kwestie van stijl; de AI was nauwkeuriger in het opsporen van de specifieke onderdelen van een post die misleidend waren. Terwijl standaard AI-modellen vaak falen in het identificeren van het probleem of feiten verzinnen, identificeerde MUSE bijna 90 procent van de gevallen de onjuistheden correct en legde deze uit. Het leverde ook links naar bronnen die bijna altijd bereikbaar en relevant waren, terwijl standaardmodellen regelmatig gebroken of neplinks citeerden. Het systeem presteerde breed goed en ging even goed om met posts over politiek, gezondheid en actuele gebeurtenissen, en vertoonde niet de politieke bias die andere AI-systemen soms teistert.
De onderzoekers wilden ook weten of mensen een correctie van een machine wel zouden vertrouwen. Ze voerden een studie uit met bijna duizend deelnemers, waarbij ze hen de misleidende posts en de door AI gegenereerde correcties lieten zien. De resultaten waren bemoedigend: na het lezen van de uitleg van de AI waren deelnemers aanzienlijk beter in staat om te herkennen dat de oorspronkelijke post misleidend was. Hun geloof in de valse claim nam af. Echter, geen van de correcties had een significant effect op de intentie van deelnemers om de misinformatie te delen, die over het algemeen laag bleef. Interessant genoeg had het vertellen van mensen dat de correctie afkomstig was van kunstmatige intelligentie geen invloed op hun bereidheid om de AI te vertrouwen. De effectiviteit van het systeem bleef hoog, of de bron nu werd onthuld of verborgen, wat suggereert dat de kwaliteit van de uitleg belangrijker is dan de identiteit van de schrijver.
Een van de belangrijkste aspecten van dit werk is hoe het systeem omgaat met het onbekende. De onderzoekers ontdekten dat MUSE niet hoeft te vertrouren op vooraf bestaande factchecks om zijn werk te doen. Zelfs voor posts die nog nooit door iemand waren gecontroleerd, kon het systeem verse bewijslast op het web vinden en een betrouwbare correctie construeren. Het slaagde er ook in dit snel te doen, waarbij het een volledige reactie genereerde in ongeveer twee minuten op standaard computerhardware. De kosten om het systeem te draaien zijn ook laag, ongeveer 0,2 USD per post, wat veel goedkoper is dan het betalen van menselijke vrijwilligers om elk stuk content te beoordelen.
De studie kent wel degelijk beperkingen. Het systeem werkt momenteel met tekst en afbeeldingen, maar kan nog geen video analyseren. Het is ook afhankelijk van de aanwezigheid van geloofwaardige informatie online; als een post gaat over een actuele gebeurtenis waarbij nog geen betrouwbare bronnen over hebben gerapporteerd, is het systeem ontworpen om onzekerheid toe te geven in plaats van te gokken. De onderzoekers testten het systeem op één enkel platform, en hoewel dat platform wijdverbreid wordt gebruikt, kunnen de resultaten elders variëren. Ondanks deze grenzen bieden de bevindingen een veelbelovend pad voorwaarts. Door de snelheid van machines te combineren met het vermogen om te zoeken naar en te verifiëren van bewijslast uit de echte wereld, demonstreert MUSE dat we hulpmiddelen kunnen bouwen die mensen helpen het onderscheid te maken tussen waarheid en onwaarheid op de schaal en snelheid die vereist is door het moderne internet. Het werk suggereert dat de toekomst van de strijd tegen misinformatie niet een keuze is tussen mensen en machines, maar een systeem waarbij machines het zware werk van verificatie afhandelen, zodat menselijk oordeel zich kan richten op de meest complexe gevallen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.