Customized large language models can outperform Community Notes in correcting misinformation
Il documento presenta MUSE, un framework di modelli linguistici di grandi dimensioni personalizzato che integra il recupero consapevole della fiducia e il ragionamento multimodale per superare Community Notes nell'identificare e correggere la disinformazione attraverso diversi tipi di contenuti, migliorando così sia la qualità della risposta che il riconoscimento da parte dell'utente delle informazioni false.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
La piazza pubblica digitale è affollata di un problema persistente: le informazioni false che si diffondono più velocemente della verità. Sui social media, un singolo post fuorviante può raggiungere milioni di persone prima che chiunque abbia la possibilità di verificarlo. Per anni, la difesa principale contro questo fenomeno è stata l'impegno umano. I sistemi basati sul crowdsourcing, in cui i volontari scrivono note per correggere le affermazioni false, sono diventati uno strumento standard per le piattaforme. Queste note sono preziose perché sono scritte da persone che possono intervenire con contesto e sfumature, ma hanno un punto debole significativo: sono lente. Nel momento in cui un volontario scrive una correzione, il post fuorviante può aver già fatto il suo danno. Inoltre, i volontari umani non possono coprire ogni singolo post, lasciando vaste quantità di disinformazione non controllate.
Gli scienziati guardano da tempo all'intelligenza artificiale per colmare questa lacuna, sperando che le macchine possano individuare le bugie con la stessa velocità con cui si diffondono. Tuttavia, i modelli di IA standard spesso faticano in questo compito. Sono addestrati su dati vecchi e non possono vedere gli eventi che accadono proprio ora. Possono anche "allucinare", inventando fatti o citando fonti che non esistono. La sfida non è solo costruire una macchina che sappia leggere, ma una che sappia verificare, ragionare attraverso diversi tipi di media come testi e immagini, e farlo senza introdurre nuovi errori o pregiudizi. L'obiettivo è un sistema che agisca come un fact-checker instancabile e imparziale, pronto a rispondere nel momento stesso in cui appare un post sospetto.
Un team di ricercatori dell'Università di Washington ha sviluppato un nuovo sistema chiamato MUSE per affrontare esattamente questo problema. MUSE è un framework di intelligenza artificiale personalizzato, progettato per identificare e correggere la disinformazione in tempo reale. A differenza dei modelli più vecchi che si affidano esclusivamente a ciò che hanno appreso in passato, MUSE è dotato di un meccanismo per cercare prove aggiornate sul web in diretta. Quando incontra un post sui social media, non si limita a indovinare; scompone il contenuto, cerca informazioni credibili per supportare o confutare le affermazioni e poi scrive una correzione basata su tali prove. Il sistema è progettato per gestire post complessi che mescolano testo e immagini, assicurando di poter verificare tutto, da una didascalia a una fotografia.
Per testare se questo approccio funzioni effettivamente, i ricercatori hanno confrontato MUSE con le migliori correzioni scritte da umani attualmente disponibili sulla piattaforma X, precedentemente nota come Twitter. Hanno raccolto centinaia di post reali, alcuni contenenti menzogne evidenti, altri dettagli sottilmente fuorvianti e altri ancora del tutto accurati. Per ogni post, hanno messo alla prova la risposta dell'IA contro le note di alta qualità scritte da volontari umani e contro le note medie scritte da utenti meno esperti. La valutazione è stata rigorosa, coinvolgendo un panel di esperti di fact-checking professionisti che hanno valutato le risposte secondo tredici diversi criteri. Gli esperti hanno osservato se il sistema avesse identificato correttamente le parti false, se la spiegazione fosse sensata e se le fonti citate fossero affidabili e realmente esistenti.
I risultati hanno mostrato un chiaro vantaggio per il nuovo sistema. MUSE ha prodotto risposte che gli esperti hanno valutato come di qualità significativamente superiore rispetto anche alle migliori note scritte da esseri umani. Su una scala di dieci, l'IA ha ottenuto un punteggio medio di 8,1, mentre le migliori note umane hanno raggiunto una media di 6,3. Questo divario non era solo una questione di stile; l'IA era più accurata nell'individuare le parti specifiche di un post che erano fuorvianti. Mentre i modelli di IA standard spesso falliscono nell'identificare il problema o inventano fatti, MUSE ha identificato ed spiegato correttamente le imprecisioni in quasi il 90 percento delle sue risposte. Ha anche fornito link a fonti che erano quasi sempre raggiungibili e pertinenti, laddove i modelli standard citavano frequentemente link interrotti o falsi. Il sistema ha performato bene in ogni ambito, gestendo post su politica, salute ed eventi di attualità con pari abilità, e non ha mostrato il pregiudizio politico che talvolta affligge altri sistemi di IA.
I ricercatori volevano anche sapere se le persone si fiderebbero effettivamente di una correzione proveniente da una macchina. Hanno condotto uno studio con quasi mille partecipanti, mostrando loro i post fuorvianti e le correzioni generate dall'IA. I risultati sono incoraggianti: dopo aver letto la spiegazione dell'IA, i partecipanti erano significativamente più capaci di riconoscere che il post originale era fuorviante. La loro convinzione nella falsa affermazione è diminuita. Tuttavia, nessuna delle correzioni ha influenzato significativamente l'intenzione dei partecipanti di condividere la disinformazione, che è rimasta generalmente bassa. Interessantemente, dire alle persone che la correzione proveniva da un'intelligenza artificiale non ha diminuito la loro fiducia in essa. L'efficacia del sistema è rimasta alta sia che la sua origine fosse dichiarata o nascosta, suggerendo che la qualità della spiegazione conti più dell'identità dello scrittore.
Uno degli aspetti più importanti di questo lavoro è il modo in cui il sistema gestisce l'ignoto. I ricercatori hanno scoperto che MUSE non ha bisogno di fare affidamento su fact-check preesistenti per svolgere il suo compito. Anche per i post che non erano mai stati controllati da nessuno prima d'ora, il sistema è in grado di trovare nuove prove sul web e costruire una correzione affidabile. È anche riuscito a farlo rapidamente, generando una risposta completa in circa due minuti su un hardware standard. Il costo per far girare il sistema è inoltre basso, costando circa 0, 2 USD per post, il che è molto più economico che pagare volontari umani per revisionare ogni singola parte del contenuto.
Lo studio presenta comunque dei limiti. Il sistema attualmente lavora con testo e immagini, ma non può ancora analizzare i video. Inoltre, dipende dall'esistenza di informazioni credibili online; se un post riguarda un evento di cronaca dell'ultima ora in cui nessuna fonte affidabile ha ancora riportato notizie, il sistema è progettato per ammettere l'incertezza invece di tirare a indovinare. I ricercatori hanno testato il sistema su una singola piattaforma e, sebbene tale piattaforma sia ampiamente utilizzata, i risultati potrebbero variare altrove. Nonostante questi confini, i risultati offrono una via promettente. Combinando la velocità delle macchine con la capacità di cercare e verificare prove del mondo reale, MUSE dimostra che possiamo costruire strumenti che aiutino le persone a distinguere la verità dalla falsità con la scala e la velocità richieste dall'internet moderno. Il lavoro suggerisce che il futuro della lotta alla disinformazione potrebbe non essere una scelta tra umani e macchine, ma un sistema in cui le macchine si occupano del lavoro pesante di verifica, permettendo al giudizio umano di concentrarsi sui casi più complessi.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.