← Ultimi articoli
💬 NLP

Arguments that Alter Minds: LLM Rationales Sway Human (and LLM) Notions of Plausibility

Questo studio dimostra che sia gli esseri umani che i modelli linguistici di grandi dimensioni (LLM) sono significativamente influenzati nei loro giudizi di plausibilità su risposte di senso comune da argomentazioni generate da LLM, evidenziando un nuovo metodo per studiare la cognizione umana e sollevando al contempo preoccupazioni riguardo al potenziale dell'IA di influenzare indebitamente le credenze umane anche in domini di senso comune.

Autori originali: Shramay Palta, Peter Rankel, Sarah Wiegreffe, Rachel Rudinger

Pubblicato 2026-06-23
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Shramay Palta, Peter Rankel, Sarah Wiegreffe, Rachel Rudinger

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di giocare a un gioco in cui devi indovinare cosa succederà dopo in una storia buffa. Per esempio: "Se una persona fa cadere un bicchiere, cosa succede?". Potresti rispondere: "Si rompe", oppure "Rimbalza". Di solito, "Si rompe" è la risposta ovvia, mentre "Rimbalza" è una risposta buffa.

In questo studio, i ricercatori hanno posto una domanda semplice ma inquietante: un robot (un'IA) può convincerti a cambiare idea su ciò che è vero, anche quando conosci già la risposta?

Ecco come l'hanno fatto e cosa hanno scoperto, spiegato attraverso alcune semplici analogie.

La configurazione: Il "Club del Dibattito" del buon senso

I ricercatori hanno preso 100 domande di buon senso (come l'esempio del bicchiere) e hanno scelto due risposte per ciascuna:

  1. La Risposta d'Oro: Quella che la maggior parte delle persone concorda sia corretta.
  2. Il Distruttore: La risposta buffa, solitamente errata.

Poi, hanno usato un'IA potente (GPT-4o) per scrivere due tipi di argomentazioni per ogni risposta:

  • L'Argomento "Pro": Un discorso che spiega perché questa risposta ha perfettamente senso.
  • L'Argomento "Contro": Un discorso che spiega perché questa idea è terribile.

Hanno mostrato queste domande e argomentazioni a 3.000 esseri umani reali e a 13.600 diversi modelli di IA, chiedendo loro di valutare quanto fosse "plausibile" (probabile) la risposta su una scala da 1 a 5.

I Risultati: Il trucco magico dell'IA

1. La "Risposta Buffa" riceve una spinta

Quando l'IA forniva un argomento "Pro" per la risposta buffa (il Distruttore), gli esseri umani e le altre IA iniziavano a pensare: "Ehi, in realtà ha senso!".

  • Analogia: È come un amico dai modi gentili che ti convince che un tappeto elastico sia un ottimo posto dove far cadere un bicchiere. Anche se sai che il vetro di solito si rompe, la logica del tuo amico ti fa esitare e ti porta a dare all'idea del "rimbalzo" un punteggio più alto.

2. La "Risposta Ovvia" subisce un colpo (per gli umani)

Questa è la parte più strana. Quando l'IA forniva un argomento "Pro" per la risposta ovviamente corretta (l'Oro), gli esseri umani in realtà abbassavano i loro punteggi.

  • Analogia: Immagina di essere sicuro al 100% che il bicchiere si romperà. Poi, un robot entra in scena e dice: "Beh, è plausibile che il bicchiere si rompa". Potresti pensare: "Aspetta, perché lo stai nemmeno spiegando? È ovvio! Se devi spiegarlo, forse mi sbaglio io".
  • I ricercatori chiamano questo "sottovalutare" (underselling). Cercando di dimostrare l'ovvio, l'IA ha accidentalmente fatto dubitare gli umani della propria sicurezza.

3. L'Argomento "Contro" è un martello pneumatico

Quando l'IA forniva un argomento "Contro" (argomentando contro una risposta), era molto efficace nel far abbassare i punteggi.

  • Analogia: Se il robot dice: "Il bicchiere non si romperà perché è fatto di gomma", le persone smettono immediatamente di credere alla risposta "il vetro si rompe". L'argomento negativo è stato più forte di quello positivo.

4. Robot contro Umani

I modelli di IA (i robot) erano ancora più facilmente influenzabili degli esseri umani.

  • L'Effetto "Camera dell'Eco": I modelli di IA sembravano apprezzare molto gli argomenti scritti dal loro "fratello maggiore" (GPT-4o). Quando GPT-4o scriveva un argomento "Pro", gli altri modelli di IA ci credevano ancora più degli umani.
  • La Differenza: Gli umani si confondevano quando l'IA cercava di spiegare l'ovvio (abbassando il loro punteggio), ma le altre IA diventavano invece più sicure della risposta corretta quando l'IA la spiegava.

La Regola dell' "Ancoraggio"

Lo studio ha scoperto una regola su quanto siano testarde le nostre menti: più sei sicuro all'inizio, più è difficile cambiare idea.

  • Analogia: Se ti trovi su una scogliera alta (un punteggio molto alto), serve un vento enorme (un argomento forte) per spingerti giù. Se ti trovi su un terreno pianeggiante (un punteggio basso), una leggera brezza può farti cadere facilmente.
  • I dati hanno mostrato che la valutazione iniziale era il predittore più forte di quanto la valutazione sarebbe cambiata.

La Grande Conclusione

L'articolo conclude che gli LLM (IA) possono agire come avvocati persuasivi. Possono parlare agli umani per convincerli che un'idea buffa sia vera, o parlare agli umani per farli dubitare di un'idea vera.

Anche in un campo in cui gli umani dovrebbero essere gli "esperti" (il buon senso quotidiano), le parole di un'IA possono spostare ciò che crediamo sia plausibile. I ricercatori avvertono che se un'IA può ingannarci su un bicchiere che cade, potrebbe essere in grado di ingannarci su argomenti molto più seri e complessi dove non conosciamo le risposte così bene.

In breve: Non ascoltare solo la risposta; ascolta chi sta argomentando a suo favore. Il parlare fluido di un robot può far sembrare giusto ciò che è sbagliato, e far sembrare dubbio ciò che è giusto.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →