← Ultimi articoli
💬 NLP

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action

Questo articolo introduce il framework della Teoria della Mente per la Pianificazione Non Conversazionale (NCP-ToM) per valutare quanto i grandi modelli linguistici siano in grado di indurre stati di credenza specifici attraverso le azioni piuttosto che la conversazione, riscontrando che, sebbene GPT-5 superi gli esseri umani nel tasso di successo in questi compiti, rimane meno robusto tra i diversi contesti e, come gli umani, fatica maggiormente nell'indurre credenze false rispetto a quelle vere.

Autori originali: Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

Pubblicato 2026-07-01
📖 6 min di lettura🧠 Approfondimento

Autori originali: Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

L'Idea Centrale: Il Test del "Burattinaio Silenzioso"

Immagina di giocare a scacchi, ma invece di muovere i pezzi per dare scacco al re, il tuo obiettivo è far credere al tuo avversario qualcosa che non è vero, o fargli sapere qualcosa che è vero, senza mai dire una singola parola. Non puoi parlargli; puoi solo spostare oggetti sul tabellone o nascondere cose nelle scatole.

Questo articolo introduce un nuovo modo per testare l'IA (Large Language Models o LLM) chiamato NCP-ToM (Teoria della Mente per la Pianificazione Non Conversazionale).

  • Teoria della Mente (ToM): Questa è la capacità umana di capire cosa pensano o credono le altre persone.
  • Non Conversazionale: L'IA non è autorizzata a chattare, persuadere o spiegare. Deve usare le azioni per cambiare ciò che gli altri credono.

I ricercatori volevano vedere se gli agenti IA potessero agire come un "burattinaio silenzioso", disponendo il mondo in modo che altri personaggi finiscano con determinati credenze, semplicemente spostando le cose.

L'Ambientazione: Un Gioco Digitale di "Nascondino"

Per testare questo, i ricercatori hanno costruito un parco giochi digitale basato su un classico test psicologico chiamato test di Sally-Anne.

  • Il Test Classico: Nella versione originale, guardi un video dove Sally mette una biglia in un cestello e se ne va. Anne sposta la biglia in una scatola. Ti viene chiesto: "Dove pensa Sally che sia la biglia?" (La risposta è il cestello, perché lei non ha visto lo spostamento). Questo è un test di Domanda e Risposta. Tu guardi e indovini.
  • Il Nuovo Test (NCP-ExploreToM): In questo articolo, l'IA non sta solo guardando; è dentro il gioco. All'IA viene dato un obiettivo, come: "Fai credere a Sally che la biglia sia nel cestello, anche se in realtà è nella scatola."
  • Il Lavoro dell'IA: L'IA deve capire i passaggi per far sì che ciò accada. Potrebbe dover:
    1. Spostare Sally fuori dalla stanza.
    2. Spostare la biglia nella scatola.
    3. Lasciare Sally fuori dalla stanza in modo che non veda lo scambio.
    4. Riportare Sally dentro.

Se l'IA fa questo correttamente, Sally avrà una "credenza falsa" (pensa che sia nel cestello). Se l'IA fallisce, Sally potrebbe vedere lo scambio e conoscere la verità.

Chi ha Giocato al Gioco?

I ricercatori hanno testato:

  1. Sei IA di alto livello: Inclusi GPT-5, Gemini 2.5 Pro e varie versioni di Claude.
  2. 40 Partecipanti Umani: Persone reali che giocano allo stesso gioco su un computer.

Hanno eseguito 600 scenari diversi (compiti) con diversi livelli di difficoltà, stanze diverse (come un ospedale, un hotel o un matrimonio) e diversi tipi di obiettivi (far credere a qualcuno qualcosa di vero vs. far credere a qualcuno qualcosa di falso).

I Risultati: Il Tabellone del Punteggio

Ecco cosa è successo quando hanno confrontato i giocatori:

1. La Sfida della "Credenza Falsa" è Difficile
Proprio come gli umani, i modelli di IA hanno trovato molto più difficile ingannare qualcuno per indurlo ad avere una credenza falsa (far pensare qualcosa che non è vero) rispetto all'aiutarlo ad avere una credenza vera (fargli sapere la verità).

  • Analogia: È più facile mostrare a qualcuno la foto di un gatto affinché sappia che c'è un gatto (Credenza Vera) che nascondere il gatto e fargli pensare che sia un cane (Credenza Falsa).
  • Perché questo è importante: L'articolo nota che questo è un "segnale positivo". Suggerisce che l'IA potrebbe essere più brava in compiti utili (insegnare, assistere) che in compiti ingannevoli (ingannare le persone).

2. La Sorpresa "GPT-5"
Il modello più recente, GPT-5, è stato la superstar.

  • Ha risolto circa l'80% dei compiti.
  • È stato l'unico modello ad aver effettivamente fatto meglio dei partecipanti umani.
  • Tuttavia, gli umani erano più costanti. Le prestazioni dell'IA sono diminuite significativamente a seconda dell' "ambientazione" (ad esempio, l'IA eccelleva in uno scenario di edificio governativo ma faceva peggio in uno scenario di matrimonio). Gli umani rimanevano stabili indipendentemente dall'ambientazione.

3. Il Gap della "Pianificazione"
I ricercatori hanno confrontato due modi di testare l'IA:

  • Il "Quiz" (Q&A): "Ecco una storia. Cosa pensa Sally?"
  • L' "Azione" (Agentic): "Ecco un obiettivo. Vai e fallo."

Di solito, si assume che il test di "Azione" sia molto più difficile del "Quiz". Per la maggior parte dei modelli di IA, questo è stato vero. Ma per GPT-5, il divario è scomparso. Ha performato quasi altrettanto bene nel test di "Azione" quanto in quello di "Quiz". Ciò suggerisce che per i modelli più intelligenti, l'effettiva pianificazione dell'azione sta diventando facile quanto il semplice parlarne.

4. La Complessità Uccide le Prestazioni
Man mano che i compiti diventavano più complicati (richiedendo all'IA di tracciare le credenze di più persone contemporaneamente, o far credere a tre persone diverse tre cose diverse), i punteggi di tutti diminuivano. È come cercare di fare giocoleria con più palline; alla fine, ne fai cadere una.

Cosa Significa Questo? (Secondo il Documento)

L'articolo conclude con alcune riflessioni chiave, attenendosi strettamente a quanto scoperto:

  • L'IA sta diventando brava nella "Persuasione Silenziosa": Le moderne IA possono pianificare una sequenza di azioni fisiche per cambiare ciò che altri personaggi credono, senza dire una parola.
  • Controllo di Sicurezza: Il fatto che l'IA fatichi di più con le "credenze false" (inganno) rispetto alle "credenze vere" è una buona notizia per la sicurezza. Suggerisce che non sono naturalmente inclini a mentire o manipolare tramite l'azione, sebbene possano farlo se richiesto.
  • Il Problema del "Contesto": L'IA è ancora un po' fragile. Se cambi la storia da un "ospedale" a un "matrimonio", l'IA potrebbe confondersi. Gli umani non si confondono con questi cambiamenti.
  • La Trappola del "Quiz": Non possiamo presumere che se un'IA è brava a rispondere a domande su una storia, sarà brava anche a mettere in pratica quella storia. Per i modelli migliori (come GPT-5), la vecchia regola che "i Quiz sono più facili delle Azioni" potrebbe non essere più valida.

In Sintesi

Questo articolo mostra che l'IA si sta evolvendo da un "chatbot" che risponde a domande in un "agente" capace di pianificare e agire per dare forma alla realtà. Sebbene l'IA più intelligente possa attualmente superare gli umani in questi specifici enigmi logici, manca ancora della capacità umana di rimanere costante in diverse situazioni del mondo reale. I ricercatori avvertono che, sebbene questa sia una capacità utile per gli assistenti, significa anche che dobbiamo prestare attenzione a come valutiamo la sicurezza dell'IA, perché i vecchi test (porre solo domande) potrebbero non essere più sufficienti.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →