← Ultimi articoli
💬 NLP

Where Norms and References Collide: Evaluating LLMs on Normative Reasoning

Questo articolo introduce SNIC, un banco di prova validato da esseri umani per valutare i Large Language Models sulla risoluzione del riferimento basata su norme, rivelando che anche i modelli allo stato dell'arte faticano a identificare e applicare coerentemente le norme sociali implicite essenziali per interazioni situate ed incarnate.

Autori originali: Mitchell Abrams, Kaveh Eskandari Miandoab, Felix Gervits, Vasanth Sarathy, Matthias Scheutz

Pubblicato 2026-02-04
📖 5 min di lettura🧠 Approfondimento

Autori originali: Mitchell Abrams, Kaveh Eskandari Miandoab, Felix Gervits, Vasanth Sarathy, Matthias Scheutz

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di essere in una cucina affollata con un amico. Chiedi: "Puoi passarmi una tazza?". Sul bancone ci sono tre tazze: una è splendente e pulita, e due sono coperte da macchie di caffè asciutto.

Se fossi un essere umano, sapresti istantaneamente che il tuo amico ti porgerà la tazza pulita. Non hai bisogno che lui dica "quella pulita" perché entrambi condividete una regola non scritta: Non bere dalla tazza sporca di qualcun altro. Questa regola invisibile è una norma sociale.

Questo articolo, intitolato "Where Norms and References Collide" (Dove le norme e i riferimenti collidono), pone una domanda semplice ma complicata: l'IA moderna (specificamente i Large Language Models o LLM) riesce a capire a quale tazza ti riferisci senza che venga detto esplicitamente?

Ecco la scomposizione dei loro risultati, utilizzando alcune analogie quotidiane:

Il Problema: Il "Punto Cieco" dell'IA

Pensa a un LLM come a uno studente molto intelligente che ha letto quasi tutti i libri della biblioteca. È bravissimo a rispondere a quiz di cultura generale e a risolvere enigmi logici. Tuttavia, non ha mai vissuto in una cucina, in una biblioteca o in un ristorante. Sa cos'è una "tazza", ma non ha imparato le sottili regole non scritte su come si comportano le persone in quei luoghi.

I ricercatori chiamano questa competenza mancante Risoluzione del Riferimento Basata sulle Norme (NBRR). È la capacità di osservare una scena disordinata, comprendere la "grammatica sociale" (le regole di comportamento) e indovinare a cosa una persona stia puntando.

L'Esperimento: Costruire una "Trappola per le Norme"

Per testare questo aspetto, il team ha creato un dataset chiamato SNIC (Situated Norms in Context - Norme Situate nel Contesto).

  • L'Ambientazione: Hanno creato 9.000 brevi storie (vignette) che coinvolgono compiti quotidiani come pulire, servire cibo o riordinare.
  • La Trappola: In ogni storia, hanno posto una domanda che sembrava ambigua. Ad esempio, "Prendi il piatto".
    • Scenario A: La stanza viene pulita. L'IA dovrebbe prendere il piatto sporco.
    • Scenario B: La stanza viene servita. L'IA dovrebbe prendere il piatto pulito.
  • Il Test Umano: Prima di fidarsi dell'IA, hanno chiesto a 210 esseri umani reali di risolvere questi enigmi. Gli umani concordavano per lo più sulla risposta "normativa" (ad esempio, "Prendi quello sporco perché stiamo pulendo"), dimostrando che le regole erano chiare per le persone.

I Risultati: L'IA si perde senza una mappa

I ricercatori hanno testato diversi modelli di IA di alto livello (come GPT-4, Llama e Phi) su queste 9.000 storie. I risultati sono stati come guardare un GPS che cerca di navigare in una città che non ha mai visitato:

  1. Il "Gioco delle Tante Scuse" fallisce: Quando l'IA riceveva solo la storia e doveva scegliere l'oggetto giusto, faceva fatica. Otteneva la risposta corretta meno della metà delle volte in media. Spesso non riusciva a distinguere tra un "compito di pulizia" e un "compito di servizio" perché non comprendeva la norma alla base del compito.
  2. Il vicolo cieco del "Linguaggio Formale": I ricercatori hanno provato a dare all'IA una descrizione matematica super-precisa della scena (usando un linguaggio di codice chiamato Prolog) per eliminare ogni ambiguità. Sorprendentemente, questo non ha aiutato molto. È come dare a un guidatore una mappa perfetta ma dirgli: "Tuttavia, non conosci ancora le leggi del traffico". L'IA conosceva i fatti, ma non conosceva ancora le regole della strada.
  3. Il successo del "Foglietto Illustrativo": Quando i ricercatori hanno fornito esplicitamente all'IA un elenco di regole da seguire (ad esempio, "Regola: In un compito di pulizia, prendi gli oggetti sporchi"), le prestazioni dell'IA sono schizzate alle stelle. Improvvisamente, otteneva le risposte corrette.

La Grande Conclusione

L'articolo conclude che gli attuali modelli di IA sono come eccellenti enciclopedie ma cattivi vicini.

  • Sanno cos'è una tazza.
  • Sanno cos'è la pulizia.
  • Ma non sanno intrinsecamente come le persone usano le tazze in un contesto sociale, a meno che non venga spiegata loro esplicitamente la regola.

Gli autori sostengono che questo sia un "punto cieco". I modelli di IA sono addestrati sul testo, ma le norme sociali sono spesso implicite (mai scritte) e fisicamente radicate (legate a oggetti e azioni del mondo reale). Poiché queste regole non sono sempre spiegate chiaramente nei libri, l'IA le perde di vista.

Perché questo è importante (secondo l'articolo)

L'articolo suggerisce che se vogliamo che i robot o gli assistenti IA lavorino nelle case o negli uffici reali, devono imparare queste regole sociali invisibili. Attualmente, potrebbero porgervi una tazza sporca quando ne chiedete una per bere, non perché siano "stupidi", ma perché non hanno imparato il contratto sociale implicito che dice: "Non si fa così".

In breve: l'articolo ha costruito un test per vedere se l'IA comprende le "regole non scritte" della vita quotidiana. Ha scoperto che, sebbene l'IA sia intelligente, attualmente è pessima nel dedurre ciò che intendiamo quando ci affidiamo a quelle regole non scritte, a meno che non si spieghino prima le regole stesse.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →