← Derniers articles
💬 NLP

Where Norms and References Collide: Evaluating LLMs on Normative Reasoning

Cet article présente SNIC, un banc d'essai validé par l'humain pour évaluer les grands modèles de langage sur la résolution de références basées sur les normes, révélant que même les modèles de pointe peinent à identifier et à appliquer de manière cohérente les normes sociales implicites essentielles aux interactions situées et incarnées.

Auteurs originaux : Mitchell Abrams, Kaveh Eskandari Miandoab, Felix Gervits, Vasanth Sarathy, Matthias Scheutz

Publié 2026-02-04
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mitchell Abrams, Kaveh Eskandari Miandoab, Felix Gervits, Vasanth Sarathy, Matthias Scheutz

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez dans une cuisine animée avec un ami. Vous demandez : « Peux-tu me passer un mug ? » Il y a trois mugs sur le comptoir : l'un est étincelant de propreté, et deux autres sont couverts de taches de café séchées.

Si vous êtes un humain, vous savez instantanément que votre ami vous tendra le mug propre. Vous n'avez pas besoin qu'il dise « le propre » car vous partagez tous deux une règle tacite : On ne boit pas dans le verre de quelqu'un d'autre. Cette règle invisible est une norme sociale.

Cet article, intitulé « Where Norms and References Collide » (Là où les normes et les références se rencontrent), pose une question simple mais délicate : L'IA moderne (plus précisément les grands modèles de langage ou LLM) peut-elle comprendre quel mug vous désignez sans qu'on lui dise explicitement ?

Voici la décomposition de leurs conclusions, en utilisant quelques analogies de la vie quotidienne :

Le Problème : Le « point aveugle » de l'IA

Considérez un LLM comme un étudiant très intelligent qui a lu presque tous les livres de la bibliothèque. Il est excellent pour répondre à des questions de culture générale et résoudre des énigmes logiques. Cependant, cet étudiant n'a jamais réellement vécu dans une cuisine, une bibliothèque ou un restaurant. Il sait ce qu'est un « mug », mais il n'a pas appris les règles subtiles et non écrites de la manière dont les gens se comportent dans ces lieux.

Les chercheurs appellent cette compétence manquante la Résolution de Référence Basée sur les Normes (NBRR). C'est la capacité à observer une scène désordonnée, à comprendre la « grammaire sociale » (les règles de comportement) et à deviner ce que quelqu'un pointe du doigt.

L'Expérience : Construire un « Piège à Normes »

Pour tester cela, l'équipe a créé un ensemble de données appelé SNIC (Situated Norms in Context - Normes Situées en Contexte).

  • Le Montage : Ils ont créé 9 000 petites histoires (vignettes) impliquant des tâches quotidiennes comme nettoyer, servir de la nourriture ou ranger.
  • Le Piège : Dans chaque histoire, ils posaient une question qui semblait ambiguë. Par exemple : « Ramasse l'assiette. »
    • Scénario A : La pièce est en train d'être nettoyée. L'IA devrait ramasser l'assiette sale.
    • Scénario B : La pièce est en train d'être servie. L'IA devrait ramasser l'assiette propre.
  • Le Test Humain : Avant de faire confiance à l'IA, ils ont soumis ces puzzles à 210 humains réels. Les humains étaient pour la plupart d'accord sur la réponse « normative » (ex : « Ramasse la sale parce qu'on est en train de nettoyer »), prouvant que les règles étaient claires pour les humains.

Les Résultats : L'IA se perd sans carte

Les chercheurs ont testé plusieurs modèles d'IA de haut niveau (comme GPT-4, Llama et Phi) sur ces 9 000 histoires. Les résultats ressemblaient à l'observation d'un GPS essayant de naviguer dans une ville qu'il n'a jamais visitée :

  1. L'échec du « Jeu de Devinettes » : Lorsque l'IA recevait simplement l'histoire et devait choisir le bon objet, elle peinait. Elle obtenait la bonne réponse moins de la moitié du temps en moyenne. Elle ne parvenait souvent pas à faire la distinction entre une « tâche de nettoyage » et une « tâche de service » car elle ne comprenait pas la norme derrière la tâche.
  2. L'impasse du « Langage Formel » : Les chercheurs ont tenté de donner à l'IA une description mathématique ultra-précise de la scène (en utilisant un langage de code appelé Prolog) pour éliminer toute ambiguïté. Étonnamment, cela n'a pas beaucoup aidé. C'est comme donner une carte parfaite à un conducteur, mais en lui disant : « Vous ne connaissez toujours pas le code de la route ». L'IA connaissait les faits, mais ne connaissait toujours pas les règles de conduite.
  3. Le Succès du « Aide-mémoire » : Lorsque les chercheurs ont explicitement donné à l'IA une liste de règles à suivre (ex : « Règle : Dans une tâche de nettoyage, ramasse les objets sales »), les performances de l'IA ont grimpé en flèche. Elle trouvait soudainement les bonnes réponses.

La Grande Conclusion

L'article conclut que les modèles d'IA actuels sont comme d'excellentes encyclopédies mais de mauvais voisins.

  • Ils savent ce qu'est un mug.
  • Ils savent ce qu'est le nettoyage.
  • Mais ils ne savent pas intrinsèquement comment les gens utilisent les mugs dans un contexte social, à moins que vous ne leur donniez explicitement la règle.

Les auteurs soutiennent que c'est un « point aveugle ». Les modèles d'IA sont entraînés sur du texte, mais les normes sociales sont souvent implicites (jamais écrites) et ancrées physiquement (liées à des objets et des actions réels). Comme ces règles ne sont pas toujours énoncées clairement dans les livres, l'IA les manque.

Pourquoi cela importe (selon l'article)

L'article suggère que si nous voulons que des robots ou des assistants IA travaillent dans nos maisons ou bureaux, ils doivent apprendre ces règles sociales invisibles. Actuellement, ils pourraient vous tendre un mug sale quand vous en demandez un, non pas parce qu'ils sont « stupides », mais parce qu'ils n'ont pas appris le contrat social tacite qui dit : « On ne fait pas ça ».

En bref : L'article a construit un test pour voir si l'IA comprend les « règles non écrites » de la vie quotidienne. Il a découvert que bien que l'IA soit intelligente, elle est actuellement incapable de deviner ce que nous voulons dire lorsque nous nous appuyons sur ces règles non écrites, à moins de lui expliquer d'abord les règles.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →