← Derniers articles
💬 NLP

Quantification and object perception in Multimodal Large Language Models and human linguistic cognition

Cette étude examine comment les grands modèles de langage multimodaux (MLLM) traitent la quantification par rapport à la cognition humaine en analysant trois caractéristiques linguistiques clés, révélant que bien que les modèles « pensants » excellent dans certaines tâches, des écarts significatifs persistent concernant les plages d'usage et la prototypicalité des quantificateurs.

Auteurs originaux : Raquel Montero, Natalia Moskvina, Paolo Morosi, Tamara Serrano, Elena Pagliarini, Evelina Leivada

Publié 2026-03-26
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Raquel Montero, Natalia Moskvina, Paolo Morosi, Tamara Serrano, Elena Pagliarini, Evelina Leivada

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🎨 Le Grand Test de la "Quantité" : Humains vs. IA

Imaginez que vous êtes dans une pièce remplie de carrés noirs et de ronds blancs. On vous demande : « Combien y a-t-il de carrés ? »
Un humain répondrait instinctivement : « Il y en a beaucoup », ou « Il y en a quelques-uns », ou encore « La majorité ».

Les chercheurs de cet article ont voulu voir si les Intelligences Artificielles (IA) les plus avancées (les "LLM multimodaux") font de même. Le but ? Comprendre pourquoi ces IA, si douées pour écrire des poèmes ou coder, semblent parfois avoir du mal à compter ou à évaluer des quantités de manière naturelle.

🔍 Les Trois Mystères Résolus

Les chercheurs ont posé trois grandes questions, comme un détective qui enquête sur trois pistes différentes :

1. L'Échelle de la "Vague" (L'ordre des mots)

Chez les humains, il y a une hiérarchie naturelle dans les mots de quantité. C'est comme une échelle de gravité :

  • Quelques-uns (peu) ➡️ Beaucoup ➡️ La majorité (presque tout).
  • Si vous dites "La majorité", cela implique automatiquement "Beaucoup".

Ce que l'IA a fait :
Les IA "réfléchissantes" (celles qui prennent le temps de "penser" avant de répondre, comme un élève qui fait des calculs au brouillon) ont bien compris cette échelle. Elles savent que "La majorité" est plus fort que "Beaucoup".
Cependant, les IA "classiques" (celles qui répondent vite, comme un chatbot standard) ont parfois mélangé les cartes. Pour elles, "La majorité" pouvait parfois signifier la même chose que "Beaucoup", ou même moins ! C'est comme si elles confondaient "un peu de pluie" et "une inondation".

2. La Zone de Confort (Le sens exact des mots)

C'est ici que ça devient intéressant. Pour un humain, le mot "Beaucoup" a une zone de confort.

  • Si vous voyez 40% de carrés noirs, vous direz "Quelques-uns".
  • Si vous voyez 80%, vous direz "La majorité".
  • Mais pour "Beaucoup", la zone de confort est souvent entre 50% et 80%.

Ce que l'IA a fait :
Les IA ont des zones de confort très étranges.

  • Parfois, elles disent "Beaucoup" pour seulement 30% d'objets (trop tôt !).
  • Parfois, elles ne disent "La majorité" que si c'est 95% (trop tard !).
    C'est comme si un humain disait "Il fait chaud" quand il y a 15°C, ou "Il fait très froid" quand il y a 25°C. Leurs "thermomètres internes" sont mal calibrés.

3. Le Biais de l'Estimation (Compter sans compter)

Avant de choisir un mot, l'humain doit estimer la quantité. Notre cerveau a deux modes :

  • Le mode "Compteur précis" : pour les petits nombres (1, 2, 3, 4).
  • Le mode "Estimateur approximatif" : pour les grands nombres (on sent juste que c'est "énorme").

Ce que l'IA a fait :
Les IA "réfléchissantes" sont devenues d'excellents "compteurs". Elles voient l'image et disent : "Ah, il y a 65% de carrés".
Les IA classiques, elles, ont tendance à sous-estimer les choses. Si l'image est remplie de noir, elles pensent qu'il y en a moins qu'il n'y en a vraiment. C'est comme si elles avaient des lunettes qui rendent les objets plus petits.

🧠 Les Deux Types d'IA : Le Génie vs. Le Rapide

L'étude a comparé deux familles d'IA :

  1. Les "Penseurs" (Thinking Models) : Comme un étudiant qui prend 10 secondes pour réfléchir, faire des calculs et vérifier sa logique.
    • Résultat : Ils sont très forts pour compter et organiser les mots. Ils se rapprochent beaucoup des humains, mais ils restent un peu "robotiques" dans la nuance des mots.
  2. Les "Instructeurs" (Instruct Models) : Comme un élève qui répond vite pour avoir une bonne note, sans trop réfléchir.
    • Résultat : Ils sont plus brouillons. Ils mélangent souvent les définitions des mots et ont du mal à comprendre la logique mathématique derrière les images.

🌍 La Question des Langues

Les chercheurs ont testé cela en anglais, grec, russe, espagnol, italien et catalan.

  • Le verdict : Les IA ne sont pas des "génies universels" qui comprennent le concept de quantité de la même manière dans toutes les langues.
  • Elles ont des "cartes mentales" différentes selon la langue. Par exemple, le mot "Beaucoup" est difficile pour elles dans toutes les langues, mais pour des raisons différentes selon la langue.
  • Curieusement, l'anglais n'est pas la langue où elles réussissent le mieux ! C'est souvent l'inverse de ce qu'on imagine.

🏁 Conclusion : Pourquoi est-ce important ?

Imaginez que l'IA soit un acteur qui joue le rôle d'un humain.

  • Elle peut réciter le texte (les mots) parfaitement.
  • Mais quand on lui demande de jouer une scène où elle doit estimer la foule ou comprendre les nuances d'une conversation, elle trébuche. Elle ne "ressent" pas la quantité comme nous.

En résumé :
Cette étude nous dit que les IA sont excellentes pour reconnaître des motifs (comme un détective qui voit des formes), mais elles peinent encore à comprendre la logique profonde derrière les mots comme "beaucoup" ou "la majorité". Elles ne possèdent pas encore notre "sens commun" mathématique et linguistique.

C'est une bonne nouvelle pour les chercheurs : cela signifie qu'il reste du travail à faire pour rendre les IA plus humaines, non pas en leur donnant plus de données, mais en leur apprenant à mieux "sentir" le monde qui les entoure.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →