← Derniers articles
🤖 AI

Structural Ranking of the Cognitive Plausibility of Computational Models of Analogy and Metaphors with the Minimal Cognitive Grid

Ce papier applique le cadre de la Grille Cognitive Minimale pour évaluer et classer systématiquement la plausibilité cognitive des principaux modèles computationnels de l'analogie et de la métaphore, notamment SME, CogSketch, METCL et les LLM, en utilisant une approche quantitative formalisée fondée sur le rapport fonctionnel/structurel, la généralité et la correspondance des performances.

Auteurs originaux : Alessio Donvito, Antonio Lieto

Publié 2026-05-06
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Alessio Donvito, Antonio Lieto

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez un juge dans une émission de talents, mais au lieu de chanteurs ou de danseurs, les candidats sont des programmes informatiques tentant de se comporter comme des penseurs humains. Plus précisément, ils essaient de résoudre des énigmes impliquant des analogies (comme « A est à B ce que C est à D ») et des métaphores (comme « Mon travail est une prison »).

Les auteurs de cet article, Alessio Donvito et Antonio Lieto, ont créé un système de notation spécial appelé la Grille Cognitive Minimale (MCG). Imaginez cette grille comme un tabouret à trois pieds. Pour qu'un ordinateur puisse s'asseoir confortablement sur ce tabouret et être considéré comme un modèle « cognitivement plausible » (c'est-à-dire qu'il pense comme un humain, et non pas qu'il ressemble simplement à un humain), il doit trouver l'équilibre sur ses trois pieds.

Voici comment fonctionnent les trois pieds, en utilisant des analogies simples :

Pied 1 : La Correspondance du Plan (Ratio Fonctionnel/Structural)

La Question : L'ordinateur construit-il sa réponse de la même manière que le cerveau humain, ou obtient-il simplement la bonne réponse par magie ?

  • L'Analogie : Imaginez deux personnes essayant de construire une niche pour oiseau.
    • Personne A (Le Modèle Structural) : Utilise du bois, des clous et un marteau, en suivant exactement les mêmes étapes qu'un charpentier. Ils peuvent être lents, mais leur processus est semblable à celui d'un humain.
    • Personne B (Le Modèle Fonctionnel) : Utilise une imprimante 3D ou une découpeuse laser. Ils obtiennent exactement la même niche, mais la machine à l'intérieur est totalement différente des mains d'un humain.
  • L'Affirmation de l'Article : Les auteurs soutiennent que pour qu'un ordinateur soit un bon modèle de la manière dont nous pensons, il doit utiliser l'approche « bois et clous » (structurelle).
    • SME et CogSketch : Ce sont comme les charpentiers. Ils utilisent des règles spécifiques (comme « une chose se mappe à une chose ») qui imitent la façon dont les humains font des analogies. Ils obtiennent de bons scores ici.
    • LLM (comme GPT-4) : Ce sont comme les imprimantes 3D. Ils sont incroyables pour fabriquer la niche (obtenir la bonne réponse), mais ils le font en devinant des modèles à partir d'une immense bibliothèque de livres, et non en suivant des étapes logiques semblables à celles des humains. Ils obtiennent des scores très bas ici car leur « machinerie interne » est étrangère à la pensée humaine.
    • METCL : C'est un charpentier intermédiaire. Il utilise un ensemble différent de plans (se concentrant sur la catégorisation plutôt que sur la mise en correspondance), il obtient donc un score intermédiaire.

Pied 2 : Le Couteau Suisse (Généralité)

La Question : L'ordinateur peut-il effectuer de nombreux types de pensée différents, ou est-il un one-trick pony (un spécialiste d'une seule chose) ?

  • L'Analogie :
    • Le Spécialiste : Un joueur d'échecs maître qui peut battre un grand maître mais ne peut pas nouer ses lacets ou cuire un œuf.
    • Le Généraliste : Quelqu'un qui peut jouer aux échecs, cuisiner, conduire une voiture et résoudre des problèmes de mathématiques.
  • L'Affirmation de l'Article : Les auteurs examinent si ces systèmes peuvent gérer les mathématiques, les énigmes visuelles, le langage et même le mouvement physique (compétences sensorimotrices).
    • LLM : Ce sont les Généralistes ultimes. Ils peuvent lire, écrire, faire des mathématiques et regarder des images. Ils obtiennent les scores les plus élevés ici.
    • SME et CogSketch : Ce sont les Spécialistes. Ils sont excellents dans des énigmes logiques spécifiques (comme les motifs visuels) mais ne peuvent pas vraiment faire de mathématiques ou comprendre des phrases complexes. Ils obtiennent de faibles scores ici.
    • METCL : Également un spécialiste, se concentrant principalement sur les métaphores linguistiques.

Pied 3 : Le Test du Miroir (Correspondance de Performance)

La Question : Lorsque l'ordinateur se trompe, commet-il le même type d'erreur qu'un humain ?

  • L'Analogie : Imaginez passer un examen.
    • Si vous répondez mal à une question parce que vous avez mal compris le concept, c'est une erreur « humaine ».
    • Si vous répondez mal parce que l'ordinateur a bugué ou a deviné au hasard, c'est une erreur « machine ».
    • L'objectif est de voir si les « bugs » de l'ordinateur ressemblent à de la confusion humaine.
  • L'Affirmation de l'Article :
    • SME et CogSketch : Ils excellent dans ce domaine. Lorsqu'ils échouent à une énigme visuelle (comme les Matrices Progressives de Raven), ils échouent sur les exactes mêmes énigmes difficiles qui posent problème aux humains. Ils prennent même un temps de réflexion similaire. Ils obtiennent des scores très élevés.
    • LLM : Ils obtiennent souvent la bonne réponse, mais lorsqu'ils échouent, leurs erreurs semblent différentes de celles des humains. Ils peuvent se tromper à cause d'un léger changement de formulation qui ne dérouterait pas une personne. Ils obtiennent des scores plus bas ici.

Le Tableau des Scores Final

Les auteurs combinent ces trois scores pour déterminer qui remporte le titre de « Plausibilité Cognitive ». Ils ont décidé que le Pied 1 (Le Plan) est le plus important car l'objectif principal est de comprendre comment les humains pensent, et non pas simplement d'obtenir la bonne réponse.

  • Le Gagnant (Selon des règles strictes) : CogSketch et SME. Même s'ils sont des « one-trick ponies » (faible généralité), ils pensent comme des humains. Ce sont les meilleurs modèles pour étudier l'esprit humain.
  • Le Second : METCL. Il se situe au milieu, réalisant certaines choses semblables à l'humain, mais pas aussi de manière complète que les deux premiers.
  • La Boîte « Magique » : LLM (GPT-4, etc.). Ils sont incroyablement intelligents et polyvalents (généralité élevée), mais ils ne pensent pas comme des humains. Si vous voulez un outil pour résoudre des problèmes, ils sont excellents. Mais si vous voulez un modèle pour expliquer pourquoi les humains pensent comme ils le font, l'article indique qu'ils ne sont pas le meilleur choix.

La Grande Conclusion

L'article conclut que être « intelligent » (obtenir la bonne réponse) est différent d'être « cognitivement plausible » (penser comme un humain).

  • Les LLM sont comme un super-acteur qui peut mémoriser un script parfaitement et sonner exactement comme un humain, mais ils ne ressentent pas réellement les émotions.
  • SME/CogSketch sont comme un acteur de méthode qui ressent réellement les émotions et réfléchit à travers la logique du personnage, même s'il ne peut pas mémoriser autant de répliques.

Les auteurs ont construit cette grille pour aider les scientifiques à décider quel programme informatique est le meilleur « acteur de méthode » pour étudier l'esprit humain. Ils ont constaté que si les « super-acteurs » (LLM) sont impressionnants, les « acteurs de méthode » (SME/CogSketch) restent la référence pour comprendre les mécanismes de la pensée humaine.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →