A criterion for Artificial General Intelligence: hypothetic-deductive reasoning, tested on ChatGPT
L'article propose le raisonnement hypothético-déductif comme un critère fondamental de l'intelligence artificielle générale et démontre, à travers des tests, que les modèles actuels tels que ChatGPT ne possèdent qu'une capacité limitée pour ce type de raisonnement dans des contextes complexes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
La grande question : L'IA est-elle réellement en train de « réfléchir » ?
Imaginez que vous avez un étudiant qui a lu tous les livres de la bibliothèque. Il peut réciter des faits, résoudre des problèmes mathématiques et écrire des essais qui semblent incroyablement intelligents. Mais si vous lui demandez : « Comment as-tu trouvé cela ? » ou « Pourquoi cela se produit-il ? », il pourrait bégayer. Il pourrait donner la bonne réponse en devinant la suite de mots, mais il ne comprend pas réellement les règles derrière la réponse.
Ce document pose la question suivante : ChatGPT « réfléchit-il » vraiment, ou n'est-il qu'un très bon devineur ?
Les auteurs, Louis Vervoort et son équipe, soutiennent que pour être considéré comme une véritable « machine pensante » (ou Intelligence Artificielle Générale, connue sous le nom d'AGI), une IA doit maîtriser une compétence spécifique appelée le raisonnement hypothético-déductif.
Les deux compétences clés
Le document décompose la « pensée » en deux capacités principales :
1. Le raisonnement causal (Le test du « Domino »)
- Ce que c'est : Comprendre que si vous poussez le premier domino, le dernier tombe. Il s'agit de savoir ce qui cause quoi.
- Le test du document : Les chercheurs ont utilisé des « diagrammes de neurones » (comme des organigrammes complexes de dominos). Ils ont demandé à l'IA : « Si je tire ce levier, quels autres leviers bougeront, et lesquels ne bougeront pas ? »
- Le résultat : L'IA était correcte pour les chaînes simples, mais quand les dominos devenaient emmêlés (avec certains leviers en bloquant d'autres), l'IA se perdait. Elle manquait souvent la cause racine ou se trompait dans la séquence. C'était comme une personne qui connaît le mot « cause », mais qui est incapable de tracer le chemin d'un domino qui tombe dans une pièce encombrée.
2. Le raisonnement hypothético-déductif (Le test de la « Recette »)
- Ce que c'est : C'est la façon de penser du « Scientifique ». Cela implique deux étapes :
- Émettre une hypothèse : Choisir le bon manuel de règles (la théorie) pour le problème.
- Déduire : Suivre les étapes de ce manuel pour obtenir la réponse.
- Le test du document : Les chercheurs ont soumis à l'IA des énigmes de physique et de logique (ex : « Si je pousse une rangée de cubes dont l'un est fait de glace, que se passe-t-il quand la pièce devient chaude ? »).
- L'arme secrète : Les chercheurs n'ont pas seulement demandé la réponse. Ils ont demandé à l'IA de énumérer les règles (hypothèses) qu'elle a utilisées pour arriver à cette réponse.
- Analogie : Imaginez demander à un chef : « Comment avez-vous fait cette soupe ? ». S'il répond : « J'ai juste jeté des choses dedans », il a peut-être eu de la chance. S'il dit : « J'ai utilisé la règle selon laquelle le sel se dissout dans l'eau chaude et la règle selon laquelle les oignons cuisent plus vite que les carottes », alors il réfléchit réellement.
Qu'est s'est-il passé quand ils ont testé ChatGPT ?
Les chercheurs ont testé la version plus ancienne (ChatGPT-3.5) et la version plus récente et plus intelligente (ChatGPT-4).
Le problème de la « Bonne réponse, mauvaise raison » :
ChatGPT-4 donnait souvent la bonne réponse aux énigmes. C'était très impressionnant ! Cependant, lorsqu'on lui demandait de lister les règules qu'il avait utilisées, il inventait souvent des choses.- Exemple : Dans un test, l'IA a correctement deviné qu'un seau d'eau allait se renverser. Mais lorsqu'on lui a demandé pourquoi, elle a inventé une fausse règle concernant des « chemises isolantes » qui n'avait rien à voir avec la physique réelle de la situation.
- La métaphore : C'est comme un étudiant qui réussit un problème de mathématiques parce qu'il a mémorisé le résultat final, mais qui, lorsqu'on lui demande de montrer son raisonnement, écrit une formule qu'il vient d'inventer sur le moment.
Le verdict :
Le document conclut que, bien que ChatGPT soit incroyable pour imiter la conversation humaine et résoudre des problèmes simples, il manque actuellement d'une compréhension réelle.- C'est comme un perroquet qui peut dire « Le ciel est bleu » parfaitement, mais qui ne comprend pas pourquoi le ciel est bleu ou ce que « bleu » signifie réellement d'un point de vue physique.
- Lorsque les problèmes devenaient légèrement complexes (combinant différentes idées), l'IA commençait à échouer. Elle ne parvenait pas à lier systématiquement les bonnes règles aux bonnes réponses.
La barre de l'« AGI »
Les auteurs fixent une barre élevée pour ce qui compte comme une « Intelligence Artificielle Générale » (AGI). Ils soutiennent qu'une IA ne « réfléchit » véritablement que lorsqu'elle peut :
- Résoudre un problème.
- Énumérer explicitement les règles et les théories qu'elle a utilisées pour le résoudre.
- Faire cela correctement à travers de nombreux types de problèmes différents (pas seulement un seul).
La conclusion :
Pour l'instant, ChatGPT est un brillant improvisateur. Il peut « faire de l'impro » et paraître intelligent. Mais il n'a pas encore prouvé qu'il possède une carte logique profonde du fonctionnement du monde. Pour être une véritable « machine pensante », il doit cesser de simplement deviner le mot suivant et commencer à prouver pourquoi ce mot est le bon, étape par étape, en utilisant de vraies règles.
Tant qu'une IA ne peut pas réussir ces tests de « liste des règles » de manière cohérente, le document affirme qu'elle n'est pas encore une véritable AGI.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.