← Derniers articles
🤖 AI

Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?

Cet article présente VLATIM, une évaluation basée sur *The Incredible Machine 2* qui révèle un écart significatif entre les capacités de planification de haut niveau et l'ancrage visuel précis des modèles vision-langage actuels, démontrant qu'ils n'ont pas encore atteint des capacités de résolution de problèmes logiques à la manière des humains dans des environnements de puzzles interactifs au point-and-click.

Auteurs originaux : Dominik Helfenstein, Marco Menner, Maximilian Triebel

Publié 2026-05-13
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Dominik Helfenstein, Marco Menner, Maximilian Triebel

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un assistant robot très intelligent. Vous pouvez lui parler, lui montrer des images et lui demander de résoudre une énigme. La grande question que pose cet article est la suivante : ce robot est-il assez intelligent pour penser et agir comme un humain lorsqu'il joue à un jeu d'énigme « pointer-et-cliquer » délicat ?

Pour le découvrir, les chercheurs ont créé un test spécial appelé VLATIM. Ils ont utilisé un jeu classique des années 90 intitulé The Incredible Machine 2. Dans ce jeu, vous ne vous contentez pas d'appuyer sur des boutons ; vous devez construire des machines folles dans le style de Rube Goldberg. Par exemple, vous pourriez avoir besoin de faire tomber une boule de bowling sur une balançoire pour lancer un chat, qui effraie une souris, qui allume un générateur pour alimenter un mixeur. Cela nécessite de comprendre la physique, la causalité et des mouvements de souris précis.

Voici comment l'article décompose les performances du robot, en utilisant des analogies simples :

1. Le test en cinq étapes

Les chercheurs n'ont pas simplement jeté le robot dans le grand bain. Ils ont construit une échelle à cinq barreaux, devenant plus difficile à chaque niveau :

  • Barreau 1 (Repérer les choses) : Le robot peut-il pointer son doigt vers un objet spécifique à l'écran ? (par exemple : « Où est la bougie ? »)
  • Barreau 2 (Connaître les règles) : Le robot peut-il répondre à des questions sur le fonctionnement des choses ? (par exemple : « Quel mur est glissant ? »)
  • Barreau 3 (Prédire l'avenir) : Le robot peut-il deviner ce qui se passe ensuite ? (par exemple : « Si je lâche la balle, où atterrira-t-elle ? »)
  • Barreau 4 (Déplacer les choses) : Le robot peut-il réellement utiliser la souris pour glisser, déposer et faire pivoter des objets ?
  • Barreau 5 (Résoudre l'énigme entière) : Le robot peut-il regarder un écran vide, déterminer l'objectif et construire toute la machine à partir de zéro ?

2. Les deux types de « robots » testés

Ils ont testé cinq modèles d'IA différents, qui se répartissaient en deux types de personnalité distincts :

  • Les « Stratèges aveugles » (grands modèles coûteux comme GPT et Gemini) :

    • La métaphore : Imaginez un grand maître d'échecs brillant qui porte des lunettes épaisses et embuées par le brouillard.
    • Ce qu'ils ont fait : Ils étaient excellents dans les parties de réflexion. Ils comprenaient la physique, élaboraient d'excellents plans et savaient exactement quoi faire.
    • L'échec : Quand il s'agissait de cliquer réellement avec la souris, ils étaient terribles. Ils ne pouvaient pas voir exactement où se trouvait l'objet. Ils planifiaient un mouvement parfait mais cliquaient à 10 pouces à gauche, manquant complètement la cible. Ils étaient « aveugles » aux détails précis nécessaires pour exécuter leurs idées intelligentes.
  • Les « Opérateurs myopes » (modèles spécialisés comme UI-Tars) :

    • La métaphore : Imaginez un chirurgien très précis aux mains stables, mais qui n'a aucune idée de l'opération qu'il est censé réaliser.
    • Ce qu'ils ont fait : Ils étaient excellents pour cliquer au bon endroit. Si vous leur disiez « cliquez ici », ils le faisaient parfaitement.
    • L'échec : Ils ne pouvaient pas anticiper. Ils ne comprenaient pas la réaction en chaîne. Ils cliquaient sur le bon bouton mais dans le mauvais ordre, ou restaient bloqués dans une boucle à faire la même chose encore et encore, sans jamais réaliser qu'ils échouaient.

3. Le verdict : Le fossé entre la pensée et l'action

La conclusion principale de l'article est que les modèles d'IA actuels ne possèdent pas encore de compétences de résolution de problèmes humaines dans ces jeux.

  • La déconnexion : Il existe un énorme fossé entre planifier et faire. Les modèles les plus intelligents peuvent planifier une solution mais échouent à l'exécuter car ils ne peuvent pas « voir » avec suffisamment de précision. Les modèles capables de « voir » avec précision ne sont pas assez intelligents pour planifier la solution.
  • Le résultat : Lors du test final (résoudre l'énigme entière), chaque modèle a échoué. Aucun d'eux n'a pu construire la machine avec succès du début à la fin.

4. Pourquoi cela compte (selon l'article)

Les chercheurs voulaient voir si l'IA pouvait simplement « lire le manuel » et jouer au jeu comme un humain. Ils ont constaté que, bien que l'IA s'améliore dans la compréhension du langage et des images séparément, elle lutte toujours pour combiner le raisonnement logique (la pensée) avec l'action continue (le contrôle précis de la souris).

En bref : l'IA est comme un architecte génie capable de dessiner un plan parfait mais qui ne peut pas tenir un marteau assez fermement pour construire la maison. Tant que l'IA ne pourra pas faire les deux en même temps, elle ne pourra pas vraiment résoudre ces énigmes comme un humain.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →