← Derniers articles
🤖 AI

The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

KnotBench introduit un benchmark rigoureux utilisant près de 860 000 diagrammes de nœuds pour démontrer que les modèles vision-langage actuels, malgré une performance améliorée avec les modes « réflexion », éprouvent fondamentalement des difficultés à traduire les structures visuelles de nœuds en raisonnement symbolique exploitable, échouant souvent à surpasser les bases aléatoires sur des tâches nécessitant une manipulation diagrammatique.

Auteurs originaux : Hao Liu, Jicheng Liu

Publié 2026-05-12
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hao Liu, Jicheng Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédiez un robot très intelligent capable d'examiner une image d'un fil emmêlé et de la décrire parfaitement. Il peut dire : « Je vois une boucle rouge passant au-dessus d'une boucle bleue, qui passe ensuite sous une boucle verte. » Il possède une excellente vue.

Mais voici le hic : si vous demandez à ce même robot de démêler le fil, ou de vous dire si deux images différentes de nœuds représentent en réalité le même nœud simplement dessiné différemment, il échoue complètement. Il peut décrire le nœud, mais il ne peut pas « jouer » avec lui dans son esprit.

Ce papier, intitulé "Le Nœud Gordien pour les VLM", introduit un nouveau test appelé KnotBench pour prouver exactement l'ampleur de cet écart entre « voir » et « faire » pour les modèles d'IA modernes.

Le Contexte : Un Jardin Numérique de Nœuds

Les chercheurs ont créé un vaste jardin de 858 000 images de nœuds.

  • La Source : Ils ont commencé avec 1 951 nœuds « prototypes » de base (les briques de construction les plus simples de la théorie des nœuds).
  • La Magie : Ils ont utilisé une règle mathématique (appelée mouvement de Reidemeister) pour tordre, tourner et redessiner ces nœuds des milliers de fois.
  • Le Résultat : Vous pourriez avoir une image d'un simple nœud « trèfle » avec 3 croisements, et une autre image du même nœud exact avec 20 croisements, ayant l'air complètement différent. Ou bien, vous pourriez avoir deux images qui semblent presque identiques mais qui sont en réalité des nœuds différents (comme un gant gauche par rapport à un gant droit).

L'ordinateur connaît la « véritable identité » de chaque nœud car il les a générés à l'aide des mathématiques, et non par des suppositions humaines. Cela rend le test parfaitement équitable.

Le Test : 14 Façons de Rester Bloqué

Les chercheurs ont demandé à quatre des modèles d'IA les plus intelligents disponibles (y compris Claude Opus 4.7 et GPT-5) d'effectuer 14 tâches différentes. Ils ont divisé les tâches en deux groupes pour voir où l'IA échoue :

  1. Le Groupe « Image » : L'IA examine une image du nœud.
  2. Le Groupe « Texte » : L'IA examine une liste de chiffres et de lettres (un code) décrivant le nœud.

Voici ce qu'ils ont demandé à l'IA de faire, en utilisant des analogies simples :

  • Le Test « Même ou Différent ? » (Famille A) : « Ces deux images représentent-elles le même nœud ? »

    • Le Piège : Parfois, les images semblent totalement différentes mais représentent le même nœud. Parfois, elles semblent presque identiques mais sont différentes.
    • Le Résultat : Lorsqu'on lui donnait le code texte, l'IA était excellente dans cette tâche. Lorsqu'on lui donnait l'image, elle devinait au hasard, comme un singe lançant des fléchettes.
  • Le Test « Qu'est-ce qui s'est passé ? » (Famille B) : « Je vous ai montré un nœud, puis j'ai effectué un petit mouvement (comme ajouter une boucle). Quel mouvement ai-je effectué ? »

    • Le Piège : Cela oblige l'IA à simuler mentalement le mouvement. « Si je tire ce fil ici, à quoi ressemble l'image ? »
    • Le Résultat : Lorsqu'on lui donnait le code texte, l'IA pouvait le comprendre. Lorsqu'on lui donnait l'image, elle échouait lamentablement. Un modèle (GPT-5) s'est contenté de deviner la réponse la plus courante (« R3 ») encore et encore, comme un élève qui a mémorisé la clé des réponses sans avoir appris les mathématiques.
  • Le Test « Comptage » (Famille C) : « Combien de fois les fils se croisent-ils ? »

    • Le Résultat : L'IA pouvait compter 8 croisements facilement. Mais une fois le nœud devenu complexe (17+ croisements), le décompte de l'IA est devenu un désastre complet. Elle ne pouvait même pas compter les éléments sur lesquels elle regardait.
  • Le Test « Traducteur » (Famille D) : « Voici une image. Écrivez le code secret correspondant. »

    • Le Résultat : Zéro. Aucun des modèles n'a pu le faire. Ils n'ont pas pu traduire l'image visuelle en code mathématique, même avec leur mode « réflexion » activé.

La Grande Découverte : Le « Fossé Perception-Opération »

Le papier qualifie ce point d'échec de « Fossé Perception-Opération ».

Pensez-y ainsi :

  • La Perception consiste à regarder une carte et à dire : « Je vois une rivière et un pont. »
  • L'Opération consiste à regarder cette même carte et à dire : « Si je traverse le pont, j'arriverai de l'autre côté. »

Les modèles d'IA sont incroyables en Perception. Ils peuvent décrire le nœud. Mais ils sont terribles en Opération. Ils ne peuvent pas prendre ce qu'ils voient et le manipuler mentalement pour résoudre un problème.

Est-ce que « Réfléchir » Aide ?

Les chercheurs ont activé le mode « réflexion » de l'IA (où le modèle parle à lui-même avant de répondre).

  • Est-ce que cela a aidé ? Oui, mais seulement un peu.
  • Où cela a-t-il aidé ? Seulement lorsque l'IA recevait le code texte. Si l'IA devait d'abord regarder une image, « réfléchir » n'a pas résolu le problème. C'est comme donner une calculatrice à quelqu'un qui ne sait pas lire les chiffres affichés à l'écran ; la calculatrice est inutile.

La Conclusion

Le papier conclut que les modèles d'IA actuels sont comme des photographes qui ne peuvent pas être mécaniciens. Ils peuvent prendre une photo parfaite d'un nœud et décrire chaque détail, mais ils manquent du « simulateur » interne que les humains utilisent pour tordre et tourner mentalement des objets afin de comprendre leur fonctionnement.

Ils peuvent voir le nœud, mais ils ne peuvent pas agir dessus. Jusqu'à ce que l'IA construise ce « simulateur mental » interne, elle restera aveugle à la logique des diagrammes, peu importe le nombre d'images qu'elle voit.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →