← Derniers articles
💬 NLP

Investigating LLM's Problem Solving Capability -- a Study on Statics Questions

Cette étude évalue les capacités des grands modèles de langage à résoudre des problèmes de statique via une approche de distillation de modèle, révélant que, bien qu'ils soient performants sur les questions textuelles uniquement, leur précision diminue considérablement lorsque des diagrammes et un raisonnement multi-étapes sont requis en raison de difficultés à appliquer de manière cohérente l'information visuelle plutôt que des limitations de reconnaissance d'image.

Auteurs originaux : Tanner Culleton, Hung-Fu Chang

Publié 2026-06-26
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Tanner Culleton, Hung-Fu Chang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez un étudiant très intelligent et cultivé nommé « ChatGPT », qui a lu presque tous les livres de la bibliothèque. Vous voulez tester s'il est capable de résoudre des problèmes de devoirs d'ingénierie difficiles, plus précisément dans une matière appelée la Statique (qui traite de l'équilibre des forces sur des objets immobiles, comme des ponts ou des grues).

Voici ce que les chercheurs ont fait, expliqué simplement :

1. Le problème du « Copier-Coller »

D'abord, les chercheurs ont tenté la chose évidente : ils ont pris de vraies questions de manuels scolaires et ont demandé à ChatGPT de les résoudre.

  • Le résultat : Ce fut un désastre. L'étudiant s'est emmêlé les pinceaux, surtout lorsque les problèmes impliquaient des dessins en 3D. Il confondait les directions (comme dire « haut » quand il voulait dire « droite ») et faisait des erreurs de calcul.
  • L'analogie : C'était comme demander à un étudiant de lire une carte écrite dans une langue qu'il connaît à peine. Il connaissait les mots, mais il ne parvenait pas à comprendre les directions.

2. L'astuce de l'« Ingénierie Inverse » (Distillation de Modèle)

Puisque les questions des manuels étaient trop difficiles, les chercheurs ont tenté une astuce ingénieuse appelée Distillation de Modèle. Au lieu de demander à l'étudiant de résoudre les questions des autres, ils lui ont demandé d'écrire ses propres questions.

  • La logique : Ils se sont dit : « Si ChatGPT peut écrire une bonne question, c'est qu'il connaît probablement la réponse à ce type précis de question car il l'a "apprise" de ses propres données d'entraînement. »
  • Le processus : Ils ont demandé à ChatGPT de générer 50 problèmes de statique. Ils ont remarqué que l'étudiant écrivait sans cesse les mêmes problèmes simples en 2D (plats). Ils ont donc sélectionné les 25 meilleures questions uniques que ChatGPT semblait bien comprendre.

3. Les trois niveaux de l'examen

Les chercheurs ont créé trois « examens » différents à partir de ces 25 questions pour voir comment le cerveau de l'étudiant fonctionnait :

  • Examen A (Texte uniquement) : Ils ont demandé à ChatGPT de résoudre les questions qu'il avait lui-même écrites, en utilisant uniquement des mots.
    • Résultat : Score parfait (100 %). L'étudiant connaissait les réponses car c'est lui qui avait écrit les questions !
  • Examen B (Avec des images) : Ils ont repris ces mêmes questions textuelles et ont dessiné des diagrammes simples pour chacune d'elles.
    • Résultat : Le score est tombé à 68 %. L'étudiant pouvait toujours lire les mots, mais l'image l'a dérouté. Il avait du mal à relier le dessin au calcul mathématique.
  • Examen C (Le test des « Nouveaux Nombres ») : Ils ont repris les diagrammes de l'Examen B et ont changé tous les chiffres (par exemple, en changeant une force de 10 lbs à 15 lbs).
    • Résultat : Le score est tombé à 60 %. Cela prouvait que l'étudiant ne se contentait pas de mémoriser les réponses. Il essayait de résoudre le problème de manière inédite, mais il commettait des erreurs au milieu du processus.

4. Qu'ont-ils appris ?

Les chercheurs ont comparé ChatGPT à un autre étudiant IA nommé « Gemini ».

  • La grande découverte : Le problème n'était pas que l'IA ne pouvait pas « voir » les images. Le problème était qu'elle ne pouvait pas penser par étapes.
  • L'analogie : Imaginez un chef qui peut lire une recette parfaitement (Texte uniquement). Si vous lui donnez les ingrédients et une photo du plat (Diagramme), il peut encore cuisiner. Mais si vous lui demandez de cuisiner un repas complexe à plusieurs services où il doit ajuster la recette à mi-chemin (Raisonnement multi-étapes), il commence à faire tomber les ingrédients ou à oublier l'étape suivante.
  • La conclusion : L'IA est très douée pour les calculs simples en une seule étape. Mais lorsqu'elle doit regarder une image, extraire des informations, puis utiliser ces informations dans trois ou quatre étapes différentes pour obtenir un résultat final, elle s'y perd. Elle suit la bonne méthode, mais obtient souvent le mauvais chiffre à la fin.

Résumé

L'article conclut que, bien que l'IA devienne très performante pour lire et écrire, elle reste encore un peu maladroite lorsqu'il s'agit de raisonnement visuel et de chaînes de logique longues et complexes. C'est comme un étudiant qui connaît parfaitement la théorie, mais qui perd ses moyens lorsqu'on lui demande de l'appliquer à un dessin réel avec des chiffres changeants.

Note : Les chercheurs n'ont testé que ces problèmes d'ingénierie spécifiques. Ils n'ont pas affirmé que cela s'applique aux diagnostics médicaux, aux conseils juridiques ou à d'autres domaines, et n'ont pas suggéré comment améliorer l'IA pour l'avenir. Ils ont simplement rapporté la façon dont l'IA s'est comportée sur cet ensemble spécifique de puzzles d'ingénierie.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →