When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models
Cet article présente un benchmark diagnostique démontrant que, si les grands modèles de langage atteignent une haute précision sur des tâches procédurales courtes, leur capacité à exécuter fidèlement des algorithmes étape par étape se dégrade considérablement à mesure que la complexité augmente, révélant ainsi qu'une forte performance sur les benchmarks masque souvent des faiblesses substantielles dans le suivi des instructions.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
L'Idée Principale : Le Test de la « Recette »
Imaginez que vous donniez à un chef une recette très spécifique, étape par étape, pour faire un gâteau. La recette dit : « Mélangez la farine et le sucre. Ajoutez ensuite les œufs. Remuez pendant 10 secondes. Puis faites cuire. »
Vous pourriez vous attendre à ce que le chef suive chaque instruction dans l'ordre. Mais que se passe-t-il si le chef, au lieu de suivre les étapes, devine simplement à quoi un gâteau a généralement le goût et vous remet un résultat ? Ou que s'il s'arrête à mi-chemin, oublie les trois dernières étapes et se contente de dire : « Voici le gâteau » ?
Ce papier est comme une immense cuisine d'expérimentation où des chercheurs ont donné à 14 modèles d'IA différents (« chefs ») des milliers de ces recettes spécifiques. Les recettes étaient de simples problèmes de mathématiques, mais elles étaient conçues pour être longues et piégeuses. Le but n'était pas de voir si l'IA pouvait faire des mathématiques difficiles, mais de voir si elle pouvait suivre fidèlement les instructions du début à la fin.
Le Déroulement : L'« Escalier Infini »
Les chercheurs ont conçu un test spécial avec deux façons principales de rendre la tâche plus difficile :
- La Longueur de l'Escalier : Ils ont donné à l'IA des recettes comportant entre 5 et 95 étapes. Imaginez un escalier. Un escalier de 5 marches est facile à monter. Un escalier de 95 marches est épuisant.
- La Règle du « Regard en Arrière » : Dans certaines recettes, l'étape 10 n'utilisait pas seulement le résultat de l'étape 9. Elle pouvait dire : « Revenez en arrière et utilisez le résultat de l'étape 3. » C'est comme dire à un randonneur : « Faites un pas en avant, puis retournez au troisième arbre que vous avez passé et ramassez une pierre là-bas. » Cela force l'IA à se souvenir de choses très anciennes dans le passé.
Ce Qu'ils Ont Découvert : Le « Lâcher de Mémoire »
Les résultats ont été surprenants. Même si les mathématiques étaient simples (seulement de l'addition, de la soustraction, de la multiplication ou de la division), les IA se sont de moins en moins bien débrouillées à mesure que les recettes s'allongeaient.
- La Chute : Sur une courte recette de 5 étapes, les IA trouvaient la bonne réponse environ 61 % du temps. Mais sur une longue recette de 95 étapes, leur taux de réussite a chuté à seulement 20 %.
- Le Problème du « Regard en Arrière » : Lorsque l'IA devait se souvenir d'étapes très anciennes (comme l'étape 3), leurs performances ont encore davantage baissé. C'est comme si l'IA se perdait dans l'histoire, ne sachant plus où elle en était.
Comment les IA Ont Échoué : Les Chefs « Tricheurs »
Les chercheurs n'ont pas seulement regardé la réponse finale ; ils ont observé comment l'IA tentait de résoudre le problème. Ils ont découvert que les IA ne faisaient souvent pas le travail. Au lieu de cela, elles tentaient de « tricher » ou de « prendre des raccourcis » de plusieurs façons amusantes :
- La « Sortie Anticipée » (Sous-exécution) : C'était l'échec le plus courant. L'IA commençait la recette, faisait quelques étapes, s'ennuyait ou se confondait, puis sautait directement à la fin, faisant semblant d'avoir tout terminé. C'est comme un élève qui écrit la première phrase d'une dissertation, puis saute à la conclusion sans écrire le milieu.
- Les Étapes « Hallucinées » : Parfois, l'IA inventait des étapes supplémentaires qui n'étaient pas du tout dans la recette. C'est comme un chef ajoutant « saupoudrez de poussière d'unicorne » alors que la recette ne disait jamais de le faire.
- Le Piège de l'« Auto-correction » : Parfois, l'IA se trompait dans la réponse, s'en rendait compte et tentait de la corriger plus loin dans le texte. Mais au moment où elle la corrigeait, elle avait déjà gâché le résultat final.
- Le « Détecteur de Motifs » : Au lieu de faire les mathématiques, certaines IA semblaient deviner la réponse en fonction de l'apparence des nombres, plutôt que de suivre réellement les étapes.
La Conclusion Principale
Le papier conclut que le fait qu'une IA vous donne une réponse finale « plausible » ne signifie pas qu'elle a réellement fait le travail.
Pensez-y comme à un élève passant un examen. S'il trouve la bonne réponse, vous pourriez penser qu'il a étudié. Mais ce papier montre que parfois, il devine simplement ou se souvient de la réponse d'un examen précédent, au lieu de réellement résoudre le problème étape par étape.
En bref : Les modèles d'IA actuels sont excellents pour avoir l'air intelligents et donner un résultat final, mais ils peinent à agir comme un robot fiable qui suit une longue et ennuyeuse liste d'instructions exactement comme elle est écrite. Lorsque les instructions deviennent trop longues ou nécessitent de se souvenir de trop de choses dans le passé, l'IA a tendance à perdre le fil et à arrêter de suivre les règles.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.