← Derniers articles
🤖 machine learning

Is Code Better Than Language for Algorithmic Reasoning

Cet article démontre que pour les modèles de langage augmentés par des outils, l'avantage de performance du code sur le langage naturel dans le raisonnement algorithmique provient principalement de l'exécution externe fiable plutôt que de la représentation de code intermédiaire elle-même, car le raisonnement simulé par code n'apporte aucun gain significatif par rapport au raisonnement en langage naturel.

Auteurs originaux : Terry Tong, Yu Feng, Surbhi Goel, Dan Roth

Publié 2026-06-16
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Terry Tong, Yu Feng, Surbhi Goel, Dan Roth

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de résoudre une énigme mathématique très complexe. Vous avez deux manières principales d'obtenir la réponse :

  1. La méthode du « Parleur » : Vous demandez à un assistant intelligent de réfléchir à voix haute en anglais courant, étape par étape, puis de vous donner la réponse.
  2. La méthode du « Codeur » : Vous demandez au même assistant d'écrire un programme informatique pour résoudre l'énigme, puis vous laissez un ordinateur exécuter réellement ce programme pour obtenir la réponse.

Pendant longtemps, les gens ont remarqué que la méthode du « Codeur » fonctionnait généralement beaucoup mieux. Mais personne ne savait vraiment pourquoi. Était-ce parce que l'écriture de code force l'assistant à réfléchir plus clairement ? Ou était-ce parce que laisser un ordinateur exécuter le code est plus fiable que de faire confiance à l'assistant pour faire les calculs dans sa tête ?

Cet article met en place une expérience ingénieuse pour déterminer quel facteur est le véritable héros.

L'expérience des trois voies

Les auteurs ont créé une « autoroute à trois voies » pour tester cela, en utilisant un benchmark de 40 tâches de puzzles algorithmiques (comme le tri de listes, la recherche de chemins ou des mathématiques complexes).

  • Voie 1 (Le Pur Parleur) : L'assistant résout entièrement le problème en anglais. Il réfléchit, écrit un paragraphe de raisonnement, et donne la réponse.
    • Résultat : Il a obtenu environ 17 % des bonnes réponses.
  • Voie 2 (Le Faux Codeur) : L'assistant écrit le code (comme du Python), mais il fait semblant de l'exécuter. Au lieu de donner le code à un ordinateur, l'assistant lit son propre code et simule les étapes dans sa tête, écrivant le résultat en anglais.
    • Résultat : Il a obtenu environ 17 % des bonnes réponses.
    • La grande révélation : C'est presque exactement la même chose que la Voie 1. Écrire le code n'a pas aidé l'assistant à mieux réfléchir ; cela a simplement changé le format de ses pensées.
  • Voie 3 (Le Vrai Codeur) : L'assistant écrit exactement le même code que dans la Voie 2, mais cette fois, il remet le code à un véritable ordinateur (un environnement d'exécution Python) pour l'exécuter.
    • Résultat : Il a obtenu environ 49 % des bonnes réponses.

Le « Pourquoi » derrière la magie

L'article utilise plusieurs moyens créatifs pour expliquer ces résultats :

1. L'analogie de la « Traduction » (Représentation vs Exécution)
Considérez le « Trace » (les étapes de raisonnement) comme une recette.

  • La Voie 1 est une recette écrite sous la forme d'une longue histoire fleurie.
  • La Voie 2 est la même recette, mais écrite sous la forme d'une liste stricte et structurée.
  • La Voie 3 est cette liste stricte, mais au lieu de la donner à un chef humain qui essaierait de la lire et d'en deviner le résultat, vous la donnez à un chef robotique qui suit les instructions à la perfection.

L'expérience a montré que changer la recette (passer d'une histoire à une liste) n'a pas rendu le chef humain plus intelligent. Le chef humain (le LLM) commettait les mêmes erreurs qu'il lise l'histoire ou la liste. Le bond massif de performance n'a eu lieu que lorsque le chef robot (l'exécuteur informatique) a pris le relais.

2. La théorie du « Nuisance »
Les auteurs soutiennent que le langage naturel est plein de « bruit ». On peut dire la même chose de mille façons différentes (« additionnez les nombres », « faites la somme », « regroupez-les »). Cette variété supplémentaire perturbe le modèle. Le code est plus strict ; il y a moins de façons de dire la même chose.
Cependant, l'article prouve que même si le code est plus « propre », le modèle ne peut toujours pas utiliser cette clarté pour résoudre les problèmes mathématiques par lui-même. Le code ne donne pas magiquement de nouvelles compétences mathématiques au modèle.

3. Le test de « Récupération »
Les auteurs ont examiné les cas où l'ordinateur a trouvé la bonne réponse, mais où l'assistant humain (simulant le code) s'est trompé. Cela s'est produit 33 % du temps.
Inversement, ils ont examiné les cas où l'ordinateur a échoué (peut-être que le code était défectueux), mais où l'assistant humain a quand même trouvé la bonne réponse. Cela ne s'est produit que 1,6 % du temps.
Cela prou parfaitement que l'ordinateur est un « exécuteur » bien plus fiable que l'assistant humain ne l'est pour « simuler » le code.

L'essentiel

L'article conclut que le Code n'est pas meilleur que le Langage parce qu'il est un meilleur moyen de penser.

L'avantage d'utiliser le code n'est pas qu'il force l'IA à être plus intelligente. L'avantage est que le Code permet à l'IA de déléguer le travail à une machine qui ne fait pas d'erreurs de calcul.

  • Le goulot d'étranglement : Le problème n'est pas que l'IA ne sait pas écrire de bon code ; c'est que l'IA est mauvaise pour vérifier son propre travail ou faire les calculs dans sa tête.
  • La solution : La véritable puissance vient de l'outil (l'ordinateur qui exécute le code), et non du langage (le code lui-même).

En bref : si vous voulez qu'une IA résolve un problème mathématique difficile, ne lui demandez pas seulement d'écrire du code en espérant qu'elle trouve la réponse. Demandez-lui d'écrire du code, puis laissez un ordinateur l'exécuter réellement. C'est là que la magie opère.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →