← Derniers articles
💬 NLP

Teaching Language Models to Think in Code

L'article présente ThinC, un cadre qui déplace le raisonnement des modèles de langage de l'alternance entre langage naturel et code vers un paradigme centré sur le code où le code lui-même agit comme le principal raisonneur, atteignant des performances de pointe sur des benchmarks mathématiques de niveau compétition en distillant des trajectoires de code et en utilisant un affinage supervisé suivi d'un apprentissage par renforcement.

Auteurs originaux : Hyeon Hwang, Jiwoo Lee, Jaewoo Kang

Publié 2026-05-11
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hyeon Hwang, Jiwoo Lee, Jaewoo Kang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de résoudre une énigme mathématique très délicate. Vous avez deux façons de le faire :

  1. L'Ancienne Méthode (Raisonnement Entrelacé) : Vous vous parlez en anglais, en déterminant les étapes. « D'accord, d'abord je dois multiplier 500 par 0,12... » Ensuite, vous devenez un peu incertain, alors vous demandez à une calculatrice (l'outil de code) de vérifier votre travail. Mais voici le hic : si vous avez fait une erreur dans votre réflexion en anglais (comme dire que 500 fois 0,12 fait 50 au lieu de 60), vous risquez de taper par erreur ce mauvais nombre dans la calculatrice. La calculatrice fait simplement ce que vous lui dites ; elle ne sait pas que vous avez fait une erreur. Elle calcule à partir de votre mauvais nombre, et vous obtenez une mauvaise réponse.
  2. La Nouvelle Méthode (THINC) : Vous prenez un tout petit instant pour planifier votre stratégie en anglais (« Je dois trouver l'aire de cette forme »), puis vous remettez immédiatement l'ensemble du travail à un programmeur robot. Le robot écrit du code, l'exécute, voit le résultat, écrit plus de code basé sur ce résultat, et continue ainsi jusqu'à ce que la réponse apparaisse. Vous ne faites aucun calcul dans votre tête ni dans des phrases en anglais ; le robot fait tout le gros œuvre.

Ce papier présente THINC (Thinking in Code), une nouvelle façon d'enseigner aux modèles d'IA de résoudre des problèmes mathématiques en laissant le code lui-même être le penseur, plutôt que d'être simplement un outil que l'IA utilise pour vérifier son travail.

Le Problème avec l'Ancienne Méthode

Les auteurs affirment que les modèles d'IA actuels qui mélangent la réflexion en anglais avec du code (appelés Raisonnement Intégré aux Outils) présentent trois défauts majeurs, qu'ils appellent des « limitations structurelles » :

  • Le Vérificateur « Post-Hoc » : L'IA écrit souvent toute la solution en anglais d'abord, puis exécute du code juste pour dire : « Oui, c'est correct. » Le code ne fait pas vraiment la réflexion ; il n'est qu'un tampon d'approbation à la fin.
  • L'« Erreur Silencieuse » : Si l'IA fait une erreur de calcul dans ses pensées en anglais (comme calculer 12 % de 500 comme étant 50 au lieu de 60), elle pourrait copier ce mauvais nombre dans le code. Le code calcule alors avec le mauvais nombre, et l'IA ne s'en rend jamais compte. L'erreur est « silencieuse » parce que le code suit simplement les ordres.
  • Le « Double Travail » : L'IA écrit souvent une longue explication en anglais de comment résoudre le problème, puis écrit du code qui fait exactement la même chose. C'est comme écrire une recette en anglais, puis écrire la recette exacte en français, juste pour prouver que vous savez cuisiner. C'est redondant et confus.

La Solution THINC

THINC change les règles du jeu. Au lieu que l'IA parle de mathématiques, l'IA parle en mathématiques (via le code).

  • Le Plan : L'IA commence par une courte phrase en anglais pour définir la stratégie (par exemple : « Je vais boucler sur les nombres pour trouver la réponse »).
  • Le Travail : Après cette unique phrase, tout se déroule dans des blocs de code. L'IA écrit un morceau de code, l'exécute, voit la sortie, puis écrit le prochain morceau de code basé sur cette sortie.
  • Le Résultat : La réponse finale provient directement de la calculatrice de l'ordinateur (l'interpréteur), et non d'une supposition de l'IA en anglais.

Comment Ils Ont Enseigné à l'IA

Les chercheurs n'ont pas simplement dit à l'IA de faire cela ; ils l'ont enseignée à travers un processus en trois étapes :

  1. Distillation (Le Professeur) : Ils ont pris un modèle d'IA très intelligent et de grande taille et lui ont demandé de résoudre des problèmes mathématiques en utilisant ce nouveau style « Code-First ». Ils ont collecté 12 200 exemples de ces solutions parfaites « Code-First ».
  2. Affinement Supervisé (L'Élève) : Ils ont enseigné à deux modèles d'IA plus petits (l'un avec 1,7 milliard de « cellules cérébrales » et l'autre avec 4 milliards) à imiter ces exemples. Cela a enseigné aux modèles l'habitude de penser en code.
  3. Apprentissage par Renforcement (L'Entraîneur) : Ils ont laissé les modèles s'entraîner sur des milliers de problèmes mathématiques. Si le modèle obtenait la bonne réponse, il recevait une « récompense ». S'il échouait, il apprenait à essayer une stratégie de code différente. Cela a rendu les modèles beaucoup plus intelligents et plus fiables.

Les Résultats : Petits Modèles, Grandes Victoires

Le papier a testé ces nouveaux modèles sur des concours mathématiques très difficiles de niveau compétition (comme AIME et HMMT).

  • Battre les Géants : Le petit modèle THINC à 4 milliards de paramètres a obtenu 78,1 % en moyenne. C'est mieux que le modèle 1,7B, mieux que les autres modèles « Intégrés aux Outils », et même mieux qu'un modèle massif à 235 milliards de paramètres qui ne pense qu'en anglais !
  • Fiabilité : Dans 99,2 % des cas, la réponse finale a été directement extraite de la sortie de code de l'ordinateur. L'IA n'a pas deviné ; elle a calculé.
  • Se Relever : Si le code faisait une erreur et plantait (une erreur), le modèle THINC était étonnamment bon pour la corriger dans le bloc de code suivant sans avoir besoin de « parler » pour s'en sortir. Les autres modèles qui mélangent anglais et code ont tendance à s'effondrer lorsqu'ils rencontrent une erreur de code.

La Conclusion

Le papier affirme qu'en forçant l'IA à arrêter de « parler » des mathématiques et à commencer à « faire » les mathématiques en code, les modèles deviennent plus précis, font moins d'erreurs arithmétiques bêtes et résolvent des problèmes difficiles plus efficacement. C'est comme passer d'un humain essayant de faire une division longue dans sa tête à un humain qui sait programmer une calculatrice pour le faire à sa place, étape par étape, sans jamais commettre d'erreur de calcul mental.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →