← Derniers articles
🤖 AI

AdaR: A Framework for Equipping LLMs with Adaptive Reasoning

Le cadre AdaR améliore la robustesse et la généralisation du raisonnement mathématique des grands modèles de langage en les entraînant par apprentissage par renforcement sur des requêtes synthétisées automatiquement et logiquement équivalentes afin de pénaliser les corrélations spécieuses et d'encourager un raisonnement adaptatif.

Auteurs originaux : Zhejian Lai, Xiang Geng, Zhijun Wang, Yang Bai, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xuezhi Cao, Xunliang Cai, Shujian Huang

Publié 2026-08-25
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhejian Lai, Xiang Geng, Zhijun Wang, Yang Bai, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xuezhi Cao, Xunliang Cai, Shujian Huang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le vaste paysage de l'intelligence artificielle, les grands modèles de langage sont apparus comme des outils puissants capables de résoudre des problèmes complexes, de l'écriture de poésie au débogage de code. Parmi leurs prouesses les plus impressionnantes figure le raisonnement mathématique, où ces systèmes décomposent une question en une série d'étapes logiques pour parvenir à une solution. Pendant des années, les chercheurs ont célébré cette capacité, supposant que lorsqu'un modèle résout un problème correctement, il comprend véritablement la logique sous-jacente. Cependant, un examen plus approfondi révèle une faille troublante : beaucoup de ces modèles ne raisonnent pas réellement sur le problème. Au lieu de cela, ils mémorisent souvent des motifs issus de leurs données d'entraînement. Ils apprennent à associer des nombres ou des phrases spécifiques à certaines réponses, tout comme un élève qui mémorise le corrigé d'un examen blanc sans comprendre les mathématiques sous-jacentes. Lorsque l'examen change légèrement — quand les nombres sont différents ou que la formulation est modifiée — ces modèles trébuchent souvent, échouant à s'adapter car leur « raisonnement » n'était jamais réel pour commencer.

C'est le défi central abordé par une nouvelle étude de chercheurs de l'Université de Nanjing et de Meituan, qui ont développé un cadre appelé AdaR pour apprendre aux machines à penser de manière adaptative. L'équipe a découvert que la racine du problème réside dans ce qu'ils appellent le « raisonnement fallacieux » (spurious reasoning). Cela se produit lorsqu'un modèle s'appuie sur des connexions superficielles, telles que la valeur spécifique d'un nombre dans une question, plutôt que sur la structure logique du problème lui-même. Pour illustrer cela, imaginez un modèle entraîné à résoudre un problème où un nombre est élevé au cube. Si les données d'entraînement utilisaient toujours le nombre 3, le modèle pourrait apprendre à simplement produire « cube » dès qu'il voit un problème de multiplication, quels que soient les nombres réellement impliqués. Si le problème change pour impliquer un nombre différent, le modèle échoue car il n'a jamais appris la règle du passage au cube ; il a seulement appris à reconnaître le motif du nombre 3. Les chercheurs ont constaté que même les modèles avancés, qui performent brillamment sur les tests standards, souffrent de cette fragilité, incapables de généraliser leurs compétences à de nouveaux scénarios légèrement différents.

Pour corriger cela, les chercheurs ont créé un système qui force le modèle à apprendre la logique plutôt que les nombres. Ils ont commencé par prendre des problèmes mathématiques existants et les ont dépouillés de leur structure fondamentale, ou « template ». Ils ont ensuite utilisé un programme informatique pour générer automatiquement des milliers de nouvelles versions de ces problèmes en changeant les nombres spécifiques tout en gardant les étapes logiques exactement les mêmes. Crucialement, ils n'ont pas simplement demandé à un modèle de langage de deviner les nouvelles réponses ; ils ont écrit du code exécutable pour calculer les bonnes réponses avec une certitude absolue. Cela a permis de garantir que chaque nouveau problème créé était valide et possédait une solution vérifiée. Ils ont ensuite soumis leurs modèles à un processus d'entraînement rigoureux utilisant ces nouveaux problèmes variés. Au lieu de simplement montrer au modèle la bonne réponse, ils ont utilisé une méthode qui ne récompensait le modèle que lorsqu'il parvenait à résoudre l'ensemble des problèmes variés correctement. Si le modèle s'appuyait sur des motifs mémorisés, il échouerait sur les nouveaux nombres et recevrait une pénalité. S'il apprenait la logique réelle, il réussirait à travers toutes les variations et recevrait une récompense.

Les résultats de cette approche ont été frappants. Testés sur des types de problèmes mathématiques familiers et totalement nouveaux, les modèles entraînés avec ce cadre adaptatif ont montré des améliorations significatives. En moyenne, leur performance a bondi de plus de huit points par rapport aux autres méthodes, un gain substantiel dans le monde de l'intelligence artificielle. Plus important encore, les modèles sont devenus beaucoup plus robustes. Ils pouvaient gérer les changements de nombres dans un problème sans s'effondrer, prouvant qu'ils avaient appris les règles sous-jacentes plutôt que de simplement mémoriser des exemples spécifiques. Les chercheurs ont également observé un changement dans la façon dont les modèles « pensaient ». Avant cet entraînement, les modèles avaient tendance à se concentrer sur les nombres spécifiques d'une question, ignorant la structure. Après l'entraînement, leur attention s'est déplacée vers la structure du problème elle-même, leur permettant de traiter les variables inconnues avec la même rigueur logique que les nombres connus. Ce changement suggère que les modèles développaient une forme de pensée algébrique, traitant les problèmes comme des systèmes de relations plutôt que comme des listes de faits à rappeler.

L'étude a également exploré comment différents types de changements affectaient le processus d'apprentissage. Ils ont découvert que changer les nombres dans les problèmes était bien plus efficace pour enseigner le raisonnement au modèle que de simplement réécrire les questions avec des mots différents. Cela indique que la clé du raisonnement adaptatif est d'exposer le modèle à une grande variété de scénarios numériques, le forçant à s'appuyer sur la logique pour naviguer à travers les différences. Les chercheurs ont noté que, bien que la méthode fonctionne bien, elle avait des limites ; elle nécessitait que les problèmes soient solubles par un programme informatique, ce qui signifiait qu'elle était mieux adaptée aux tâches mathématiques et logiques plutôt qu'à des domaines plus abstraits comme la démonstration de théorèmes complexes. De plus, le succès de la méthode dépendait du fait que le modèle possède déjà une base solide de connaissances mathématiques. Le système ne pouvait pas enseigner le raisonnement à partir de zéro à un modèle qui ne savait rien ; il ne pouvait qu'affiner le raisonnement d'un modèle possédant déjà les briques élémentaires.

En fin de compte, ce travail offre une voie claire pour rendre l'intelligence artificielle plus fiable. En passant de la simple mémorisation vers le raisonnement adaptatif, les chercheurs ont montré qu'il est possible de construire des modèles capables de gérer l'imprévu. Les conclusions suggèrent que l'avenir des systèmes intelligents ne réside pas seulement dans le fait de les rendre plus grands ou plus rapides, mais dans l'enseignement des règles qui régissent le monde, plutôt que de simples exemples spécifiques qu'ils ont vus auparavant. À mesure que ces modèles s'intègrent dans notre vie quotidienne, de la résolution d'équations financières à la planification de logistiques complexes, la capacité à s'adapter à de nouvelles informations sans échouer sera essentielle. Le cadre AdaR fournit un schéma directeur pour y parvenir, transformant des machines fragiles de reconnaissance de formes en penseurs flexibles et logiques, capables de naviguer dans un monde en constante évolution.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →