← Derniers articles
💻 computer science

Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction

Cet article introduit le benchmark Constraint Saturation Evaluation (CSE) pour démontrer que, bien que les grands modèles de langage puissent suivre des contraintes individuelles avec expertise, leur capacité à satisfaire plusieurs contraintes simultanées s'effondre de manière multiplicative au-delà de 5 à 6 contraintes en raison de l'accumulation indépendante des échecs, affectant particulièrement le raisonnement structurel par rapport aux détails lexicaux.

Auteurs originaux : Mariya I. Vasileva

Publié 2026-08-14
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mariya I. Vasileva

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de cuisiner un gâteau, mais au lieu de simplement suivre une seule recette, on vous donne une liste de règles. « Utilisez exactement 200 grammes de farine », « N'utilisez pas de sucre », « Le gâteau doit être bleu », et « Il doit avoir la forme d'une étoile ». Si vous n'avez qu'une seule règle, c'est facile. Si vous en avez deux ou trois, vous pouvez probablement vous en sortir. Mais qu'arrive-t-il si quelqu'un vous tend une liste de cinquante règles d'un coup ? C'est le monde des Grands Modèles de Langage (LLM), ces programmes informatiques super intelligents qui écrivent des histoires, répondent à des questions et résolvent des problèmes. Ces modèles sont comme des chefs numériques qui ont lu presque tous les livres de la bibliothèque. Les scientifiques savent depuis un certain temps que ces chefs sont excellents pour suivre une instruction unique. Mais personne ne savait ce qui se passait quand on leur demandait de jongler avec une douzaine d'instructions en même temps. Est-ce que leurs performances chutent légèrement, comme un coureur fatigué qui ralentit ? Ou est-ce qu'elles s'effondrent soudainement, comme un château de cartes qui s'écroule quand on souffle dessus ? Cette question est cruciale car, alors que nous commençons à utiliser ces chefs IA pour construire des outils du monde réel — comme des systèmes de sécurité, des documents juridiques ou du code complexe — nous devons savoir exactement combien de règles ils peuvent gérer avant de commencer à commettre des erreurs.

Entrez dans une nouvelle étude qui traite ces modèles d'IA comme une expérience scientifique dans une cuisine géante. Les chercheurs, dirigés par Mariya Vasileva, ont construit un terrain de test spécial appelé Évaluation de la Saturation des Contraintes (CSE). Voyez cela comme un « test de résistance » pour le cerveau de l'IA. Ils ne se sont pas contentés de demander aux modèles d'écrire une histoire ; ils leur ont donné un nombre spécifique de règles à suivre simultanément, allant d'une seule règle jusqu'à douze. Ces règles étaient strictes et immuables, comme « Votre réponse doit comporter exactement 3 paragraphes », « La lettre 'e' est interdite », ou « Chaque phrase doit commencer par la lettre 'A' ». Les chercheurs ont ensuite observé combien de fois l'IA parvenait à respecter chaque règle parfaitement en même temps.

Les résultats ont été surprenants et un peu dramatiques. L'étude a révélé que les modèles d'IA ne se contentent pas de se fatiguer à mesure que vous ajoutez des règles ; ils atteignent un point de bascule. Imaginez que vous empilez des blocs. Pour les premiers blocs, la tour est stable. Mais une fois que vous atteignez une certaine hauteur — environ 5 ou 6 règles, même pour les modèles les plus intelligents — la tour ne se contente pas de vaciller ; elle s'effondre soudainement. Les chercheurs ont découvert que, bien qu'une IA puisse encore réussir 40 % des règles individuelles lorsqu'il y en a huit, la probabilité qu'elle réussisse toutes les huit en même temps tombe à moins de 6 %. C'est comme un musicien qui peut jouer une note parfaitement, ou même deux, mais dès qu'on lui demande de jouer une symphonie complexe avec douze instruments différents à la fois, il oublie totalement la mélodie.

L'étude a également déterminé pourquoi cela se produit. Il s'avère que les règles ne se battent pas entre elles comme des ennemies dans un jeu. Au lieu de cela, elles agissent comme une réaction en chaîne. Si l'IA commet une erreur sur une petite partie de la réponse — par exemple, si elle oublie de compter correctement les phrases — alors toutes les règles qui dépendent des phrases échouent en même temps. Ce n'est pas que les règles se confondent, c'est que la « mémoire de travail » de l'IA est surchargée. Les chercheurs ont constaté que les règles exigeant que l'IA garde une trace des choses au fil du temps (comme compter les mots ou maintenir un motif) s'effondrent deux fois plus vite que les règles simples (comme « ne pas utiliser un mot spécifique »).

Peut-être la partie la plus intéressante est ce que les chercheurs ont tenté de réparer. Ils ont demandé : « Pouvons-nous aider l'IA en la faisant planifier à l'avance ? Ou en la laissant essayer à nouveau ? » Ils ont essayé de donner à l'IA un « brouillon » pour planifier sa réponse, ou de la laisser corriger ses propres erreurs. Le résultat ? Cela a aidé un tout petit peu, permettant peut-être à l'IA de gérer une ou deux règles supplémentaires, mais cela n'a pas empêché l'effondrement. La seule véritable solution, suggère l'article, est de rendre l'IA meilleure dans le respect de chaque règle individuelle dès le départ. Aucune planification ou tentative de correction ne peut réparer le fait que l'arithmétique du jonglage de trop de choses à la fois mène inévitablement à une chute de performance.

En fin de compte, cet article trace une ligne claire dans le sable. Pour les modèles d'IA les plus intelligents testés, la limite pour un suivi d'instructions multi-règles fiable est d'environ 5 à 6 contraintes. Au-delà de cela, le système devient peu fiable, non pas parce que l'IA est « stupide », mais parce que le nombre pur de choses qu'elle doit garder en tête à la fois crée un effondrement mathématique. C'est un rappel que même les chefs numériques les plus avancés ont une limite au nombre de recettes qu'ils peuvent suivre à la fois, et si nous voulons qu'ils fassent plus, nous devons les construire plus forts, et non pas simplement leur donner plus d'instructions.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →