← Derniers articles
💬 NLP

Prompt-Induced Waste in Large Reasoning Models: A Preregistered Two-Harness Benchmark of Coding Agents

Cette étude de référence préenregistrée démontre que la formulation des prompts et la conception du harnais augmentent considérablement les coûts de raisonnement des agents de codage de grande taille — souvent de 2,4 à 30 fois — sans améliorer le succès des tâches, des instructions spécifiques telles que « développer plusieurs approches » et certaines architectures de harnais étant les principaux moteurs de cette inefficacité.

Auteurs originaux : Sarel Weinberger, Amir Hozez

Publié 2026-08-04
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Sarel Weinberger, Amir Hozez

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous embauchiez un assistant robotique super intelligent pour réparer un grille-pain en panne. Vous ne voulez pas seulement que le robot le répare ; vous voulez qu'il réfléchisse d'abord à la manière de le réparer. Dans le monde de l'intelligence artificielle, ces étapes de « réflexion » sont appelées tokens de raisonnement. Tout comme un humain pourrait griffonner des notes, raturer et essayer différentes idées avant de résoudre un puzzle, ces modèles d'IA passent du temps et de l'argent à « délibérer » avant de vous donner une réponse.

Mais voici le hic : vous payez pour chaque pensée que le robot a, même celles qu'il jette. Si vous demandez au robot de « réfléchir très fort » ou d'« essayer cinq manières différentes », il pourrait le faire exactement ainsi, brûlant votre budget sans mieux réparer le grille-pain que si vous lui aviez simplement demandé de « réparer le grille-pain ». Ce document explore un recoin étrange de l'informatique où les chercheurs agissent comme des détectives, essayant de découvrir quels mots dans vos instructions font gaspiller de l'argent au robot et quels mots le maintiennent avec un budget serré. Ils ne se contentent pas de deviner ; ils mènent des milliers d'expériences contrôlées pour voir exactement combien coûtent différentes expressions.


La Grande Expérience des Prompts : Pourquoi vos mots coûtent de l'argent

Imaginez que vous avez une flotte de six chefs robots super intelligents différents. Vous voulez qu'ils écrivent du code (ce qui est comme une recette pour un ordinateur) pour résoudre 24 défis culinaires spécifiques. Mais il y a un piège : vous devez payer pour chaque pensée que les chefs ont pendant qu'ils cuisinent. Les chercheurs voulaient savoir : La façon dont vous rédigez votre commande change-t-elle la quantité de réflexion des chefs, et cette réflexion aide-t-elle réellement le plat à avoir meilleur goût ?

Pour le découvrir, ils ont mis en place un laboratoire de cuisine massif et super organisé. Ils n'ont pas fait que deviner ; ils ont écrit leurs règles avant de commencer à cuisiner (c'est ce qu'on appelle la « pré-enregistrement », comme écrire un menu avant d'aller à l'épicerie). Ils ont utilisé deux types différents de gestionnaires de cuisine (appelés « harnesses ») pour parler aux chefs : l'un était un gestionnaire direct et sans détour, et l'autre était un gestionnaire très bavard et détaillé qui envoyait une énorme quantité d'informations contextuelles avec chaque commande.

Voici ce qu'ils ont découvert après avoir mené plus de 4 600 sessions de cuisine :

1. Le piège du « Essayer tout »

Le plus grand gaspilleur d'argent ? Dire au robot : « développe plusieurs approches et compare-les. »
Cela semble intelligent, n'est-ce pas ? Comme un bon chef qui goûte trois sauces avant d'en choisir une. Mais pour ces robots d'IA, cette instruction a été un désastre. Cela les a fait réfléchir 2,4 à 7,4 fois plus que d'habitude. Et le pire ? Le plat final (le code) n'était pas meilleur. Ils ont simplement brûlé de l'argent supplémentaire pour réfléchir à des options qu'ils n'ont jamais utilisées. C'est comme payer un chef pour qu'il écrive trois recettes différentes pour un sandwich, qu'il les goûte toutes, puis qu'il vous serve le même sandwich qu'il aurait fait si vous lui aviez juste demandé « un sandwich ».

2. Les mots magiques qui ne servent à rien

Les gens disent souvent « réfléchis étape par étape » ou « réfléchis profondément » pour obtenir de meilleurs résultats. Les chercheurs ont découvert que pour ces robots de codage, ces mots magiques de « réflexion profonde » étaient du pur gaspillage. Ils ont fait réfléchir les robots 1,6 à 2,2 fois plus longtemps sans améliorer le résultat. C'est comme dire à une calculatrice de « réfléchir intensément » avant d'ajouter 2 + 2 ; la réponse est la même, mais vous avez payé pour le temps de réflexion supplémentaire.

3. Le hack de l'« Efficacité Bornée »

À l'inverse, il y avait une sauce secrète pour économiser de l'argent. Si vous donniez au robot une boîte stricte dans laquelle travailler — en lui disant exactement quel était l'objectif, quelles étaient les règles et quand s'arrêter — il réfléchissait en fait moins. Un robot a même réduit son temps de réflexion de moitié ! Ce modèle d'« efficacité bornée » était gratuit à utiliser et a rendu les robots plus rapides et moins chers sans altérer le code.

4. Le gestionnaire compte plus que le chef

L'une des découvertes les plus surprenantes est que celui que vous embauchez pour gérer le robot importe plus que le robot lui-même.
Ils ont testé le même robot avec deux gestionnaires différents. Un gestionnaire (PI.DEV) était efficace. L'autre (Claude Code) était comme un micro-gestionnaire qui envoyait un « discours d'introduction » 12 à 15 fois plus grand avec chaque message. Même lorsque les robots résolvaient le problème parfaitement, la version micro-gestionnaire coûtait 5 à 30 fois plus cher simplement à cause de la façon dont la conversation était gérée. Il s'avère que le « gestionnaire » (le logiciel qui entoure l'IA) est souvent la plus grosse partie de la facture, et non l'IA elle-même.

5. L'illusion de la « Remise Cachée »

Les chercheurs ont également examiné comment les entreprises facturent ces robots. Ils ont découvert que les entreprises économisent automatiquement de l'argent en se souvenant du « discours d'introduction » qu'elles envoient à chaque fois. Cela a économisé environ 61 % de la facture. Mais les chercheurs ont averti : Ne l'appelez pas « efficacité ». C'est juste une remise sur le même travail habituel. Le robot n'a pas travaillé plus vite ou plus intelligemment ; l'entreprise a simplement cessé de vous facturer les parties dont elle se souvenait.

6. Nouveaux robots, vieilles méthodes

Lorsqu'un nouveau robot super rapide (Kimi-K3) a été lancé, les chercheurs l'ont testé immédiatement. Même si ce nouveau robot était naturellement moins cher à exploiter, les mauvaises instructions (comme « essayer plusieurs approches ») l'ont fait gaspiller de l'argent 15 fois plus que d'habitude. La leçon ? Peu importe si le robot est intelligent ou bon marché, les mauvaises instructions le feront toujours trop dépenser.

Le mot de la fin

Ce document prouve que la façon dont vous posez une question change son coût, même si la réponse est la même.

  • Ne dites pas au robot de « essayer de nombreuses approches » ou de « réfléchir profondément » à moins que vous n'ayez réellement besoin qu'il fasse ces choses.
  • Donnez-lui des limites claires et une condition d'arrêt.
  • Rappelez-vous que le logiciel qui gère le robot peut vous coûter plus cher que le robot lui-même.

Les chercheurs ont rendu toutes leurs données, leur code et leurs recettes de test publics. Ils veulent que tout le monde sache que dans le monde des agents d'IA, moins de théâtre de réflexion et des instructions plus claires est le meilleur moyen d'économiser de l'argent et de faire le travail.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →