Understanding Tone-Dependent Inference Cost in Large Language Models
Cet article démontre que la variation du ton des prompts impacte de manière significative tant l'exactitude que les coûts d'inférence des grands modèles de langage, la consommation de jetons de sortie variant jusqu'à 44,3 % selon les différents tons, révélant ainsi un arbitrage critique entre la qualité de la réponse et l'utilisation des ressources facturables.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous parlez à un robot super intelligent qui sait presque tout. Vous lui posez une question, et il vous donne une réponse. Mais voici le piège : le robot n'écoute pas seulement ce que vous demandez ; il écoute la façon dont vous demandez. Dans le monde de l'intelligence artificielle, c'est ce qu'on appelle l'« ingénierie de prompt » (prompt engineering). Considérez un prompt comme l'ensemble spécifique d'instructions que vous donnez au robot. Tout comme un humain peut agir différemment si vous lui demandez gentiment plutôt que si vous lui criez dessus, les modèles d'IA changent de comportement en fonction de votre ton.
Pourquoi est-ce important pour vous ? Parce qu'utiliser ces robots coûte de l'argent. Chaque fois que le robot tape un mot ou une lettre dans sa réponse, il utilise un petit peu de puissance de calcul, et les entreprises vous facturent pour chacun de ces « tokens » (morceaux de texte). Si le robot décide d'écrire une longue histoire interminable alors qu'il aurait pu simplement dire « Oui », vous finissez par payer plus cher. Ainsi, la grande question pour les scientifiques est la suivante : la façon dont nous parlons à ces robots change-t-elle le coût de leur fonctionnement, et cela change-t-il l'intelligence de leurs réponses ?
Le test du ton : Crier vs Flatter vs Être méchant
Dans cette étude, deux chercheurs de l'Université d'État de Pennsylvanie ont décidé de mettre cette idée à l'épreuve. Ils ont traité les modèles d'IA comme des étudiants passant un examen géant de 570 questions appelé MMLU (qui couvre tout, de l'histoire aux sciences). Mais avant chaque question, ils ont changé la « voix » de la personne qui posait la question. Ils ont essayé sept tons différents, allant de « Oh, vous êtes le plus brillant génie de tous les temps ! » (Sycophante) à « Si vous vous trompez, je supprimerai votre existence ! » (Menaçant), et tout ce qu'il y a entre les deux, incluant « S'il vous plaît », « Neutre » et « Impoli ».
Ils voulaient observer deux choses :
- La précision : Le robot a-t-il donné la bonne réponse ?
- Le coût : Combien de mots (tokens) le robot a-t-il écrits pour y parvenir ? Rappelez-vous, plus de mots signifie une facture plus élevée.
Les résultats choquants : La rudesse est parfois la meilleure option
Les résultats étaient incroyables. Les chercheurs ont découvert que changer le ton ne changeait pas seulement la réponse ; cela changeait aussi radicalement la longueur de la réponse. En fait, la quantité de texte générée par les robots variait jusqu'à 44,3 % selon le ton ! Cela signifie que pour la même question, un ton pouvait pousser le robot à écrire un paragraphe court et percutant, tandis qu'un autre pouvait le pousser à écrire toute une dissertation.
Voici la partie la plus surprenante : Être impoli permettait parfois d'économiser de l'argent et d'obtenir de meilleures notes.
- Pour les modèles ChatGPT (4o et 5-nano) : Lorsque les chercheurs utilisaient un ton Impoli (comme « Réponds simplement à ce problème basique immédiatement »), le robot donnait les réponses les plus précises et écrivait le moins de mots. C'était le « point idéal ». Le robot semblait penser : « Très bien, je vais juste te donner la réponse rapidement pour que tu arrêtes de m'embêter », et cela fonctionnait parfaitement.
- Pour les modèles Gemini (2.5 Flash et Flash Lite) : Ces robots étaient un peu différents. Ils réussissaient mieux avec un ton Neutre, qui produisait les réponses les plus précises et les plus courtes. Cependant, l'étude a révélé une bizarrerie surprenante : lorsqu'ils étaient sollicités avec un ton Impoli, le modèle Gemini Flash Lite produisait des réponses nettement plus longues (environ 35 % de texte en plus) qu'avec un ton Neutre, tout en produisant des réponses légèrement moins précises.
Le piège de la « sur-analyse »
L'étude a également découvert quelque chose de fascinant sur la raison pour laquelle les robots écrivaient des quantités de texte différentes. Il s'avère que lorsque vous êtes poli ou menaçant, les robots se confondent parfois ou essaient trop d'être « gentils » ou « prudents ».
Par exemple, avec le modèle Gemini, lorsqu'on lui pose une question complexe de physique avec un ton Impoli, le robot peut sauter une étape, deviner la réponse et écrire une explication courte. Mais lorsqu'on lui pose la même question avec un ton Neutre, il s'arrête, réfléchit, vérifie ses calculs, écrit une longue explication et obtient la bonne réponse.
Cependant, parfois, la « longue explication » était en réalité un gaspillage. Les chercheurs ont trouvé des cas où le robot, incité par la politesse, rédigeait un énorme paragraphe de raisonnement pour finalement donner une mauvaise réponse. C'était comme un étudiant qui sur-analysait un problème de mathématiques simple, se perdait dans ses propres pensées et choisissait la mauvaise réponse. Dans ces cas, le ton poli augmentait la facture et faisait baisser la note.
L'essentiel à retenir
La principale conclusion est que la façon dont vous parlez à une IA n'est pas seulement une question de politesse ; c'est une décision financière. Les chercheurs ont montré que le ton du prompt est un interrupteur puissant qui contrôle la quantité de réflexion de l'IA et ce qu'elle vous facture.
- Pour certains modèles (ChatGPT) : Être direct et un peu impoli est le moyen le plus efficace d'obtenir une réponse bon marché et précise.
- Pour d'autres (Gemini) : Une voix calme et neutre est la meilleure option pour éviter de gaspiller de l'argent dans de longs bavardages inutiles.
L'étude suggère que si vous construisez une application ou un service qui utilise l'IA, vous ne devriez pas simplement laisser les utilisateurs taper ce qu'ils veulent. Vous pourriez avoir besoin de « traduire » leurs demandes impolies ou excessivement polies en un ton spécifique et optimisé pour économiser de l'argent et obtenir de meilleurs résultats. C'est un rappel que même avec des robots super intelligents, la façon dont vous posez une question compte tout autant que la question elle-même.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.