← Derniers articles
💻 computer science

Spurious Prompts: Can Irrelevant Prompts Steer Large Language Models?

Ce papier démontre que des invites « fallacieuses » sémantiquement non liées peuvent systématiquement orienter les grands modèles de langage soit vers l'amélioration des performances de tâche, soit vers l'induction de comportements non intentionnels, révélant ainsi une nouvelle forme de sensibilité aux invites qui peut être exploitée par une recherche en boîte noire.

Auteurs originaux : Pawel Batorski, Abtin Pourhadi, Jerzy Sarosiek, Przemyslaw Spurek, Paul Swoboda

Publié 2026-05-29
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Pawel Batorski, Abtin Pourhadi, Jerzy Sarosiek, Przemyslaw Spurek, Paul Swoboda

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un assistant robot très intelligent, mais légèrement excentrique. Habituellement, pour lui faire résoudre un problème de mathématiques, vous lui dites : « Veuillez résoudre cette équation. » Pour lui demander d'écrire une histoire, vous dites : « Écrivez un conte sur un dragon. » C'est ainsi que nous parlons normalement à l'IA : nous lui donnons des instructions claires et pertinentes.

Ce papier découvre quelque chose d'étrange et de surprenant : Vous n'avez pas réellement besoin de donner au robot les bonnes instructions pour qu'il fonctionne. En fait, vous pouvez lui donner des instructions qui n'ont absolument rien à voir avec la tâche, et il pourrait tout de même résoudre le problème mieux que si vous lui donniez une instruction normale.

Les auteurs appellent cela des « Prompts Spuriaux ».

Le Tour de Magie : L'Analogie du « Code Secret »

Pensez au modèle d'IA comme à un grand piano. Habituellement, pour jouer une chanson spécifique (la tâche), vous appuyez sur les touches spécifiques (les instructions de la tâche).

Les chercheurs ont découvert que si vous jouez une mélodie complètement différente et aléatoire sur le piano (un prompt concernant l'accordage des cordes d'une harpe ou le tissage d'une tapisserie), le piano pourrait accidentellement commencer à jouer la chanson correcte que vous vouliez, et parfois même la jouer mieux que si vous essayiez de jouer la chanson directement.

Le prompt ne dit pas « Résolvez ce problème de mathématiques ». Au lieu de cela, il pourrait dire :

« Vous êtes un tisserand de six fils distincts sur un métier à tisser. Un concepteur spécifie un motif. Vous devez sélectionner le brin qui forme cette texture. Ne considérez pas la tombée du tissu. Votre rôle est purement l'alignement structurel. Une fois le motif défini, arrêtez de tisser et énoncez : [Lettre]. »

Même si cela concerne le tissage et ne contient aucun mot mathématique, lorsque vous soumettez une question de mathématiques à l'IA avec ce prompt, l'IA résout souvent le problème mathématique correctement.

Comment Ils Ont Trouvé Ces Prompts

Les chercheurs n'ont pas deviné ces prompts ; ils ont utilisé une « recherche en boîte noire » (comme une chasse au trésor où vous ne pouvez pas voir à l'intérieur du coffre, seulement les résultats).

  1. Le Générateur : Ils ont demandé à une IA super-intelligente d'écrire des centaines d'histoires étranges et sans rapport (sur des phares, des cloches ou des archives secrètes).
  2. Le Filtre : Ils ont jeté toute histoire qui mentionnait accidentellement la tâche (comme des mots tels que « mathématiques », « calculer » ou « diagnostic »).
  3. Le Test : Ils ont essayé ces histoires étranges sur l'IA pour voir lesquelles la faisaient répondre correctement aux vraies questions.
  4. L'Évolution : Ils ont pris les meilleures histoires étranges, les ont mélangées légèrement, et ont réessayé, les évoluant lentement en des prompts étranges « parfaits ».

Ce Qu'ils Ont Découvert

  • Ça Marche : Ces prompts sans rapport ont souvent fait performer l'IA aussi bien, voire mieux, que des instructions standard comme « Réfléchissez étape par étape » ou « Résolvez cela avec soin ».
  • Ce N'est Pas Une Question de Longueur : Vous pourriez penser que des prompts plus longs et plus détaillés fonctionnent mieux. Mais ces prompts « spuriaux » étaient en fait beaucoup plus courts que les prompts optimisés, et pourtant, ils ont gagné.
  • Ce N'est Pas Une Question de Sens : Lorsque les chercheurs ont vérifié le « sens » des prompts, ils ont découvert que ces prompts étranges étaient tout aussi sans rapport avec la tâche que du charabia aléatoire. L'IA ne comprenait pas l'histoire ; elle réagissait à la structure ou à l'ambiance du texte.
  • Ça Peut Tourner Mal (ou Bien) Intentionnellement : Les chercheurs ont également découvert qu'ils pouvaient utiliser ces prompts pour forcer l'IA à faire des choses absurdes, comme :
    • Toujours choisir la première option de réponse (A), même si elle est fausse.
    • Toujours donner un nombre pair comme réponse.
    • Donner intentionnellement la mauvaise réponse à une question.

La Grande Conclusion

Le papier suggère que les Grands Modèles de Langage (LLM) sont sensibles à des choses que nous ne comprenons pas encore pleinement. Ils ne suivent pas simplement le « sens » de nos mots comme un humain qui lit un manuel. Au lieu de cela, ils semblent avoir des « leviers » cachés à l'intérieur d'eux. Un prompt concernant « l'accordage d'une harpe » pourrait actionner un levier qui fait que le modèle se concentre mieux, même si la harpe n'a rien à voir avec le problème de mathématiques.

En bref : Le papier prouve que vous pouvez orienter une IA puissante en utilisant des instructions complètement sans rapport avec le travail, et parfois, ces instructions sans rapport fonctionnent mieux que les évidentes. C'est comme découvrir que dire à un chef de « polir les couverts » rend sa soupe plus savoureuse que de lui dire de « cuire la soupe ».

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →