← Derniers articles
💻 computer science

What Prompts Don't Say: Understanding and Managing Underspecification in LLM Prompts

Ce papier analyse la fragilité de la sous-spécification des invites dans les modèles de langage de grande taille, démontrant que, bien que les modèles infèrent souvent les exigences manquantes, cela entraîne des performances instables qui ne peuvent être fiabilisées par une simple spécification ou des optimiseurs standards, incitant les auteurs à proposer des mécanismes d'optimisation conscients des exigences et un processus systématique pour une gestion proactive des exigences.

Auteurs originaux : Chenyang Yang, Yike Shi, Qianou Ma, Michael Xieyang Liu, Christian Kästner, Tongshuang Wu

Publié 2026-04-28
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Chenyang Yang, Yike Shi, Qianou Ma, Michael Xieyang Liu, Christian Kästner, Tongshuang Wu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'idée principale : Le problème de « l'hypothèse silencieuse »

Imaginez que vous engagez un assistant personnel très talentueux, mais un peu trop littéral (l'IA), pour organiser un voyage pour vous. Vous lui dites : « Organise-moi un voyage de 7 jours en Chine en juillet. »

Vous pensez peut-être avoir donné suffisamment d'instructions. Mais vous n'avez pas dit :

  • « Vérifie la météo. »
  • « Demande si j'ai besoin d'un visa. »
  • « Ne réserve pas de billets d'avion pour moi ; donne juste des conseils. »
  • « Garde un ton amical. »

Ce papier appelle cela « l'insuffisance de spécification de l'invite » (Prompt Underspecification). C'est lorsque vous omettez des règles importantes parce que vous supposez que l'IA va « simplement savoir » ou « comprendre » comme le ferait un humain.

Les chercheurs ont découvert que, bien que l'IA puisse parfois deviner ces règles manquantes, c'est un pari. Parfois, elle devine juste ; parfois, elle se trompe complètement. Et si vous mettez à jour l'IA ou modifiez légèrement votre formulation, cette « devinette » peut disparaître entièrement, faisant échouer le plan de voyage (par exemple, vous suggérer de faire une randonnée pendant une mousson ou réserver un vol sans visa).


Les trois principaux problèmes qu'ils ont découverts

Les chercheurs ont mené des expériences pour voir ce qui se passe lorsque vous omettez des règles. Voici ce qu'ils ont découvert, en utilisant des métaphores :

1. L'IA est un « lecteur d'esprit capricieux »

  • La découverte : L'IA devine correctement les règles manquantes environ 41 % du temps. Mais sa « lecture de l'esprit » est incroyablement fragile.
  • L'analogie : Imaginez que l'IA est un élève passant un examen. Si vous ne rédigez pas la question clairement, l'élève peut deviner la réponse. Parfois, il devine juste. Mais si vous changez le professeur (le modèle d'IA) ou l'éclairage de la salle (un tout petit changement dans l'invite), ce même élève peut soudainement deviner la mauvaise réponse.
  • Le résultat : Lorsque l'IA devine une règle qu'on ne lui a pas donnée, elle a deux fois plus de chances de rompre lors d'une mise à jour de l'IA par rapport au moment où vous lui avez explicitement donné cette règle.

2. L'erreur du « tout-venant » (Kitchen Sink)

  • La découverte : Vous pourriez penser : « D'accord, je vais juste lister chaque règle possible à laquelle je peux penser pour être prudent. » Les chercheurs ont découvert que cela empire les choses.
  • L'analogie : Imaginez que vous essayez de faire asseoir un chien. Si vous dites « Assis, reste, au pied, ne aboie pas, ne saute pas, regarde-moi, ne gratte pas », tout d'un coup, le chien se confond et ne fait rien.
  • Le résultat : Lorsque vous bourrez une invite de trop d'instructions (comme 19 règles), les performances de l'IA chutent considérablement (d'environ 19 %). Elle est submergée et commence à ignorer les règles, même celles que vous avez explicitement écrites.

3. Le « contrôle de l'ambiance » ne suffit pas

  • La découverte : Les développeurs testent généralement leurs invites en examinant quelques exemples pour voir si elles fonctionnent. Les chercheurs disent que c'est comme vérifier la météo en regardant par la fenêtre pendant 5 secondes.
  • L'analogie : Si vous ne vérifiez que quelques exemples, vous risquez de manquer les « cas limites » (comme l'exigence de visa ou l'activité dangereuse). Vous pensez que l'IA est parfaite, mais dès qu'un utilisateur pose une question légèrement différente, l'IA échoue parce qu'on ne lui a jamais dit de gérer ce scénario spécifique.

La solution : Le « prompting intelligent »

Le papier suggère deux façons principales de résoudre ce problème, plutôt que d'écrire simplement plus ou moins de texte.

1. L'approche « Curateur » (Optimisation)

Au lieu d'écrire une liste massive de règles, les chercheurs ont créé un système qui agit comme un éditeur intelligent.

  • Ce qu'il fait : Il examine votre liste de 20 règles et demande : « Laquelle de ces règles l'IA connaît-elle déjà par défaut ? » et « Laquelle de ces règles se bat en réalité contre les autres ? »
  • Le résultat : Il crée une invite plus courte et plus propre. Il supprime les règles que l'IA connaît déjà (ce qui économise de l'espace) et conserve les règles critiques. Cela a amélioré les performances d'environ 5 % en moyenne et a rendu les invites 40 % plus courtes.

2. L'approche « Surveillance continue » (Processus)

Les chercheurs soutiennent que la gestion des invites d'IA ne devrait pas être une tâche du type « configurer et oublier ». Elle doit être comme l'entretien d'une voiture.

  • L'analogie : Vous n'achetez pas une voiture et ne vérifiez jamais l'huile. Vous devez la vérifier régulièrement.
  • Le processus :
    • Découvrir : Trouver systématiquement toutes les règles cachées (comme « vérifier les visas ») avant de commencer à construire.
    • Valider : Faire en sorte qu'un « juge » (une autre IA ou un humain) vérifie constamment si l'IA suit à la fois les règles écrites et les règles cachées.
    • Surveiller : Lorsque le modèle d'IA se met à jour (comme un correctif logiciel), re-vérifiez tout immédiatement pour vous assurer qu'il n'a pas oublié une règle.

Résumé

Le papier conclut que vous ne pouvez pas compter sur l'IA pour « combler les blancs » de manière fiable.

  • Ne supposez pas que l'IA sait ce que vous voulez dire.
  • Ne jetez pas une énorme liste de règles dessus ; elle se confondra.
  • Utilisez des outils intelligents pour choisir les bonnes règles à spécifier, et gardez un œil constant sur l'IA pour vous assurer qu'elle ne dévie pas de sa trajectoire lorsque les choses changent.

L'objectif est de passer de « deviner ce dont l'IA a besoin » à « concevoir un système fiable où l'IA sait exactement quoi faire, à chaque fois ».

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →