← Derniers articles
💬 NLP

Prompt Stability Scoring for Text Annotation with Large Language Models

Ce papier traite de la vulnérabilité de l'annotation de texte par les grands modèles de langage face aux variations de consignes en proposant un cadre général appelé le Score de Stabilité des Consignes (PSS), qui adapte les métriques de fiabilité traditionnelles pour diagnostiquer les problèmes de stabilité et inclut un package Python pour une mise en œuvre pratique.

Auteurs originaux : Christopher Barrie, Elli Palaiologou, Petter Törnberg

Publié 2026-05-18
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Christopher Barrie, Elli Palaiologou, Petter Törnberg

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Grande Idée : Votre IA est-elle « Versatile » ?

Imaginez que vous engagez un assistant très intelligent, mais légèrement nerveux, pour trier une pile de lettres dans des enveloppes « Oui » et « Non ». Vous lui donnez une instruction précise : « Si la lettre mentionne de l'argent, mettez-la dans le tas « Oui ». »

Vous lui demandez de faire cela 30 fois.

  • Scénario A : Il place les mêmes lettres dans les mêmes tas à chaque fois.
  • Scénario B : Au 1er essai, il place une lettre sur les « économies » dans le tas « Oui ». Au 2e essai, il place cette même lettre dans le tas « Non ». Au 3e essai, il la remet dans « Oui ».

Même si l'assistant est généralement juste, le Scénario B pose problème. Cela signifie que sa prise de décision est instable. Si vous ne pouvez pas lui faire confiance pour être cohérent avec exactement les mêmes instructions, vous ne pouvez certainement pas lui faire confiance si vous modifiez légèrement la formulation (par exemple : « Si la lettre parle de liquidités... »).

Cet article traite de la création d'un test pour vérifier si votre assistant IA est stable (Scénario A) ou versatile (Scénario B) avant de lui confier du travail réel.


Le Problème : L'IA est sensible au « Salade de Mots »

Les auteurs expliquent que les grands modèles de langage (IA) ne fonctionnent pas comme une calculatrice. Ils ne consultent pas une réponse fixe dans un livre. Au lieu de cela, ils prédisent le mot suivant un par un, comme une personne qui devine ce qui vient ensuite dans une phrase.

Pour cette raison, deux choses peuvent perturber leur cohérence :

  1. Le Problème du « Même Prompt » : Même si vous tapez exactement les mêmes instructions deux fois, l'IA peut donner une réponse légèrement différente en raison de facteurs aléatoires minuscules et invisibles dans son cerveau informatique (comme un lancer de pièce qui se produit en arrière-plan).
  2. Le Problème de la « Reformulation » : Si vous modifiez vos instructions ne serait-ce qu'un peu — par exemple en disant « Classez ceci » au lieu de « Triez ceci » — l'IA peut se confondre et donner une réponse totalement différente.

L'article soutient que la précision ne suffit pas. Une IA peut obtenir la bonne réponse 90 % du temps, mais si elle change de réponse à chaque fois que vous ajustez le prompt, vos résultats de recherche sont peu fiables.

La Solution : Le « Score de Stabilité du Prompt » (PSS)

Les auteurs ont créé un outil (un package Python appelé promptstability) qui agit comme un test de résistance pour vos instructions IA.

Pensez-y comme à tester un pont :

  • Stabilité Intra-Prompt (Le Test de « Répétition ») : Vous exécutez la même instruction exactement 30 fois sur les mêmes données. L'outil vérifie : L'IA a-t-elle donné la même réponse à chaque fois ? Si les réponses sautent partout, le pont est branlant.
  • Stabilité Inter-Prompt (Le Test de « Reformulation ») : Vous prenez votre instruction et demandez à une autre IA de la réécrire de 10 manières différentes (par exemple : « Triez ceci », « Catégorisez ceci », « Étiquetez ceci »). Ensuite, vous exécutez les 10 versions sur les mêmes données. L'outil vérifie : L'IA est-elle toujours d'accord avec elle-même, même si les mots ont changé ?

L'outil vous donne un score (appelé alpha de Krippendorff, qui est simplement une façon élégante de dire « score d'accord »).

  • Score Élevé (Proche de 1,0) : Excellent ! Vos instructions sont robustes. L'IA est cohérente.
  • Score Faible (En dessous de 0,8) : Attention ! Vos instructions sont trop fragiles. Un tout petit changement de formulation fait craquer le système.

Ce qu'ils ont découvert (Les Résultats du « Test de Résistance »)

Les chercheurs ont testé cela sur six ensembles de données réels différents (comme des tweets politiques américains, des manifestes de partis britanniques et des articles de presse). Voici ce qu'ils ont découvert :

  1. Le Simple est Stable : Lorsque la tâche était facile et les données claires (comme identifier si un tweet provenait d'un Républicain ou d'un Démocrate), l'IA était très stable. Peu importait si vous reformuliez le prompt ; elle donnait la même réponse.
  2. Le Complexe est Fragile : Lorsque la tâche était difficile ou les données désordonnées (comme décider si un tweet utilise un langage « populiste », ou trier des réponses à un sondage dans 12 catégories très similaires), l'IA devenait instable. De petits changements dans le prompt faisaient que l'IA changeait d'avis.
  3. Le Piège du « Format » : Parfois, l'IA n'était pas vraiment confuse ; elle oubliait simplement de suivre les règles de mise en forme (comme écrire un paragraphe au lieu d'un nombre). Lorsque les chercheurs ont filtré ces réponses « négligentes », les scores de stabilité ont augmenté. Cela leur a appris que parfois, le problème ne réside pas dans le cerveau de l'IA, mais dans son incapacité à suivre des règles de formatage strictes.
  4. Le Modèle Compte : Ils ont comparé une IA puissante (GPT-4) avec une plus petite, open-source. La puissante était beaucoup plus stable. Cela signifie que la « versatilité » n'est pas toujours de votre faute ; parfois, il vous faut simplement une IA plus intelligente.

Le « Guide Pratique » : Que devez-vous faire ?

L'article fournit un guide simple pour les chercheurs :

  • Étape 1 : Lancez le Test de Stabilité. Avant de dépenser de l'argent ou du temps pour valider vos résultats, exécutez l'outil promptstability.
  • Étape 2 : Vérifiez le Score.
    • Si le score est élevé : Vous pouvez continuer. Votre chaîne de traitement est robuste.
    • Si le score est faible : Arrêtez-vous ! Ne faites pas confiance à vos résultats pour l'instant.
  • Étape 3 : Résolvez le Problème.
    • L'IA ignore-t-elle la mise en forme ? Rendez le prompt plus strict.
    • La tâche est-elle trop vague ? Clarifiez vos instructions.
    • Les données sont-elles trop désordonnées ? Peut-être que cette tâche spécifique est trop difficile pour qu'une IA la gère de manière cohérente.
    • L'IA est-elle trop faible ? Essayez un modèle plus puissant.

L'Essentiel

Vous ne pouvez pas supposer que, simplement parce qu'une IA vous donne une réponse, cette réponse est fiable. Cet article fournit une liste de contrôle pour vous assurer que votre IA ne fait pas que deviner au hasard ou réagir de manière trop sensible à la façon dont vous formulez vos questions.

La stabilité est le fondement de la confiance. Si votre IA ne peut pas être d'accord avec elle-même lorsque vous posez la même question de manière légèrement différente, vous ne pouvez pas faire confiance aux résultats qu'elle vous fournit pour vos recherches.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →