← Derniers articles
🤖 AI

Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking

Cet article introduit l'Indice de Sensibilité au Format (FSI) et l'Indice de Sensibilité à la Parsabilité (PSI) pour démontrer que des différences de formatage mineures dans les enveloppes de prompts provoquent des variations de scores significatives et dépendantes du modèle ainsi que des échecs de conformité, soutenant ainsi que la précision des benchmarks sans prise en compte de cette variance est statistiquement fragile.

Auteurs originaux : Deep Pankajbhai Mehta

Publié 2026-07-14
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Deep Pankajbhai Mehta

Article original placé dans le domaine public sous CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez un juge dans un concours de talents, mais qu'au lieu d'écouter les chanteurs, vous n'ayez le droit que de lire leurs paroles. Maintenant, imaginez que certains chanteurs soient invités à écrire leurs paroles sur une simple feuille de papier, tandis que d'autres sont forcés de les écrire à l'intérieur d'une boîte JSON élégante et rigide, et que d'autres encore doivent envelopper leurs mots dans un sandwich spécifique « BEGIN/END ».

Vous vous attendriez à ce que le talent du chanteur reste le même, n'est-ce pas ? La chanson ne devrait pas changer simplement parce que le support a changé. Mais selon cette étude de Deep Pankajbhai Mehta de chez Adobe, c'est exactement ce qui arrive aux modèles d'IA. Le « papier » (l'enveloppe du prompt) compte tellement que cela peut renverser entièrement le classement, faisant passer un génie pour un novice et un novice pour un génie.

Le grand bouleversement des formats
Les chercheurs ont mené une expérience massive, générant 140 000 réponses à partir de quatre modèles d'IA différents (allant de 7 milliards à 72 milliards de « cellules cérébrales ») sur sept tâches de questions-réponses. Ils ont testé cinq styles d'« enveloppes » :

  1. Simple : Juste la réponse.
  2. JSON : Format de code informatique strict.
  3. Structuré : Paires clé-valeur.
  4. Structuré avec délimiteurs : Paires clé-valeur avec des balises spéciales comme <BEGIN ANSWER>.
  5. Délibéré : Un brouillon pour réfléchir, suivi de la réponse.

Le résultat ? Les modèles étaient incroyablement sensibles à ces règles de formatage. Pour certains modèles, changer l'enveloppe entraînait des variations d'exactitude spectaculaires. Le modèle Phi-4 était une véritable diva : son exactitude a bondi de 0,763 (une plage énorme) simplement en changeant l'enveloppe. En revanche, le géant Qwen-2.5-72B était un rockstar décontracté, ne bougeant presque pas avec une variation de seulement 0,024.

Le problème du « Pouvez-vous lire ceci ? »
Pourquoi les scores ont-ils changé autant ? L'article suggère que ce n'était pas parce que l'IA devenait soudainement plus intelligente ou plus stupide sur les questions réelles. C'était principalement un problème de conformité.

Pensez à un distributeur automatique qui n'accepte que les pièces. Si vous essayez d'y insérer un billet de banque (même s'il est valide), la machine le rejette. Dans l'étude, lorsque l'IA tentait de suivre une règle JSON stricte mais ajoutait accidentellement une balise de code markdown (comme le petit symbole ```), la machine (l'extracteur de réponse) ne pouvait pas la lire. La réponse était marquée comme « non analysable », ce qui comptait comme une mauvaise réponse.

Les données montrent un lien fort : lorsque l'IA échouait à être « analysable » (lisible par une machine), son exactitude s'effondrait souvent pour atteindre presque zéro. Pour le modèle Phi-4 utilisant l'enveloppe JSON stricte, il a produit des sorties commençant par une balise de code markdown dans 85,3 % des générations, produisant une analysabilité de seulement 2,8 % et une exactitude de 0,7 %. Les chercheurs ont constaté que l'« analysabilité » était un prédicteur majeur de succès, expliquant environ 82 % des différences de scores après avoir pris en compte le modèle et la tâche.

Ce que cela signifie pour l'avenir
L'article soutient que rapporter un chiffre d'exactitude unique pour une IA est comme rapporter une température unique sans préciser si elle est en Fahrenheit ou en Celsius — c'est trompeur. Si le choix d'une enveloppe peut modifier un score de 0,76, ce chiffre unique est « statistiquement fragile ».

Les auteurs suggèrent que, lors de nos tests d'IA, nous ne devrions pas simplement choisir une enveloppe et croiser les doigts. Au lieu de cela, nous devrions :

  • Rapporter la plage de scores à travers différentes enveloppes (comme un « indice de sensibilité »).
  • Vérifier si les réponses sont réellement analysables.
  • Être prudents quant à l'utilisation de formats stricts dans les applications réelles, à moins que l'IA ne soit forcée de suivre les règles par son décodeur (la partie qui génère le texte), et non par le simple prompt.

L'essentiel à retenir
Cette étude ne dit pas que l'IA est cassée ; elle dit que notre ruban à mesurer est bancal. L'indice de sensibilité de format (FSI) et l'indice de sensibilité de l'analysabilité (PSI) sont de nouveaux outils pour mesurer à quel point le score d'un modèle dépend de l'enveloppe. Les conclusions suggèrent que pour certains modèles, le choix de l'enveloppe est plus important que l'intelligence réelle du modèle. Tant que nous ne réglerons pas cela, la « meilleure » IA sur un classement pourrait simplement être celle qui se trouvait par chance en phase avec le style de formatage de la personne qui a construit le test.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →