← Derniers articles
💻 computer science

Testing JSON Schema Instruction Artifacts: Distributional Robustness under Validation-Equivalent Serialization and JSON Mode

Cette étude démontre que des sérialisations JSON Schema équivalentes en termes de validation peuvent induire des changements statistiquement significatifs et pratiquement significatifs dans les distributions de sortie des modèles de langage, révélant que l'équivalence de validation seule est un oracle de régression insuffisant pour garantir la robustesse distributionnelle dans les systèmes déployés.

Auteurs originaux : Shengyao Sun

Publié 2026-08-07
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Shengyao Sun

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous donniez des instructions à un robot très intelligent, mais légèrement littéral, pour construire un type de sandwich spécifique. Vous écrivez les instructions sur une feuille de papier. Maintenant, imaginez que vous avez un tampon magique qui dit : « Cette recette de sandwich est parfaite. » Ce tampon vérifie si vous avez tous les bons ingrédients (pain, fromage, jambon) et si vous n'avez pas accidentellement oublié la moutarde. Mais voici le piège : le tampon ne se soucie pas de l'ordre dans lequel vous avez écrit les étapes. Que vous disiez « Mettez le jambon sur le pain, puis le fromage » ou « Mettez le fromage sur le pain, puis le jambon », le tampon donne le même pouce levé « Parfait » parce que le sandwich final possède les mêmes éléments.

Dans le monde de l'informatique, ce « tampon » est appelé un JSON Schema. C'est un livre de règles qui indique à des programmes informatiques à quoi doit ressembler une donnée. Lorsque nous demandons à l'Intelligence Artificielle (IA) d'écrire du code ou d'organiser des informations, nous lui donnons souvent ce livre de règles comme un ensemble d'instructions. La grande question que les chercheurs se posent est la suivante : si nous mélangeons l'ordre des instructions sur le papier — sans changer les règles réelles ou le tampon « parfait » — l'IA construit-elle toujours exactement le même sandwich ? Ou l'IA est-elle confuse par le nouvel ordre et sert-elle quelque chose d'un peu différent, même si elle passe quand même le contrôle du tampon ? Cela importe car si l'IA change d'avis simplement parce que nous avons réorganisé les mots, elle devient peu fiable pour des tâches importantes comme les dossiers médicaux ou les rapports financiers.

Ce document est comme une histoire de détective où l'auteur, Shengyao Sun, enquête pour savoir si le « cerveau » de l'IA est sensible à l'ordre des mots dans ces livres de règles. L'étude a testé cela en demandant à différents modèles d'IA de résoudre les mêmes énigmes en utilisant les mêmes livres de règles, mais avec les instructions écrites dans des ordres différents. Ils ne l'ont pas fait une seule fois ; ils l'ont demandé cinq fois pour chaque version afin de s'assurer que les changements n'étaient pas dus au hasard. Ils ont découvert que pour certains systèmes d'IA, l'ordre des mots importait. Lorsque l'ordre des propriétés (comme « nom » ou « âge ») était inversé, l'IA commençait à donner des réponses différentes, même si les réponses étaient toujours techniquement « correctes » selon le livre de règles.

Cependant, l'histoire n'est pas la même pour chaque IA. L'auteur a découvert que cette « sensibilité à l'ordre » dépend entièrement du système d'IA spécifique que vous utilisez. Pour les systèmes « Sonnet » et « Qwen », le mélange des ordres a provoqué des changements notables dans les réponses — environ 5 % à 12 % de désaccord de plus que d'habitude. Mais pour les systèmes « GPT » et « DeepSeek », le mélange n'a presque fait aucune différence. L'étude a également vérifié si un mode spécial « JSON Mode » (un paramètre qui dit à l'IA d'être extra prudente avec le formatage) résoudrait le problème. Étonnamment, cela ne l'a pas fait ; l'IA restait confuse par l'ordre des mots, même en ce mode strict.

La conclusion la plus importante est que, même si un programme informatique déclare qu'un ensemble d'instructions est « valide » ou « correct », cela ne signifie pas que l'IA se comportera de la même manière si vous modifiez le formatage. L'auteur suggère que nous ne devrions plus seulement faire confiance au « tampon ». Au lieu de cela, nous devons traiter ces ensembles d'instructions comme du code logiciel : nous devrions les verrouiller dans un ordre standard (comme toujours lister les ingrédients par ordre alphabétique) et les tester soigneusement avant de les laisser fonctionner dans le monde réel. L'étude prouve que la validation ne suffit pas ; nous devons vérifier si le comportement de l'IA reste stable lorsque les instructions sont réorganisées, car pour certaines IA, l'ordre des mots est secrètement une partie de la recette.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →