← Derniers articles
💬 NLP

Measuring AI "Slop" in Text

Cet article traite de l'absence d'une définition standard du « slop » de l'IA en développant une taxonomie et des dimensions interprétables grâce à des entretiens avec des experts, démontrant que si les jugements binaires sont subjectifs, ils sont corrélés à des facteurs latents tels que la cohérence et la pertinence afin de permettre une meilleure évaluation du texte généré par l'IA.

Auteurs originaux : Chantal Shaib, Tuhin Chakrabarty, Diego Garcia-Olano, Byron C. Wallace

Publié 2026-01-27
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Chantal Shaib, Tuhin Chakrabarty, Diego Garcia-Olano, Byron C. Wallace

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez qu'Internet soit un immense marché animé. Pendant longtemps, des vendeurs (des humains) ont vendu des produits frais et artisanaux. Mais récemment, une vague de produits bon marché et produits en masse est arrivée. De loin, ils ont l'air corrects, mais de près, ils semblent fragiles, répétitifs et creux. Dans le monde de l'IA, les gens ont commencé à appeler ce contenu de faible qualité généré par l'IA de la « slop » (ou « bouillie »).

Ce document est comme une équipe d'experts tentant de construire un manuel de contrôle qualité pour cette bouillie. Ils veulent répondre à deux grandes questions : Qu'est-ce qui fait exactement qu'un texte ressemble à de la « slop » ? et Pouvons-nous construire une machine capable de la repérer automatiquement ?

Voici la décomposition de leurs découvertes, en utilisant des analogies simples :

1. Définir la « Slop » (La Taxonomie)

Les chercheurs n'ont pas simplement deviné ce qu'est la slop. Ils ont interrogé 19 experts — écrivains, journalistes, philosophes et scientifiques de l'IA — pour obtenir une définition claire. Ils ont réalisé que la « slop » n'est pas une chose unique ; c'est un mélange de trois problèmes principaux, comme un mauvais repas qui est trop salé, trop fade et servi dans une assiette sale.

Ils ont organisé ces problèmes dans une liste de contrôle appelée Taxonomie :

  • Utilité de l'information (Le « Bol Vide ») :
    • Densité : Le texte est rempli de mots mais contient très peu de substance réelle. C'est comme une soupe qui est composée à 90 % d'eau et à 10 % de bouillon.
    • Pertinence : Le texte parle de choses qui n'ont pas d'importance par rapport à la question posée. C'est comme commander un burger et recevoir un cours sur l'histoire des vaches.
  • Qualité de l'information (Les « Ingrédients Périmés ») :
    • Factualité : Le texte invente des choses ou se trompe sur les faits (hallucinations).
    • Biais : Le texte semble trop robotique ou neutre alors qu'il devrait avoir une voix humaine, ou il adopte une position étrange et unilatérale.
  • Qualité du style (La « Mauvaise Présentation ») :
    • Répétition et Aspect Modèle : L'IA répète sans cesse la même chose ou utilise exactement la même structure de phrase, comme un disque rayé.
    • Verbosité : Elle utilise 100 mots pour dire ce qui pourrait être dit en 10. C'est « bavard » sans être « sage ».
    • Cohérence et Ton : Les idées ne s'enchaînent pas logiquement, ou le ton semble étrange (comme un robot essayant de raconter une blague).

2. Le Test Humain (Annoter la Slop)

Pour voir si leur liste de contrôle fonctionnait, ils ont engagé des correcteurs professionnels pour lire 150 articles de presse et 100 passages de type Questions-Réponses (Q&A). Ils ont demandé aux éditeurs de surligner les parties spécifiques « négligentes » du texte.

La Surprise :
Même les experts ne s'entendaient pas toujours sur ce qui constituait de la « slop ».

  • Le Problème de la Subjectivité : Un éditeur peut penser qu'un texte est de la « slop » parce qu'il est trop verbeux, tandis qu'un autre pense qu'il est correct.
  • La Connexion : Cependant, lorsque les éditeurs étaient d'accord pour dire qu'un texte était de la « slop », c'était généralement parce que le texte manquait de pertinence (ne répondait pas à la consigne) ou de densité (était trop vide).
  • La Différence de Domaine :
    • Dans l'Actualité (News), la slop concernait principalement le style et le ton (trop formels, trop répétitifs).
    • Dans les Questions-Réponses (Q&A), la slop concernait principalement l'erreur de faits ou une structure désordonnée.

3. Les Machines peuvent-elles la repérer ? (Le Contrôle Automatique)

Les chercheurs ont tenté de voir si les outils d'IA actuels pouvaient signaler automatiquement cette slop sans l'aide humaine. Ils ont testé trois choses :

  1. Métriques Mathématiques Standards : Ils ont utilisé de vieux outils mathématiques (comme compter la longueur des mots ou vérifier la répétition des mots).
    • Résultat : Ces outils étaient corrects pour repérer les textes « verbeux », mais ils échouaient à détecter les aspects plus subtils comme « est-ce pertinent ? » ou « est-ce que cela fait sens ? ».
  2. Modèles de Récompense d'IA : Ils ont utilisé des modèles d'IA avancés entraînés pour noter la qualité de l'écriture.
    • Résultat : Ces modèles pouvaient faire la différence entre une « bonne » et une « mauvaise » écriture de manière générale, mais ils ne pouvaient pas identifier spécifiquement la « slop » telle que définie par les humains. Ils manquaient de nuance.
  3. Juges IA (LLM comme Juges) : Ils ont demandé à de puissants modèles d'IA (comme GPT-5 et d'autres) de lire le texte et de dire : « Est-ce de la slop ? » et « Surlignez les mauvaises parties ».
    • Résultat : Ils ont échoué lamentablement. Les juges IA étaient terribles à ce jeu. Ils passaient souvent à côté de la slop ou surlignaient les mauvaises parties. Ils avaient tendance à se concentrer uniquement sur la « verbosité » et ignoraient tout le reste.

La Conclusion

Le document conclut que, bien que nous ayons une bonne liste de contrôle définie par l'humain pour identifier ce qu'est la « slop » (il s'agit principalement d'être non pertinent, vide ou répétitif), nous n'avons pas encore de robot fiable capable de la trouver automatiquement.

Actuellement, si vous voulez savoir si un texte est de la « slop », vous avez toujours besoin d'un humain pour le lire et utiliser son jugement. Les outils automatiques sont comme un détecteur de métaux qui ne trouve que les gros cailloux, mais rate les petites pierres précieuses (ou les petits débris agaçants) cachées dans le sable.

Ce que le document ne prétend PAS :

  • Il ne dit pas que nous devrions bannir l'écriture par IA.
  • Il ne prétend pas que cette méthode corrigera l'IA à l'avenir (il dit simplement qu'il s'agit d'un défi ouvert).
  • Il ne suggère pas d'utiliser cela pour des décisions médicales ou juridiques.
  • Il se concentre strictement sur la définition du problème et sur le fait de montrer que les solutions automatisées actuelles ne sont pas encore prêtes à le résoudre.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →