← Derniers articles
🤖 AI

Position: Evaluation Scores Are Perishable Knowledge Claims

Cet article soutient que les scores d'évaluation sont des prétentions de connaissance périssables sujettes à une « inflation de la confiance » lorsqu'ils sont agrégés par moyenne, proposant plutôt une approche conservatrice du « maillon faible » qui suit explicitement la formalité, la portée et la fenêtre de validité d'un score afin de prévenir des classements trompeurs.

Auteurs originaux : Sankalp Gilda, Shlok Gilda

Publié 2026-07-30
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Sankalp Gilda, Shlok Gilda

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Piège du Bulletin : Pourquoi la « Moyenne » peut être un Mensonge

Imaginez que vous soyez un détective essayant de résoudre un mystère en utilisant les indices de trois témoins différents. Un témoin est un robot super précis qui ne ment jamais, mais qui n'a vu le crime que de loin. Un autre est un humain bavard qui a tout vu de près, mais qui invente parfois des détails pour avoir l'air impressionnant. Le troisième est un miroir qui se contente de répéter ce que dit le suspect. Si vous faites la « moyenne » de leurs récits, vous pourriez obtenir une version des événements bien ordonnée et équilibrée qui semble parfaitement raisonnable. Mais voici le piège : si le témoin humain affirme que le suspect portait un chapeau rouge (alors qu'il portait un bleu), ce seul détail erroné ruine toute l'histoire, peu importe la perfection de la description de la météo faite par le robot. Dans le monde de l'Intelligence Artificielle, plus précisément lorsque nous essayons de mesurer l'intelligence de ces cerveaux informatiques, nous commettons souvent exactement cette erreur. Nous traitons les scores de tests comme de simples problèmes mathématiques où l'on peut simplement additionner les résultats et les diviser par le nombre de tests pour obtenir une « note finale ». Mais les auteurs de cet article soutiennent que ces scores ne sont pas de simples chiffres ; ce sont des affirmations de vérité qui ont des dates d'expiration, des limites d'application spécifiques et des niveaux de fiabilité différents. Si nous ignorons ces règles cachées et que nous nous contentons de tout moyenner, nous finissons par créer une « Inflation de la Confiance » — une façon sophistiquée de dire que nous devenons trop confiants envers un système qui pourrait en réalité être défaillant de manière catastrophique.

La Grande Idée de l'Article : Arrêtez de Moyennner, Commencez à Vérifier le Maillon Faible

L'article, écrit par Sankalp et Shlok Gilda, soutient que la méthode actuelle de classement des modèles d'IA est fondamentalement erronée car elle traite tous les résultats de tests comme s'ils étaient également solides et permanents. Les auteurs appellent ce problème l'Inflation de la Confiance. Cela se produit lorsque nous mélangeons différents types de preuves — comme des vérifications informatiques automatisées, des opinions humaines et des juges IA — dans un score « moyen » unique. Le problème est qu'un seul point faible peut détruire l'ensemble du tableau, alors que la moyenne masque cette faiblesse.

Pour expliquer cela, les auteurs utilisent une analogie simple : imaginez une chaîne. La force de toute la chaîne n'est pas déterminée par la force moyenne de tous ses maillons, mais par son maillon le plus faible. Si vous avez une chaîne où 99 maillons sont en acier et un seul est en papier, toute la chaîne cassera sous le poids d'une plume. De même, si un modèle d'IA est excellent pour écrire de la poésie mais médiocre pour dire la vérité (la facticité), un score « moyen » peut le faire passer pour un bon polyvalent. Mais dans le monde réel, si cette IA est utilisée pour donner des conseils médicaux, son incapacité à dire la vérité est un désastre, peu importe la beauté de sa poésie.

L'article suggère que nous arrêtions d'utiliser la « moyenne » comme méthode par défaut. Au lieu de cela, nous devrions utiliser une approche par le « maillon faible », surtout pour les tâches critiques en matière de sécurité. Cela signifie que si une IA échoue à ne serait-ce qu'un seul test important, sa note globale devrait chuter pour refléter cet échec, au lieu d'être portée par ses autres bons scores.

Les Trois Règles de la Vérité de l'IA

Les auteurs proposent que chaque score de test soit accompagné d'une « étiquette » qui nous indique trois choses spécifiques, tout comme un emballage alimentaire vous indique ce qu'il contient, d'où il vient et quand il expire :

  1. La Formalité (Quelle est la force de la preuve ?) : Tous les tests ne se valent pas. L'article crée un système de « paliers ».

    • Palier F0 (Le plus faible) : Cela inclut les scores provenant d'autres modèles d'IA jugeant le travail ou des opinions issues du crowdsourcing. Les auteurs suggèrent que ceux-ci ne peuvent être considérés fiables que jusqu'à un plafond de fiabilité de 0,70, car les juges IA ont tendance à préférer les réponses longues et sophistiquées même si elles sont fausses.
    • Paliers F1 & F2 (Plus forts) : Ce sont des vérifications informatiques structurées ou des tests humains contrôlés. Ils sont plus fiables, mais même les tests humains ont des limites (fiabilité jusqu'à 0,95).
    • Palier F3 (Le plus fort) : Il s'agit d'une preuve mathématique formelle. C'est la seule capable d'atteindre une fiabilité parfaite de 1,00.
    • La Règle : Si vous mélangez un score de palier F0 avec un score de palier F2, le résultat global est plafonné au niveau du F0 (0,70). On ne peut pas rendre un test faible fort simplement en lui ajoutant un test fort.
  2. Le Périmètre (Où cela s'applique-t-il ?) : Un score de test n'est vrai que pour la situation spécifique pour laquelle il a été testé. Si une IA est testée sur des questions en anglais, cela ne signifie pas qu'elle est bonne en espagnol. Si elle est testée sur la culture générale, cela ne signifie pas qu'elle est douée pour les conseils juridiques. L'article soutient que les scores doivent explicitement énoncer leurs limites pour que nous ne les utilisions pas accidentellement dans le mauvais contexte.

  3. Les Fenêtres de Validité (Quand cela expire-t-il ?) : Les scores de test ont une durée de vie. Comme le lait, ils tournent. Les auteurs soulignent qu'une fois qu'un modèle d'IA a vu les questions du test lors de son entraînement (un problème appelé « contamination »), le score devient sans valeur. Ils suggèrent que chaque score ait une date d'expiration. Une opinion générée par une IA pourrait n'être valide que pendant quelques semaines, tandis qu'une preuve mathématique formelle pourrait durer éternellement.

Preuve Réelle : L'« Inflation de la Confiance » en Action

Les auteurs ne se sont pas contentés de théorie ; ils ont construit un véritable système de test pour les agents d'IA et y ont découvert des bugs inquiétants.

  • Le Bug Silencieux : Ils ont découvert qu'une incompatibilité entre leurs langages de programmation faisait que chaque échec était enregistré comme un succès. Le système leur mentait, gonflant les scores sans que personne ne s'en aperçoive. C'est l'« inflation de la confiance » au niveau de l'infrastructure.
  • Le Mensonge de la « Moyenne » : Ils ont testé cette théorie sur un célèbre classement public appelé HELM. Ils ont examiné 54 modèles d'IA de pointe à travers 10 scénarios différents.
    • Lorsqu'ils ont classé les modèles selon le score moyen, les 5 meilleurs modèles appartenaient à un groupe.
    • Lorsqu'ils les ont classés selon le maillon le plus faible (le score le plus bas dans n'importe quelle catégorie), les 5 meilleurs modèles étaient un groupe totalement différent.
    • En fait, le chevauchement entre les deux listes des 5 meilleurs était nul. Les modèles qui semblaient être les meilleurs « polyvalents » selon la méthode de la moyenne étaient en réalité ceux qui présentaient les faiblesses cachées les plus importantes. Les modèles qui semblaient « moyens » selon l'ancienne méthode étaient en réalité les plus fiables car ils n'avaient aucun échec catastrophique.

Ce que cela signifie pour l'avenir

L'article conclut par un appel à l'action destiné à la communauté de l'IA. Ils veulent que nous arrêtions de cacher les mathématiques derrière les scores.

  • Montrez votre travail : Chaque score doit porter une étiquette indiquant la force de la preuve, ce à quoi il s'applique et quand il expire.
  • Choisissez votre poison : Si nous devons combiner des scores, nous devons admettre quelle méthode nous utilisons. Sommes-nous optimistes (en utilisant la moyenne) ou conservateurs (en utilisant le maillon le plus faible) ? L'article soutient que pour la sécurité, nous devrions adopter par défaut la méthode conservatrice du « maillon le plus faible », mais qu'au moins, nous devons admettre que nous avons fait ce choix.
  • Contrôle de version : Tout comme le code logiciel, la manière d'enregistrer les résultats de tests doit être versionnée pour éviter de comparer accidentellement des pommes et des oranges.

Les auteurs admettent qu'il s'agit d'un « article de position », ce qui signifie qu'ils proposent une nouvelle façon de penser basée sur une logique solide et l'expérience de l'ingénierie, plutôt que sur une nouvelle expérience massive prouvant que tout est 100 % correct. Ils reconnaissent qu'être trop conservateur pourrait faire paraître de bons modèles comme étant mauvais, mais ils soutiennent qu'il vaut mieux être prudent que de déployer un système qui semble excellent en moyenne, mais qui échoue d'une manière qui nuit aux gens. En rendant transparent le « statut épistémique » (la véracité et les limites) des scores, nous pouvons prendre de meilleures décisions concernant les systèmes d'IA auxquels nous faisons confiance.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →