← Derniers articles
🤖 AI

Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild

Cet article présente une étude empirique de 57 environnements d'évaluation d'apprentissage automatique qui identifie l'étape de spécification comme la source principale des défis opérationnels, classe 16 560 problèmes par cause racine pour révéler que les fonctionnalités non implémentées, les lacunes de documentation et l'absence de validation des entrées représentent plus de 60 % des problèmes, et établit une base pour considérer l'ingénierie de l'évaluation comme une discipline distincte de l'ingénierie logicielle.

Auteurs originaux : Zhimin Zhao, Zehao Wang, Abdul Ali Bangash, Bram Adams, Ahmed E. Hassan

Publié 2026-05-26
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhimin Zhao, Zehao Wang, Abdul Ali Bangash, Bram Adams, Ahmed E. Hassan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un chef essayant d'évaluer une nouvelle recette. Vous avez les ingrédients (les données), la fiche de recette (le modèle) et une liste de règles définissant ce qui rend un plat « bon » (les métriques). Mais avant de pouvoir goûter le plat, vous avez besoin d'une cuisine pour cuisiner, d'un minuteur pour suivre la cuisson et d'une feuille de notation pour consigner les résultats.

Dans le monde de l'Intelligence Artificielle (IA), cette « cuisine » s'appelle un Evaluation Harness (outil d'évaluation). C'est l'outil logiciel qui exécute réellement les tests, charge les données, calcule les scores et vous indique si le modèle d'IA performe bien.

Ce papier est comme une vaste inspection de 57 « cuisines d'IA » différentes pour voir comment elles fonctionnent, où elles échouent et pourquoi les gens sont frustrés par elles. Les chercheurs appellent ce nouveau domaine « Ingénierie de l'Évaluation ».

Voici la décomposition de leurs résultats utilisant des analogies simples :

1. Le flux de travail en cinq étapes de la cuisine

Les chercheurs ont découvert que chaque cuisine d'évaluation d'IA passe par cinq étapes spécifiques, comme une chaîne de production :

  • Provisionnement (Préparation de la cuisine) : Mettre le fourneau, les casseroles et les ingrédients en place. Cela inclut l'installation du logiciel et la connexion aux comptes.
  • Spécification (Écriture de la recette) : Décider exactement ce que vous cuisinez et quels ingrédients vous utilisez. C'est ici que vous chargez le modèle d'IA et les données de test.
  • Exécution (Cuisson du plat) : Lancer réellement le modèle d'IA pour générer des réponses.
  • Évaluation (Dégustation et notation) : Vérifier les réponses par rapport aux réponses correctes et calculer un score.
  • Rapport (Service du menu) : Présenter les résultats finaux dans un graphique ou un rapport.

La grande surprise : La plupart de ces cuisines sont excellentes pour « cuisiner » (Exécution) mais terribles pour « servir » (Rapport). Très peu disposent d'alarmes automatiques pour vous dire si le plat a un goût pire aujourd'hui qu'hier.

2. Là où les choses tournent mal (Les causes racines)

L'équipe a examiné plus de 16 000 plaintes (appelées « issues ») de la part des utilisateurs. Ils ont constaté que les problèmes ne sont généralement pas dus à des mathématiques erronées ou à des plantages dramatiques du code. Au contraire, les problèmes sont principalement bureaucratiques et liés à des éléments manquants.

Pensez-y comme essayer de construire un set de Lego où les instructions manquent ou où la boîte indique « comprend une brique rouge » mais où vous ne recevez qu'une brique bleue.

Les trois principales raisons pour lesquelles les cuisines échouent sont :

  1. Fonctionnalités manquantes (24 %) : L'outil a promis de faire quelque chose (comme gérer un type spécifique de données), mais les développeurs n'ont jamais réellement construit cette partie. C'est comme une voiture qui a un volant mais pas de moteur.
  2. Mauvaises instructions (20 %) : L'outil fonctionne, mais le manuel est absent, obsolète ou confus. Les utilisateurs ne parviennent pas à comprendre comment l'utiliser.
  3. Absence de contrôles de sécurité (17 %) : L'outil ne vérifie pas si les ingrédients sont frais. Si vous lui donnez de mauvaises données, il ne s'arrête pas ; il cuisine simplement des déchets et vous donne un score de déchets.

3. Les différents types de cuisines

Les chercheurs ont regroupé les 57 cuisines en quatre « archétypes » (types), et chaque type a ses propres maux de tête spécifiques :

  • La cuisine de test standardisée (40 %) : Ce sont les grandes cuisines célèbres qui testent de nombreux modèles contre des examens standard (comme le SAT pour l'IA).
    • Leur plus gros problème : Rupture de dépendances. Elles dépendent d'ingrédients externes (jeux de données) qui changent ou disparaissent sans préavis. Si le fournisseur change l'emballage, toute la cuisine cesse de fonctionner.
  • L'outil spécialisé (21 %) : Ce sont de petits outils qui font une seule chose parfaitement (comme vérifier si un robot peut marcher).
    • Leur plus gros problème : Mauvaises instructions. Parce qu'ils sont si simples, les développeurs oublient d'écrire des instructions claires sur comment les configurer.
  • La sonde personnalisée (21 %) : Elles testent des compétences spécifiques (comme le codage ou les mathématiques).
    • Leur plus gros problème : Erreurs mathématiques. Puisqu'elles inventent leurs propres formules de notation, elles font souvent des erreurs de calcul, entraînant des erreurs silencieuses où le score semble correct mais est en réalité faux.
  • Le restaurant à service complet (17 %) : Ce sont les plateformes élégantes et tout-en-un qui font tout.
    • Leur plus gros problème : Incompatibilités de contrat. Parce qu'elles connectent tant de parties différentes (comme un juge distant et un modèle local), les parties parlent souvent des langues différentes, provoquant des ruptures de communication.

4. Le « tueur silencieux »

Le problème le plus dangereux que le papier a identifié est les Erreurs de notation silencieuses.

Imaginez un juge goûtant une soupe et lui attribuant une note de 5 étoiles. Le juge est confiant, le score est imprimé, et tout le monde est heureux. Mais le juge a en fait oublié d'ajouter du sel, et la soupe a un goût terrible. L'outil ne s'est pas planté ; il a simplement donné un score erroné.

Le papier a constaté que de nombreux outils calculent les scores incorrectement (Erreurs algorithmiques) ou ne vérifient pas si les données ont du sens (Lacunes de validation), et comme il n'y a pas de « deuxième avis » intégré au système, personne ne remarque l'erreur avant beaucoup plus tard.

5. Ce que cela signifie pour l'avenir

Le papier conclut que nous devons traiter ces outils non pas comme de simples « scripts », mais comme des produits d'ingénierie sérieux.

  • Les développeurs doivent cesser de supposer que les mathématiques sont parfaites et commencer à construire des « filets de sécurité » (comme vérifier si le score a du sens avant de l'imprimer).
  • Les utilisateurs doivent cesser de faire confiance aveuglément au score. Le fait que l'outil indique « 95 % de précision » ne signifie pas que c'est vrai ; vous devez vérifier le travail.
  • Les chercheurs doivent inventer de nouvelles façons de tester ces outils, car les anciennes méthodes de test logiciel ne fonctionnent pas lorsque le « test » lui-même est une IA qui pourrait halluciner.

En résumé : Nous avons construit des machines incroyables pour tester d'autres machines, mais les machines qui effectuent les tests manquent souvent d'instructions, ont des failles dans leur logique et n'ont pas la capacité de nous dire quand elles sont confuses. Réparer ces « cuisines » est tout aussi important que de construire de meilleurs « chefs » (modèles d'IA).

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →