← Derniers articles
💬 NLP

NLG Evaluation: Past, Present, Future

Cet article retrace l'évolution de l'évaluation de la génération de langage naturel (NLG) depuis ses origines centrées sur la linguistique en 1990 jusqu'à son paradigme expérimental actuel piloté par l'apprentissage automatique, tout en prédisant que les évaluations futures privilégieront de plus en plus les métriques d'impact, qualitatives et de sécurité à mesure que la technologie NLG deviendra omniprésente.

Auteurs originaux : Ehud Reiter

Publié 2026-05-25
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ehud Reiter

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez la Génération de Langage Naturel (GLN) comme un chef qui écrit des recettes et cuisine des plats en utilisant des ordinateurs plutôt que des fours. Depuis 30 ans, la façon dont nous jugeons le travail de ce chef a complètement changé, et elle est sur le point de changer à nouveau. Cet article, écrit par Ehud Reiter, est une chronologie de la manière dont nous avons appris à faire des tests de goût sur ces repas numériques.

Voici l'histoire de l'évaluation de la GLN, décomposée en trois actes : Le Passé, Le Présent et Le Futur.

Acte 1 : Le Passé (1990 – 2010)

L'Ère de la « Note du Chef »

  • 1990 : L'Approche du Critique d'Art
    En 1990, lorsque l'auteur a obtenu son doctorat, personne ne « testait » vraiment la cuisine avec des chiffres. Si un chef affirmait que sa nouvelle recette était meilleure, il ne la servait pas à 100 personnes pour voir si elles l'aimaient. Au lieu de cela, il écrivait un long essai expliquant pourquoi la recette était bonne, en utilisant des arguments linguistiques ou techniques sophistiqués. C'était comme un critique culinaire disant : « Cette sauce est magnifique car la grammaire des ingrédients s'écoule bien », sans jamais demander à personne si cela avait bon goût.
  • 2000 : L'Explosion des Tests de Goût
    Vers 2000, les gens ont réalisé qu'ils devaient réellement goûter la nourriture. Les chercheurs ont commencé à essayer toutes sortes de méthodes pour juger les repas : demander à des humains de les noter, vérifier si la nourriture résolvait un problème spécifique, ou utiliser des scores informatiques précoces. C'était un peu chaotique — tout le monde essayait des méthodes différentes, et il n'existait pas encore de « référence absolue » unique.
  • 2010 : Le Menu Standardisé
    En 2010, la cuisine s'est organisée. La communauté a commencé à utiliser des « Tâches Partagées », qui ressemblaient à des concours de cuisine où chacun devait préparer le même plat. Ils se sont mis d'accord sur des règles spécifiques pour mesurer la nourriture :
    • La Règle (Métriques) : Ils utilisaient des scores informatiques comme BLEU et ROUGE. Imaginez-les comme comparer le nouveau plat à un « plat de référence parfait » et compter combien de mots correspondaient.
    • Le Jury (Notations Humaines) : Ils demandaient également à des humains de classer les plats. Cela est devenu la méthode standard pour juger si la nourriture était réellement délicieuse, car les règles informatiques se trompaient parfois.

Acte 2 : Le Présent (2026)

L'Ère du « Super-Chef »

Avancez rapidement jusqu'en 2026. Le chef (désormais alimenté par d'immenses modèles d'IA appelés LLM) est devenu incroyablement doué. La nourriture est si parfaite que les anciennes méthodes de jugement s'effondrent.

  • Le Problème de l'Ancienne Règle :
    Dans le passé, nous comparions la nourriture de l'IA à un « plat de référence » écrit par un humain. Mais maintenant, la nourriture de l'IA est souvent meilleure que la référence humaine. On ne peut pas juger un chef-d'œuvre en le comparant à un croquis ; le croquis paraît simplement mauvais par comparaison.
  • Le Nouveau Juge (LLM-comme-Juge) :
    Puisque la nourriture est si complexe, nous avons commencé à utiliser une IA pour juger une autre IA. C'est comme embaucher un super-connaisseur qui est aussi un robot pour critiquer le repas. Cela fonctionne bien parfois, mais c'est risqué si le robot dégustateur est biaisé ou confus.
  • Le Jury d'Experts :
    Les gens ordinaires (travailleurs de la foule) ne sont plus assez bons pour repérer les erreurs subtiles dans ces repas de haute qualité. Parfois, ils trichent même en utilisant l'IA pour faire le jugement ! Nous avons donc maintenant besoin d'experts (comme des médecins ou des avocats) pour examiner attentivement la nourriture à la recherche de problèmes spécifiques, comme « Le chef a-t-il halluciné un ingrédient factice ? » ou « Cet avis est-il sûr ? ».
  • La Vérification de Sécurité :
    Parce que ces chefs IA travaillent désormais dans des hôpitaux et des cabinets d'avocats, nous ne pouvons plus nous soucier uniquement de la qualité « moyenne » du repas. Nous devons vérifier les scénarios du pire. Si une IA médicale donne des conseils parfaits 99,9 % du temps mais donne des conseils mortels 0,1 % du temps, c'est un désastre. Nous devons traquer ces erreurs rares et dangereuses.

Acte 3 : Le Futur (2036)

L'Ère de l'« Impact dans le Monde Réel »

En regardant vers 2036, l'auteur soutient que nous devons cesser de simplement mesurer à quel point le chef cuisine bien dans une cuisine de test et commencer à mesurer comment la nourriture affecte le monde réel.

  • Évaluation de l'Impact (Le Bilan de Santé) :
    Actuellement, nous demandons surtout : « L'IA a-t-elle trouvé la bonne réponse ? » Dans le futur, nous devrons demander : « L'utilisation de cette IA a-t-elle réellement aidé le patient ? » ou « A-t-elle fait économiser de l'argent à l'entreprise ? ». C'est comme passer de l'évaluation d'une recette dans un laboratoire à la vérification de savoir si le restaurant rend réellement ses clients heureux et en bonne santé dans le monde réel.
  • Évaluation Qualitative (Le Récit) :
    Nous devrons cesser de nous fier uniquement aux chiffres (statistiques) et commencer à écouter les histoires. Nous utiliserons des entretiens et des groupes de discussion pour comprendre pourquoi les gens ont aimé ou détesté l'expérience. Les chiffres nous disent ce qui s'est passé ; les histoires nous disent comment cela s'est senti.
  • Évaluation de la Sécurité (Les Garde-fous) :
    La sécurité deviendra la chose la plus importante. Les gouvernements pourraient commencer à intervenir pour établir des règles, tout comme ils le font pour les voitures ou les médicaments. Nous devrons surveiller constamment l'IA pour nous assurer qu'elle ne dévie pas, surtout lorsque des pirates tentent de la tromper ou lorsqu'elle fait face à des situations étranges et imprévisibles.

La Grande Conclusion

L'article conclut que le domaine évolue du cochage de cases (les chiffres correspondaient-ils ?) vers la vérification du monde réel (cela a-t-il réellement aidé ou nui aux gens ?).

L'auteur met en garde contre le fait que la culture de recherche actuelle est un peu paresseuse ; tout le monde veut publier des résultats rapides, et les examinateurs ignorent souvent si les tests sont réellement bons. Pour avancer, la communauté doit être plus rigoureuse, cesser de tricher et apprendre à tester ces outils puissants dans la réalité désordonnée et complexe où ils seront effectivement utilisés.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →