OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
Cet article présente OMGEval, le premier benchmark d'évaluation générative multilingue en open-source comprenant 804 questions ouvertes rigoureusement vérifiées et localisées culturellement dans cinq langues pour évaluer et améliorer les capacités multilingues des grands modèles de langage.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous ayez construit un bibliothécaire brillant et omniscient, capable de parler toutes les langues du monde. Vous voulez tester si ce bibliothécaire est réellement intelligent dans toutes les cultures, ou s'il n'est qu'un « expert local » qui ne comprend que la culture des États-Unis.
Ce document présente OMGEval, qui est essentiellement un test de « permis de conduire » multiculturel pour ces bibliothécaires IA (les grands modèles de langage).
Voici le détail de ce que les auteurs ont fait, en utilisant des analogies simples :
1. Le problème : Le biais de la « Télévision Américaine »
La plupart des tests actuels pour l'IA sont comme regarder une émission de télévision qui ne diffuse que des programmes en anglais et parle de fêtes, de nourriture et d'histoire américaines.
- Le problème : Si vous demandez à une IA : « Quel est le plat traditionnel pour Thanksgiving ? », elle répondra correctement « Dinde ». Mais si vous demandez à un sinophone : « Quel est le plat traditionnel pour la fête des Bateaux-Dragons ? », une IA entraînée uniquement sur des données américaines pourrait être confuse ou donner une mauvaise réponse parce qu'elle ne comprend pas la culture locale.
- L'affirmation du papier : La plupart des tests existants sont trop concentrés sur l'anglais. Ils ne vérifient pas si l'IA comprend qu'en Russie, Pâques implique des gâteaux spécifiques, ou qu'en Espagne, il existe des friandises spécifiques pour la Toussaint.
2. La solution : OMGEval (Le test du « Guide Touristique Local »)
Les auteurs ont créé un nouveau test appelé OMGEval. Au lieu de simplement traduire des questions anglaises dans d'autres langues (ce qui revient à mettre des sous-titres anglais sur un film russe), ils ont réécrit les questions pour qu'elles s'adaptent à la culture locale.
- L'analogie : Imaginez une question de test sur les « Vacances d'été ».
- L'ancienne méthode (Traduction) : « Où les Américains vont-ils pour les vacances d'été ? » (Réponse : Hawaï).
- La méthode OMGEval (Localisation) : « Où les Chinois vont-ils pour les vacances d'été ? » (Réponse : Sanya).
- Pourquoi c'est important : Les deux questions portent sur les « destinations de vacances d'été », mais le contexte culturel est différent. OMGEval garantit que l'IA connaît la version locale de l'histoire, et non pas seulement la version américaine.
3. Comment ils l'ont construit
L'équipe n'a pas simplement utilisé un robot pour traduire des choses ; ils ont utilisé une équipe d'experts humains (des linguistes) pour agir comme des éditeurs culturels.
- Le processus : Ils ont pris 804 questions ouvertes (comme des devinettes, des faits ou des sujets d'écriture créative) et les ont adaptées pour 5 langues : le chinois, le russe, le français, l'espagnol et l'arabe.
- La « touche humaine » : Si une question mentionnait une célébrité américaine spécifique, ils l'échangeaient contre une figure locale célèbre. Si elle mentionnait une fête américaine spécifique, ils l'échangeaient contre un festival local. Ils ont fait cela pour s'assurer que l'IA était testée sur sa capacité à comprendre cette culture spécifique, et non seulement sur sa capacité à traduire des mots.
4. Comment ils ont noté l'IA
Puisque les humains ne peuvent pas lire des milliers de réponses dans cinq langues instantanément, ils ont utilisé GPT-4 (une IA très avancée) comme arbitre.
- Le jeu : Ils ont demandé aux modèles d'IA de répondre aux questions. Ensuite, ils ont demandé à GPT-4 d'examiner deux réponses côte à côte et de décider laquelle était la meilleure.
- La vérification : Ils ont également fait noter un petit échantillon par de vrais humains pour s'assurer que l'« Arbitre IA » était équitable. Les résultats ont montré que l'Arbitre IA était très précis (environ 90 % d'accord avec les humains).
5. Les résultats : Qui a réussi le test ?
Ils ont testé plusieurs modèles d'IA différents, y compris de gros modèles commerciaux (comme GPT-4) et des modèles open-source (des modèles gratuits que n'importe qui peut télécharger).
- Le gagnant : GPT-4 était le seul modèle à obtenir systématiquement un score supérieur à 50 % (ce qui signifie qu'il a battu la référence plus de la moitié du temps). C'était l'« élève brillant ».
- La difficulté : Les modèles open-source (comme Guanaco, Phoenix et d'autres) ont énormément lutté.
- L'écart : Tandis que GPT-4 pouvait gérer les nuances culturelles, les modèles open-source commettaient souvent des erreurs factuelles ou manquaient le contexte culturel. Par exemple, lorsqu'on demandait le premier film d'un célèbre réalisateur chinois, certains modèles open-source donna l l'année erronée ou le mauvais titre de film, alors que GPT-4 avait raison.
- La conclusion : Il existe un énorme fossé entre les modèles commerciaux de haut niveau et les modèles open-source en ce qui concerne la compréhension des différentes cultures. Les modèles open-source sont comme des étudiants qui ont étudié le manuel, mais qui ont échoué à comprendre le dialecte local.
Résumé
OMGEval est un nouveau test, plus juste, qui vérifie si les modèles d'IA comprennent les diverses cultures du monde, et pas seulement la version américaine du monde. Le papier montre que si la meilleure IA (GPT-4) est assez douée pour cela, beaucoup d'autres modèles sont encore en difficulté pour comprendre la « saveur » locale des différentes langues et cultures. Les auteurs espèrent que ce test aidera la communauté à construire des IA meilleures et plus conscientes des cultures à l'avenir.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.