Models Know Models Best: Evaluation via Model-Preferred Formats
Cet article propose une stratégie d'alignement dynamique de format qui exploite un classificateur léger entraîné sur des signaux privilégiés par le modèle pour sélectionner automatiquement entre des formats d'évaluation basés sur des symboles et de type « cloze », résolvant ainsi les écarts de performance et améliorant considérablement la précision en zéro décalage (zero-shot) à travers divers benchmarks de LLM.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous passiez un test pour prouver votre intelligence. Maintenant, imaginez que ce test se présente sous deux styles différents :
- Le style « Choix multiples » : Vous lisez une question, puis vous devez choisir une lettre (A, B, C ou D) qui correspond à la réponse.
- Le style « Texte à trous » : Vous lisez une phrase qui s'arrête brusquement, et vous devez compléter la phrase avec les bons mots.
Pendant longtemps, les chercheurs ont pensé que ces deux styles n'étaient que des manières différentes de poser la même question. Mais cet article, intitulé « Models Know Models Best » (Les modèles connaissent mieux les modèles), a découvert quelque chose de surprenant : les grands modèles de langage (LLM) n'aiment pas les deux styles de la même manière. En fait, le style que vous choisissez peut faire passer un modèle pour un génie ou pour un échec total, même si la question est exactement la même.
Voici le détail de ce que les auteurs ont découvert, en utilisant des analogies simples.
1. Le problème de « l'outil inadapté »
Les chercheurs ont testé 22 modèles d'IA différents sur 8 types de questions. Ils ont trouvé un schéma clair :
- Le style « Symbole » (Choisir A, B, C, D) : Cela fonctionne mieux pour les questions qui nécessitent de comparer des options. Pensez à un menu où vous devez choisir le plat qui convient à votre régime alimentaire. Le modèle doit examiner toutes les options côte à côte pour faire un choix.
- Le style « Cloze » (Texte à trous) : Cela fonctionne mieux pour les questions qui nécessitent de continuer une histoire. Pensez à terminer une phrase dans un roman. Le modèle est entraîné pour prédire quel mot vient ensuite dans un flux naturel.
Le Problème : Lorsque les chercheurs ont forcé un modèle de type « conteur d'histoires » à choisir une lettre dans une liste (style Symbole) pour une question qui consistait réellement à terminer une phrase, le score du modèle s'est effondré. C'était comme demander à un marathonien de résoudre une équation mathématique ; il est bon pour courir, mais le format du test ne correspondait pas à sa force.
2. Les humains ne peuvent pas deviner le meilleur format
Les auteurs ont d'abord tenté de corriger cela en demandant à des humains de regarder une question et de décider : « Hé, celle-ci ressemble à une histoire, utilisons donc le style Texte à trous ».
Le Résultat : Cela n'a pas bien fonctionné. Les humains sont mauvais pour deviner quel format une IA préférera. Parfois, une question ressemble à une histoire pour un humain, mais l'IA préfère en réalité le format de la liste à choix multiples. Se fier à l'intuition humaine a souvent fait diminuer les performances de l'IA.
3. La solution : « Demander au modèle ce qu'il veut »
Puisque les humains ne pouvaient pas deviner le bon format, les auteurs ont interrogé les modèles eux-mêmes.
Ils ont construit un petit « agent de circulation » léger (un classificateur). Cet agent de circulation examine une question spécifique et demande à l'IA : « Si je te donne cette question sous forme de liste à choix multiples, quel est ton niveau de confiance ? Si je te la donne sous forme de texte à trous, quel est ton niveau de confiance ? »
En se basant sur les propres signaux de confiance internes de l'IA, l'agent de circulation décide quel format utiliser pour cette question spécifique.
- Si la question porte sur la comparaison d'options : L'agent de circulation dit : « Utilisez le format Choix multiples (Symbole) ».
- Si la question porte sur la fin d'une phrase : L'agent de circulation dit : « Utilisez le format Texte à trous (Cloze) ».
4. Les résultats : Libérer le potentiel caché
Lorsqu'ils ont utilisé cette stratégie de « Préférence du Modèle », les résultats ont été spectaculaires.
- Pour les questions de type « Histoire » : Les performances de l'IA ont bondi de manière significative. C'était comme si on leur avait enfin donné les bonnes chaussures pour le coureur.
- Pour les questions de type « Comparaison » : Les performances sont restées élevées ou se sont légèrement améliorées.
- La conclusion majeure : L'article montre que de nombreux modèles d'IA sont en réalité bien plus intelligents que nous ne le pensions, mais que nous les testions souvent avec la mauvaise « règle ». En changeant la règle pour qu'elle corresponde à la tâche spécifique, nous pouvons voir leurs véritables capacités.
Résumé
L'article soutient que nous ne devrions pas simplement choisir un format de test et s'y tenir pour tout. Au lieu de cela, nous devrions laisser l'IA nous dire quel format elle préfère pour chaque problème spécifique. Ce faisant, nous arrêtons de faire trébucher les modèles et nous commençons à voir à quel point ils sont réellement intelligents.
En bref : la façon dont vous posez une question compte autant que la question elle-même, et la meilleure façon de trouver la bonne façon de poser la question est d'écouter les préférences du modèle lui-même.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.