The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer
Cet article révèle une « illusion de référence » où les grands modèles de langage élagués semblent compétents lors d'évaluations à choix multiples mais échouent dans la génération ouverte car l'élagage dégrade les bonnes réponses plutôt que de les effacer, suggérant que les modèles compressés doivent être testés sur leurs capacités génératives plutôt que sur leurs seules capacités de reconnaissance.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous possédez un bibliothécaire brillant et érudit (un grand modèle de langage) qui connaît la réponse à presque toutes les questions. Pour économiser de l'argent et de l'espace, vous décidez d'« élaguer » la bibliothèque. Vous retirez une énorme partie des livres et des étagères, ne gardant que les plus essentiels.
L'article sur lequel vous interrogez porte sur ce qui se passe lorsque l'on teste cette bibliothèque réduite.
L'« Illusion du QCM »
Voici l'astuce : lorsque vous posez une question au bibliothéraire, vous pouvez le tester de deux manières :
- La question ouverte : Vous demandez : « Qui a découvert les Açores ? » et vous attendez qu'il donne la réponse de mémoire.
- Le test à choix multiples (QCM) : Vous demandez : « Qui a découvert les Açores ? A) 1427, B) 1500, C) 1600, D) 1700. »
L'article a découvert une « illusion » surprenante. Après l'élagage, le bibliothécaire échoue souvent à la question ouverte. Il pourrait dire : « Je pense que c'était au XVe siècle », ce qui est vague ou incorrect. Mais, si vous lui donnez le test à choix multiples, il réussit haut la main. Il pointe immédiatement « 1427 » et trouve la bonne réponse.
Les benchmarks standards (les tests utilisés pour évaluer l'IA) reposent généralement sur le format à choix multiples. Cela crée un faux sentiment de sécurité. Le test dit : « Votre bibliothèque est toujours parfaite ! » mais en réalité, le bibliothécaire a perdu sa capacité de rappeler la réponse sans aide. Il peut encore la reconnaître si vous la lui montrez, mais il ne peut pas la produire de lui-même.
La théorie de la « Déclassement » vs « Effacement »
Les auteurs ont posé une question critique : l'élagage a-t-il effacé la connaissance (le bibliothécaire a totalement oublié le fait) ou a-t-il simplement déclassé la connaissance (le bibliothécaire connaît toujours le fait, mais ce n'est plus sa première réponse spontanée) ?
Ils ont découvert qu'il s'agit principalement d'un déclassement.
Imaginez l'esprit du bibliothécaire comme une pièce bondée d'idées. Avant l'élagage, la bonne réponse se tenait juste devant la porte, en train de vous faire signe. Après l'élagage, la bonne réponse est toujours dans la pièce, mais elle a été repoussée au troisième ou quatrième rang.
- Le décodage glouton (Greedy Decoding - le réglage par défaut) : Le bibliothécaire ne regarde que la personne debout devant la porte. Puisque la bonne réponse est maintenant au rang 3, le bibliothécaire choisit la mauvaise personne qui se tient devant la porte.
- Le choix multiple : Vous donnez au bibliothécaire une liste de personnes présentes dans la pièce. Même si la bonne personne est au rang 3, le bibliothécaire peut toujours la voir sur la liste et la choisir.
Comment corriger le « Déclassement »
Puisque la connaissance n'a pas été effacée, mais simplement repoussée, l'article montre que l'on peut souvent récupérer la réponse avec un peu d'aide :
- Recherche plus large : Au lieu de simplement regarder devant la porte (décodage glouton), si vous dites au bibliothécaire de regarder les 5 premières personnes dans la pièce (Beam Search) ou de faire quelques tentatives (Échantillonnage/Sampling), il retrouvera la bonne réponse.
- Un petit indice : Si vous donnez au bibliothécaire un seul exemple de la façon de répondre à une question similaire (un exemple « en contexte »), cela l'aide à repousser la bonne réponse vers le premier rang.
Le revers de la médaille
Cet effet de « déclassement » se produit souvent, surtout avec les modèles plus grands et les langues pour lesquelles le modèle est performant. Cependant, l'article note que pour les modèles plus petits ou les langues très difficiles, l'élagage efface parfois réellement la connaissance. Dans ces cas-là, même si vous lui montrez la liste, le bibliothécaire ne peut pas trouver la réponse car elle a disparu.
L'essentiel
L'article nous avertit de ne pas trop se fier aux scores de « Choix Multiples » pour juger les modèles d'IA compressés. Un modèle peut sembler parfait lors d'un test où l'on lui donne les réponses, mais échouer lamentablement lorsqu'un utilisateur réel pose une question directe. Pour savoir si un modèle compressé est réellement utile, nous devons tester ce qu'il peut produire par lui-même, et non pas seulement ce qu'il peut reconnaître lorsque nous lui présentons le corrigé.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.