Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?
Cette étude révèle que le format des questions, notamment le nombre d'options et la formulation spécifique, affecte considérablement les performances des grands modèles de langage dans les tâches de raisonnement, provoquant souvent un décalage entre la justesse des étapes de raisonnement et la correction de la réponse finale.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous êtes un enseignant essayant de tester l'intelligence d'un nouvel élève (une IA) dans la résolution de problèmes de logique. Vous voulez savoir si l'élève comprend vraiment les mathématiques ou la logique, ou s'il devine simplement la bonne réponse.
Ce document est comparable à un bulletin de notes d'une étude où les chercheurs ont posé les mêmes problèmes de logique à cinq élèves IA différents, mais en les interrogeant de trois manières très différentes :
- Le style « Dissertation » (Réponse courte) : « Voici un problème. Résolvez-le et donnez-moi la réponse. »
- Le style « Choix multiples » : « Voici un problème. Choisissez la bonne réponse parmi ces 5 ou 11 options. »
- Le style « Vrai ou Faux » : « Voici un problème et une réponse spécifique. Cette réponse est-elle Vraie ou Fausse ? »
Les chercheurs voulaient savoir : La manière dont vous posez la question modifie-t-elle la performance de l'IA ?
Voici les principales conclusions, expliquées simplement :
1. L'effet « Jeu de devinettes »
La plus grande surprise fut que obtenir la bonne réponse finale ne signifie pas toujours que l'IA a effectué le bon travail.
- L'analogie : Imaginez un élève passant un test à choix multiples. Il ne sait peut-être pas faire le calcul, mais il devine « C » et a raison. Si vous ne regardez que la feuille de réponses, il a eu 100 %. Mais si vous regardez ses brouillons, il a écrit du non-sens.
- La découverte : L'IA a souvent « deviné » la bonne lettre dans une question à choix multiples, même lorsque ses étapes de raisonnement étaient erronées. Inversement, parfois l'IA a effectué le calcul parfait mais a choisi la mauvaise lettre à la toute fin car elle a été confuse par les options.
- La leçon : Si vous ne vérifiez que la réponse finale, vous pourriez penser que l'IA est plus intelligente qu'elle ne l'est réellement.
2. Le problème du « Menu » (Choix multiples)
Lorsque les chercheurs ont fourni à l'IA une liste d'options à choisir, le nombre d'options et les mots utilisés ont beaucoup compté.
- Trop de choix : Lorsque la liste est passée de 5 options à 11 options, la performance de l'IA a souvent chuté. C'est comme si on offrait 5 parfums de glace à choisir contre 50 ; l'IA s'est sentie submergée et a commencé à deviner davantage.
- L'option « Quelque chose d'autre » : Les chercheurs ont ajouté une option étrange appelée « Quelque chose d'autre » (ou « Aucune des réponses ci-dessus »).
- Si « Quelque chose d'autre » était la bonne réponse, l'IA avait souvent du mal à la choisir, même si elle avait fait le calcul correctement. Elle semblait préférer choisir un nombre spécifique, même si ce nombre était faux.
- L'IA semblait aussi avoir un biais de « siège préféré ». Elle choisissait plus souvent la première ou la dernière option, indépendamment du fait qu'elle était correcte ou non.
3. Le piège « Oui/Non » (Vrai ou Faux)
Lorsqu'on pose des questions « Vrai ou Faux », les mots spécifiques utilisés modifient les résultats.
- Vrai vs Faux : L'IA était généralement meilleure pour dire « Vrai » lorsque la réponse était correcte que pour dire « Faux » lorsque la réponse était incorrecte. Elle semblait avoir un biais vers l'accord.
- La formulation : Changer l'invite de « Vrai ou Faux » à « Oui ou Non » a rendu l'IA nettement moins performante sur certaines tâches. C'est comme si une personne répondait « Oui » à « Voulez-vous y aller ? » mais hésitait sur « Est-il vrai que vous voulez y aller ? ». L'IA est sensible à ces infimes changements linguistiques.
4. La confusion des « Instructions »
Les chercheurs ont tenté d'aider l'IA en ajoutant des instructions telles que : « Résolvez d'abord le problème, puis décidez si c'est Vrai ou Faux. »
- Le résultat : Parfois cela a aidé, mais souvent cela a confondu l'IA ou l'a fait performer moins bien. L'IA s'est parfois concentrée au point d'oublier la logique réelle du problème.
Résumé : Que devons-nous apprendre ?
Le document conclut que nous ne pouvons pas nous fier uniquement au score final pour juger de l'intelligence d'une IA.
- Si vous posez une question à choix multiples à une IA, elle pourrait « tricher » en devinant la bonne lettre sans comprendre la logique.
- Si vous lui posez une question Vrai/Faux, les mots spécifiques que vous utilisez peuvent la tromper et réduire sa précision.
- Pour savoir vraiment si une IA est intelligente, vous devez vérifier ses « brouillons » (ses étapes de raisonnement), et pas seulement la dernière case qu'elle a cochée.
Les chercheurs ont créé un nouvel ensemble de tests (une référence) pour aider les futurs développeurs à comprendre ces particularités, afin de s'assurer que lorsque nous testons l'IA, nous ne testons pas seulement sa capacité à deviner, mais sa capacité à réfléchir.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.