The Effect of Scripts and Formats on LLM Numeracy
Cet article révèle que les grands modèles de langage subissent des baisses de précision significatives lors du traitement d'expressions numériques dans des scripts ou des formats sous-représentés, mais démontre que des stratégies de prompting ciblées peuvent atténuer efficacement cette disparité.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un étudiant brillant qui a lu presque tous les livres du monde. Cet étudiant est un maître en mathématiques, capable de résoudre instantanément des problèmes complexes d'addition et de multiplication. Mais il y a un piège : cet étudiant n'a jamais vu de nombres écrits de la manière standard que nous utilisons en anglais (comme 1, 2, 3).
Ce document traite de ce qui arrive lorsque vous demandez à cet étudiant surdoué de faire des mathématiques en utilisant des chiffres écrits dans des « langues » ou des « styles » différents qu'il n'a pas beaucoup vus auparavant.
La découverte principale : La « Taxe de Script »
Les chercheurs ont découvert que lorsque l'on remplace les nombres standards par d'autres écritures — comme १, २, ३ (Devanagari) ou ۱, ۲, ۳ (Perso-arabe) — les compétences mathématiques de l'étudiant chutent de manière spectaculaire.
Voyez cela comme ceci : si vous demandez à un chef de cuisiner un steak parfait, il peut le faire facilement. Mais si vous lui donnez une recette écrite dans une langue qu'il ne lit pas, ou si vous lui dites de hacher les oignons avec une cuillère au lieu d'un couteau, il pourrait faire tomber les ingrédients ou brûler le steak. Le chef sait toujours comment cuisiner, mais le format des instructions l'a confus.
Le document appelle cela la « Taxe de Script ». C'est une pénalité que l'IA paie simplement pour avoir vu des nombres sous une forme différente. Même si le problème mathématique est exactement le même (par exemple, « 5 + 5 »), l'IA se trompe 66 % à 87 % plus souvent si les nombres ne sont pas dans le style standard anglais.
Pourquoi cela arrive-t-il ?
Le document pointe deux principaux coupables :
- Le « Régime d'entraînement » : L'IA a été entraînée avec un régime massif de textes provenant d'Internet. La majeure partie de ce texte utilise des nombres standards anglais. C'est comme si l'étudiant n'avait mangé que des pommes ; quand on lui donne soudainement une poire, il ne sait pas comment la mâcher correctement.
- Le problème des « Tokens » : L'IA ne lit pas les mots comme les humains ; elle les divise en petits morceaux appelés « tokens ».
- Les nombres standards (comme 123) peuvent être un ou deux morceaux.
- Certaines autres écritures divisent le même nombre en de nombreux petits morceaux déroutants.
- Le document a constaté que plus un nombre est divisé en « morceaux », plus il est difficile pour l'IA de faire les mathématiques. C'est comme essayer de résoudre un puzzle où quelqu'un aurait découpé l'image en 100 minuscules pièces au lieu de 10 grandes.
La bonne nouvelle : Nous pouvons le réparer avec des « Indices »
Les chercheurs n'ont pas seulement trouvé un problème ; ils ont trouvé un moyen d'aider l'étudiant. Ils ont testé différentes façons de poser la question (appelées « prompting ») :
- Demander simplement poliment : « Veuillez résoudre ceci. » -> A toujours échoué.
- Indiquer la langue : « Ceci est écrit en thaï. » -> A toujours échoué.
- Donner une fiche de triche (Mapping) : Montrer à l'IA une liste du type « ce symbole signifie 1, celui-ci signifie 2. » -> Mieux, mais pas parfait.
- Le tour de magie (Few-Shot Prompting) : C'était le grand gagnant. Les chercheurs ont d'abord donné à l'IA quelques exemples.
- Exemple 1 : « Voici un problème en thaï : 1 + 1 = 2. Voici la réponse. »
- Exemple 2 : « En voici un autre... »
- Maintenant : « Résolvez celui-ci. »
En montrant à l'IA quelques exemples de la gestion de ces styles de nombres étranges, ses performances ont grimpé en flèche. C'est comme montrer à l'étudiant quelques exercices d'entraînement dans la nouvelle langue avant le véritable examen. Soudain, il pouvait faire les mathématiques parfaitement.
Le tournant du formatage
Le document a également examiné la façon dont les nombres sont groupés. Aux États-Unis, nous écrivons les grands nombres comme 1,000,000 (virgules tous les trois chiffres). En Europe, ils pourraient écrire 1.000.000 (points) ou 1 000 000 (espaces).
L'IA a été confuse par ces styles aussi. Elle gérait parfaitement le style américain, mais éprouvait des difficultés avec les styles européens. Curieusement, l'IA confondait souvent ces formats de nombres avec des choses comme des adresses IP (par exemple, 192.168.1.1), qui sont courantes dans ses données d'entraînement mais ne sont pas des problèmes mathématiques.
L'essentiel
Le document conclut que ces modèles d'IA ne sont pas « mauvais en mathématiques ». Ils sont en réalité assez bons en logique. Le problème est qu'ils sont fragiles. Ils dépendent fortement du fait de voir les nombres de la manière spécifique et familière avec laquelle ils ont été enseignés.
Si vous voulez qu'une IA fasse des mathématiques pour vous dans une langue différente ou avec des styles de nombres différents, vous ne pouvez pas simplement lui demander directement. Vous devez lui donner un petit coup de pouce : montrez-lui d'abord quelques exemples, ou expliquez-lui exactement comment les symboles fonctionnent. Une fois que vous faites cela, la « Taxe de Script » disparaît, et les mathématiques redeviennent faciles.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.