← Derniers articles
💬 NLP

Beyond 'One Language, One Script': Quantifying Orthographic Bias in Multilingual VLMs with PuMVR

Cet article introduit PuMVR, le premier benchmark quantifiant le biais orthographique significatif dans les modèles de vision-langage multilingues en démontrant que ces systèmes présentent des écarts de performance substantiels et un raisonnement incohérent à travers les trois écritures actives du pendjabi (Gurmukhi, Shahmukhi et Roman), remettant ainsi en question l'hypothèse selon laquelle une langue équivaut à un système d'écriture unique.

Auteurs originaux : Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina

Publié 2026-06-23
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un robot assistant brillant et multilingue. Vous lui dites : « Je parle le pendjabi », et il répond fièrement : « Super ! Je peux vous aider en pendjabi. » Mais voici le piège : le pendjabi n'est pas écrit d'une seule façon. C'est comme une langue qui porte trois masques différents :

  1. Le Gurmukhi : l'écriture utilisée en Inde (comme une police de caractères structurée et massive).
  2. Le Shahmukhi : l'écriture utilisée au Pakistan (comme un style cursif et fluide).
  3. Le Roman : la langue écrite avec les lettres standards de l'alphabet anglais (comme taper « Hello » au lieu de « नमस्ते »).

L'article soutient que les modèles d'IA actuels nous jouent un tour. Ils supposent que « Une Langue = Un Script ». Ils pensent que si un modèle connaît le pendjabi en Gurmukhi, il connaît automatiquement le pendjabi en Shahmukhi et en Roman. C'est faux.

Les auteurs ont construit un test appelé PuMVR (considérez cela comme un « parcours d'obstacles de changement de script ») pour le prouver. Ils ont pris 375 énigmes — allant de l'identification d'objets culturels comme des tambours à la résolution de devinettes visuelles — et ont présenté exactement la même énigme aux modèles d'IA dans les trois scripts.

Voici ce qu'ils ont découvert, en utilisant des analogies simples :

1. Le « Fossé de Script » (Le point aveugle)

Lorsqu'une IA résout une énigme en Gurmukhi, elle peut réussir 90 % du temps. Mais quand vous lui présentez la même énigme exacte écrite en Shahmukhi, sa performance peut chuter à 60 %.

  • L'analogie : Imaginez un chef qui peut parfaitement cuisiner un plat lorsque la recette est écrite en anglais, mais si vous lui donnez la même recette écrite en français, il oublie soudainement comment faire bouillir de l'eau. Les ingrédients (l'image visuelle) et l'objectif (la réponse) sont les mêmes, mais la manière dont les instructions sont écrites bloque le cerveau du chef.

2. Le « Boost Visuel » ne règle pas le problème

Vous pourriez penser : « Eh bien, l'IA peut voir l'image ! Cela devrait l'aider. »
L'article a testé cela en donnant à l'IA l'image plus le texte.

  • L'analogie : C'est comme donner une carte à une personne (l'image) pendant qu'elle essaie de lire un panneau dans une langue qu'elle ne connaît pas. La carte l'aide un peu, mais elle ne lui apprend pas à lire le panneau. L'IA continue de lutter avec le script Shahmukhi même lorsqu'elle peut voir l'image. Le biais n'a pas été corrigé ; il a juste reçu un minuscule coup de pouce.

3. La « Scission du Raisonnement » (La crise d'identité)

Les chercheurs ont demandé à l'IA de « réfléchir à voix haute » (Chaîne de pensée / Chain-of-Thought) pour voir comment elle résolvait les problèmes.

  • L'analogie : Quand l'IA lisait l'énigme en Gurmukhi, elle pensait : « C'est un symbole culturel sikh, donc je vais chercher des indices religieux. » Mais quand elle lisait la même énigme exacte en Shahmukhi, elle pensait soudainement : « C'est un symbole culturel islamique, donc je vais chercher des indices différents. »
    L'IA ne raisonnait pas sur l'image ; elle réagissait à la forme des lettres. Le script lui-même agissait comme un interrupteur qui changeait toute la personnalité et la stratégie de l'IA.

4. Le « Score de Consistance » (Le vrai test)

L'article introduit un nouveau score appelé SCR (Taux de Consistance de Script).

  • L'analogie : Imaginez un étudiant passant un examen de mathématiques. S'il obtient 90 % à l'examen écrit en Times New Roman, mais seulement 60 % quand l'examen est écrit en Comic Sans, est-il vraiment bon en mathématiques ? Non. Il est simplement bon pour lire le Times New Roman.
    L'article a découvert que pour de nombreux modèles de pointe, leur « score de consistance » est étonnamment bas (parfois aussi bas que 25 %). Cela signifie qu'ils échouent à être véritablement « multilingues » car ils ne peuvent pas gérer la même langue dans différents styles d'écriture.

L'essentiel

L'article conclut que nous nous trompons en disant que l'IA est « multilingue ». Elle est en réalité « multi-scripts » de manière très limitée. Si vous parlez une langue qui utilise plusieurs scripts (comme le pendjabi, le serbe ou le kurde), votre assistant IA pourrait être fiable pour vous dans un script, mais totalement peu fiable dans un autre.

Les auteurs ne disent pas que l'IA est inutile ; ils disent qu'elle est peu fiable pour des milliards de personnes qui passent d'un script à l'autre. Pour que l'IA soit réellement équitable, nous devons arrêter de la tester sur une seule version d'une langue et commencer à la tester sur toutes les façons dont les gens l'écrivent réellement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →