← Derniers articles
💬 NLP

Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions

Ce papier démontre que les modèles vision-langage (VLM) effectuant une reconnaissance optique de caractères sur des textes grecs anciens s'appuient souvent sur des priors linguistiques pour générer des erreurs fluides mais non ancrées visuellement, un mode de défaillance qui persiste même avec des interventions au moment du décodage et qui diffère considérablement des motifs de bruit des systèmes OCR traditionnels.

Auteurs originaux : Antonia Karamolegkou, Nicolas Angleraud, Benoît Sagot, Thibault Clérice

Publié 2026-05-28
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Antonia Karamolegkou, Nicolas Angleraud, Benoît Sagot, Thibault Clérice

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de lire une très vieille lettre manuscrite écrite en grec ancien. L'encre est fanée, les lettres sont étranges et la page est couverte de notes brouillonnes dans les marges. Vous avez deux assistants pour vous aider à la lire :

  1. Le « Scanner Ancien » (OCR traditionnel) : C'est comme un robot strict et littéral. Il observe l'encre sur la page et dit : « Je vois un gribouillis qui ressemble à un « A », donc j'écrirai un « A ». » Si l'encre est trop floue, il peut écrire un symbole aléatoire ou une faute de frappe. Il ne devine pas ; il se contente de rapporter ce qu'il voit, même si le résultat semble brouillon.
  2. L'« Assistant IA Intelligent » (Modèle vision-langage) : C'est comme un étudiant brillant qui connaît parfaitement le grec ancien, mais qui est un peu paresseux pour regarder attentivement le papier. Lorsqu'il voit une tache floue, il pense : « Hmm, en se basant sur la phrase jusqu'ici, le mot suivant devrait être « roi ». » Alors, il écrit « roi », même si l'encre sur la page ressemblait en réalité plus à « chien ».

Cet article, intitulé « Lire ou Deviner ? Échecs de l'ancrage visuel des modèles vision-langage pour l'OCR dans les éditions de grec ancien », examine ce qui se produit lorsque ces deux assistants tentent de lire des textes difficiles en grec ancien, à faible disponibilité de ressources.

Voici ce que les chercheurs ont découvert, en utilisant des analogies simples :

1. Le « Mensonge Fluide » contre la « Vérité Brouillonne »

Lorsque le Scanner Ancien fait une erreur, cela ressemble généralement à une faute de frappe ou à un assemblage de lettres (par exemple, « kng »). Il est évident que quelque chose a mal tourné.

Cependant, lorsque l'Assistant IA Intelligent fait une erreur, il écrit souvent un mot grec ancien parfaitement réel et fluide qui n'est simplement pas ce qui était écrit sur la page.

  • L'Analogie : Imaginez que l'IA lit une recette. Si la liste des ingrédients est tachée et indique « farine », mais que l'IA sait que cette recette demande habituellement du « sucre », elle pourrait écrire avec assurance « sucre ». À un coup d'œil rapide, la phrase semble parfaite. Mais c'est en réalité un mensonge. L'IA s'appuie sur sa mémoire de la façon dont les recettes se déroulent habituellement (son « antérieur linguistique ») plutôt que de regarder le papier spécifique qui se trouve devant elle.

2. Le Test de l'« Encre Magique »

Pour le prouver, les chercheurs ont joué un tour. Ils ont pris le texte, mélangé les lettres à l'intérieur des mots (transformant de vrais mots en charabia sans sens), puis ont montré ce charabia aux assistants.

  • Le Scanner Ancien : Il a regardé le charabia et a recopié le charabia. Il est resté fidèle à la preuve visuelle, même si le résultat était de la poubelle.
  • L'Assistant IA Intelligent : Il a regardé le charabia, s'est confus, puis l'a « corrigé ». Il a réécrit le charabia en de vrais mots grecs fluides. Il a ignoré la preuve visuelle (les lettres mélangées) et s'est entièrement appuyé sur sa connaissance interne de la langue.

3. Tous les IA « Intelligents » ne se ressemblent pas

Les chercheurs ont découvert une surprise. Tous les assistants IA ne se comportent pas de la même manière.

  • L'IA Généraliste : Ce sont les grands modèles célèbres utilisés pour de nombreuses tâches. Même lorsqu'ils se trompaient, ils regardaient encore « l'image ». Ils essayaient de lire l'encre, mais leur cerveau était simplement trop impatient de deviner le bon mot.
  • L'IA Spécialisée : Il y avait un modèle construit spécifiquement pour lire des documents (appelé OlmOCR). Celui-ci était le pire contrevenant. Lorsqu'il faisait une erreur, c'était presque comme s'il ne regardait pas du tout l'image. Il devinait purement en se basant sur ce qu'il pensait que le texte devait dire. C'était comme un étudiant qui ferme les yeux et récite le manuel de mémoire, en ignorant la véritable copie d'examen.

4. Peut-on réparer l'IA ?

Les chercheurs ont essayé plusieurs « correctifs » pour forcer l'IA à regarder l'image au lieu de deviner :

  • La « Clôture de Vocabulaire » : Ils ont essayé de dire à l'IA : « Vous ne pouvez écrire que des lettres grecques. » Résultat : Cela a beaucoup empiré les choses. L'IA s'est confondue et a commencé à écrire du charabia parce qu'elle ne pouvait pas utiliser ses astuces habituelles.
  • Le « Test de Contraste » : Ils ont essayé de montrer à l'IA l'image et une version floue de l'image en même temps pour la forcer à se concentrer sur les détails. Résultat : Cela a aidé un peu pour certains modèles, mais pas pour le spécialiste.
  • La « Correction Post-jeu » : Ils ont laissé l'IA écrire sa réponse d'abord, puis ont fait corriger les erreurs par une seconde IA (un éditeur uniquement textuel). Résultat : Cela a bien fonctionné pour nettoyer le texte, mais cela n'a pas résolu le problème de fond. La première IA ignorait toujours l'image ; la seconde IA se contentait de corriger le mensonge après qu'il ait été raconté.

La Grande Leçon

La leçon principale est que le fait qu'une réponse d'IA sonne parfaite et fluide ne signifie pas qu'elle a réellement lu le document.

Dans le monde de l'histoire ancienne et des documents rares, c'est dangereux. Si une bibliothèque numérique utilise ces modèles d'IA pour numériser d'anciens livres grecs, l'IA pourrait silencieusement remplacer un mot rare et obscur par un mot commun et « plausible ». Un historien lisant la version numérique ne saurait jamais que le changement s'est produit, car la phrase semble toujours grammaticalement parfaite.

L'article conclut que nous avons besoin de nouvelles façons de tester l'IA, non pas seulement en vérifiant si le score final est élevé, mais en vérifiant si l'IA est réellement « ancrée » dans la preuve visuelle, ou si elle devine simplement en se basant sur ce qu'elle pense devrait être là.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →