← Derniers articles
💬 NLP

Benchmarking Vision-Language Models for French PDF-to-Markdown Conversion

Ce rapport présente un benchmark français évaluant la conversion PDF-Markdown par des modèles vision-langage sur des documents complexes, en introduisant une méthodologie d'évaluation normalisée pour mesurer la robustesse des modèles propriétaires et open-source face aux erreurs de transcription et de mise en page.

Auteurs originaux : Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

Publié 2026-02-13
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

📖 Le Titre : "Le Grand Concours de Traduction de Documents Français"

Imaginez que vous avez une bibliothèque remplie de vieux documents français : des formulaires administratifs remplis à la main, des journaux avec des colonnes serrées, des tableaux complexes et des dessins scientifiques. Votre but ? Transformer tout cela en un texte propre et lisible (du "Markdown") que votre ordinateur peut comprendre et utiliser pour répondre à vos questions.

C'est là que les Intelligences Artificielles (IA) entrent en jeu. Mais toutes ne sont pas égales devant cette tâche !

🕵️‍♂️ Le Problème : Pourquoi les anciens tests ne fonctionnent pas

Auparavant, pour tester ces IA, on leur donnait des textes simples et on regardait si chaque lettre correspondait exactement. C'est comme si on notait un cuisinier uniquement sur le fait qu'il a mis exactement 5 grammes de sel, même si le plat est délicieux.

Le problème, c'est que pour les documents complexes, l'IA peut avoir raison sur le fond (le sens) mais se tromper sur la forme (un saut de ligne ici, une virgule là). Les vieux tests laissaient tomber l'IA pour ces détails sans importance, comme si on disqualifiait un chef parce qu'il a utilisé une cuillère en bois au lieu d'une cuillère en métal.

De plus, la plupart des tests existants étaient en anglais ou en chinois. Personne n'avait vraiment testé ces IA sur des documents français difficiles (comme des vieux formulaires à la main ou des pages avec des tableaux géants).

🎯 La Solution : Le "Concours des Difficultés"

Les auteurs de ce rapport (de l'entreprise Probayes et La Poste) ont décidé de créer leur propre concours, spécialement pour le français.

  1. La Sélection des "Niveaux Difficiles" : Au lieu de prendre des documents au hasard, ils ont demandé à deux IA différentes de traduire 60 000 documents. Là où les deux IA se sont mises d'accord, c'était trop facile. Là où elles se sont disputées (c'est-à-dire qu'elles ont donné des résultats très différents), c'est qu'il y avait un vrai défi ! Ils ont gardé ces pages "embrouillées" pour le test.
  2. Les Catégories de Défi : Ils ont divisé le concours en plusieurs épreuves :
    • Le Texte Minuscule : Des pages avec des caractères tout petits.
    • Les Colonnes : Des journaux où il faut savoir lire de gauche à droite sans se perdre.
    • Les Tableaux Denses : Des grilles de données immenses.
    • L'Écriture à la Main : Des formulaires remplis par des humains (très dur pour une machine !).
    • Les Dessins : Des graphiques qu'il faut décrire.

🧪 La Méthode : Le "Test de Vérité" (Unit Tests)

Au lieu de noter l'IA sur une "note globale" floue, ils ont utilisé une méthode plus intelligente, comme un test de contrôle qualité dans une usine.

Au lieu de dire "C'est bien", ils posent des questions précises :

  • "Est-ce que le mot 'Total' apparaît bien dans le tableau ?"
  • "Est-ce que la liste à puces est bien rangée ?"
  • "Est-ce que le nom du formulaire est bien écrit ?"

Ils ont aussi créé un système de correction automatique (normalisation) : si l'IA écrit "10 €" au lieu de "10€" (avec ou sans espace), le test ne la pénalise pas. On veut voir si elle a compris le sens, pas si elle a copié la ponctuation à la lettre.

🏆 Les Résultats : Qui gagne ?

Ils ont fait concourir 15 modèles d'IA (certains payants et très puissants, d'autres gratuits et ouverts).

  • Les Champions (Les modèles propriétaires) : Les IA de Google (Gemini 3) ont dominé le podium. Elles sont comme des chefs étoilés : elles gèrent très bien l'écriture à la main, les vieux documents et les tableaux complexes. Elles sont chères, mais elles ne font pas d'erreurs graves.
  • Les Challengers (Les modèles gratuits) : Certains modèles gratuits (comme Chandra ou OlmOCR) sont très bons pour les documents imprimés standards. C'est comme des cuisiniers de quartier très compétents pour les plats classiques.
  • Les Faiblesses :
    • L'écriture à la main reste le cauchemar pour presque tout le monde. Beaucoup de modèles gratuits ont complètement échoué sur les formulaires manuscrits.
    • Certains modèles gratuits ont tendance à "oublier" des parties du document (comme ignorer un dessin qui contient du texte important) ou à répéter des phrases en boucle.

💡 La Leçon à retenir

Ce rapport nous dit deux choses importantes :

  1. Si vous avez besoin de traiter des documents français complexes (surtout à la main), il faut probablement investir dans les IA les plus puissantes (payantes).
  2. Pour les documents simples, les IA gratuites fonctionnent très bien, mais il faut faire attention à ne pas utiliser les mauvais tests pour les juger.

L'objectif final de ces chercheurs n'est pas juste de faire un classement, mais de créer un outil vivant pour aider tout le monde à mieux transformer nos documents papiers en données numériques, afin que nos assistants IA puissent mieux nous aider à les comprendre.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →