MonkeyOCRv2: A Visual-Text Foundation Model for Document AI
MonkeyOCRv2 est un modèle de fondation visuel-texte préentraîné sur un corpus massif de 113 millions d'images de documents en utilisant une stratégie duale de génération d'image à texte et de reconstruction au niveau du pixel, ce qui surpasse de manière significative les encodeurs existants dans les tâches d'analyse de documents et permet une analyse et une compréhension de documents hautement efficaces et de pointe lorsqu'il est intégré dans des modèles de langage multimodaux de grande taille.
Article original placé dans le domaine public sous CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé Technique : MonkeyOCRv2
Problématique
Les modèles de fondation visuelle dominants (ex. : CLIP, DINO, SAM) sont principalement pré-entraînés sur des images naturelles, se concentrant sur la sémantique d'objets de haut niveau, l'alignement global et le contexte de scène. Ces modèles présentent un décalage de représentation lorsqu'ils sont appliqués aux images de documents. Les images de documents se caractérisent par du texte dense, des traits de caractères fins, des mises en page complexes et une sémantique qui repose fortement sur des détails visuels locaux (ex. : ponctuation, exposants, variations de traits). Les modèles existants écartent souvent ces détails fins au profit de l'abstraction sémantique, ce qui les rend inadaptés à l'analyse, la compréhension et les tâches connexes liées aux documents. De plus, les jeux de données de pré-entraînement orientés documents sont limités en échelle, en diversité linguistique et en granularité d'annotation, ne couvrant souvent que le chinois et l'anglais ou manquant de supervision dense.
Méthodologie
1. Moteur de Données : MonkeyDoc v2
Pour remédier à la rareté des données et au fossé de distribution, les auteurs ont construit MonkeyDoc v2, le plus grand corpus connu de pré-entraînement visuel-textuel orienté document.
- Échelle : 113 millions d'images.
- Diversité : Couvre 17 langues (incluant le chinois simplifié/traditionnel, l'anglais, l'arabe, l'allemand, etc.) et divers types de documents (articles scientifiques, factures, notes manuscrites, textes anciens, formules, tableaux).
- Composition : 61M d'échantillons réels et 52M d'échantillons synthétiques.
- Pipeline d'annotation : Utilise un pipeline d'accord multi-experts où plusieurs modèles OCR complémentaires transcrivent les éléments découpés ; la prédiction présentant l'accord par paire le plus élevé est conservée pour supprimer les erreurs spécifiques aux modèles. Les échantillons de faible qualité sont filtrés via une vérification de la mise en page et des contrôles de cohérence logique par des modèles de langage de grande taille (LLM).
2. Stratégie de Pré-entraînement : Génération et Reconstruction Conjointes
MonkeyOCRv2 emploie une stratégie de pré-entraînement à double objectif pour apprendre des représentations visuelles natives aux documents :
- Génération Image-vers-Texte : Aligne les représentations visuelles avec le contenu textuel en utilisant une perte d'entropie croisée autorégressive standard (). Cela fournit une supervision dense pour la compréhension sémantique.
- Reconstruction de Documents au Niveau du Pixel : Encourage l'encodeur à préserver les détails visuels fins (traits de caractères, formes de glyphes, structures de mise en page) qui pourraient être écartés sous une supervision purement textuelle. Ceci est réalisé via une perte d'erreur quadratique moyenne (MSE) () et, optionnellement, une perte sensible à la structure () faisant correspondre les cartes de contours et de distance aux contours.
- Objectif Combiné : . L'objectif de reconstruction agit comme un régularisateur, garantissant que l'encodeur conserve les preuves visuelles même lorsque le contexte linguistique est faible ou absent.
3. Architecture
La famille de modèles comprend trois variantes d'encodeurs visuels entraînés de zéro sur MonkeyDoc v2 :
- MonkeyOCRv2-S : ViT-Small (28M de paramètres).
- MonkeyOCRv2-B : ViT-Base (113M de paramètres).
- MonkeyOCRv2-AS : ViTAEv2-Small (21M de paramètres), optimisé pour les tâches bénéficiant d'un biais inductif multi-échelle (ex. : détection, segmentation).
Contributions Clés
- MonkeyOCRv2 : Un modèle de fondation visuel-textuel spécifiquement pré-entraîné pour l'IA documentaire, traitant le décalage de représentation entre les encodeurs d'images naturelles et les images de documents grâce à la génération de texte conjointe et à la reconstruction au niveau du pixel.
- MonkeyDoc v2 : Un corpus de pré-entraînement massif, multilingue (17 langues), multi-types (113M d'images) qui dépasse considérablement l'échelle et la diversité des jeux de données documentaires existants.
- Pré-entraînement à Double Objectif : Démontre que le couplage de la génération image-vers-texte avec la reconstruction au niveau du pixel améliore la robustesse, particulièrement lorsque le contexte linguistique est supprimé ou dégradé.
Résultats Expérimentaux
Performance sur les Tâches Aval
Le remplacement des encodeurs originaux par MonkeyOCRv2 a produit des améliorations constantes à travers cinq tâches représentatives d'analyse de documents :
- Reconnaissance de Texte : Amélioration de la précision CRNN de 58,7 % à 67,3 % sur des benchmarks exigeants. PARSeq avec MonkeyOCRv2 a atteint des performances de pointe (SOTA) sur Union14M et les benchmarks chinois.
- Reconnaissance de Formules : Un modèle de 110M de paramètres (UniMERNet-T + MonkeyOCRv2) a surpassé l'UniMERNet-B de 325M, démontant qu'un encodeur plus fort orienté document peut compenser une capacité de modèle réduite.
- Détection de Texte : Gains constants de la mesure F sur ICDAR2015, ArT, Total-Text et CTW1500, surpassant à la fois les encodeurs pré-entraînés sur ImageNet et oCLIP (un encodeur spécifique au texte).
- Détection de Tamponnage de Documents : A atteint des scores F1 SOTA sur DocTamper-Test, DocTamper-FCD et DocTamper-SCD, montant une forte généralisation à travers les changements de domaine.
- Segmentation de Texte Superposé : Amélioration de l'mIoU de 4,3 % à 6,3 % sur le jeu de données MOT.
Analyse et Compréhension de Documents
- Analyse de Documents (MDPBench) : MonkeyOCRv2-B-Parsing (0,7B de paramètres totaux, 0,1B d'encodeur visuel) a atteint 83,3 % sur MDPBench, surpassant le précédent SOTA open-source (dots.mocr, 3B de paramètres) de 2,8 % absolus, malgré l'utilisation d'un encodeur visuel environ 11 fois plus petit. Il a également surpassé de grands VLM à usage général comme Qwen3-VL-235B et GPT-5.2 sur OmniDocBench.
- Compréhension de Documents : Dans un cadre contrôlé (encodeurs gelés couplés au même LLM Qwen3-1.7B), MonkeyOCRv2-B a obtenu un score moyen de 57,2 sur huit benchmarks, surpassant significativement CLIP, DINO, SAM et d'autres encodeurs orientés documents.
Analyse de Robustesse
- Dépendance au Contexte Linguistique : Une étude contrôlée utilisant du texte brouillé a montré que MonkeyOCRv2 est plus robuste à la dégradation de la résolution et à la suppression du contexte linguistique. L'objectif de reconstruction de pixels a réduit l'écart de précision entre les textes sémantiquement cohérents et les textes brouillés, indiquant une dépendance plus forte aux preuves visuelles plutôt qu'aux priors linguistiques.
- Hallucination : Sur CHAOS-Bench, MonkeyOCRv2-Parsing a obtenu le rappel moyen par page le plus élevé pour les mots perturbés, démontant une fidélité supérieure aux preuves visuelles par rapport à des modèles comme HunyuanOCR-1.5 et PaddleOCR-VL-1.6.
Signification et Revendications
L'article soutient que le pré-entraînement visuel orienté document peut servir de fondation pour l'intelligence documentaire en soi, plutôt que de s'appuyer sur des encodeurs conçus pour les scènes naturelles.
- Changement de Paradigme : Ce travail remet en question le paradigme consistant à adapter des modèles de vision à usage général aux documents, arguant que les statistiques visuelles uniques des documents (texte dense, traits fins) nécessitent des objectifs de pré-entraînement dédiés.
- Efficacité : Il démontre qu'un encodeur compact et natif des documents (0,1B) peut surpasser de massifs VLM à usage général (centaines de milliards de paramètres) sur des tâches spécifiques aux documents lorsque la représentation visuelle est optimisée pour le domaine.
- Préservation des Preuves Visuelles : L'étude valide que les objectifs de reconstruction de pixels sont critiques pour préserver les détails fins, améliorant la robustesse dans les scénarios où le contexte linguistique est ambigu ou absent.
Les auteurs concluent que MonkeyOCRv2 et MonkeyDoc v2 fournissent des fondations réutilisables pour l'OCR multilingue, la compréhension de documents et des systèmes plus larges d'intelligence documentaire, établissant le texte comme une "modalité visuelle de premier rang".
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.