← Últimos artículos
💻 computer science

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

MonkeyOCRv2 es un modelo fundacional de visión y texto preentrenado en un corpus masivo de 113 millones de imágenes de documentos utilizando una estrategia dual de generación de imagen a texto y reconstrucción a nivel de píxel, el cual supera significativamente a los codificadores existentes en tareas de análisis de documentos y permite un procesamiento y comprensión de documentos altamente eficiente y de vanguardia cuando se integra en modelos de lenguaje extensos multimodales.

Autores originales: Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

Publicado 2026-07-14
📖 1 min de lectura☕ Lectura para el café

Autores originales: Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: MonkeyOCRv2

Planteamiento del Problema

Los modelos fundacionales visuales convencionales (p. ej., CLIP, DINO, SAM) están preentrenados principalmente en imágenes naturales, centrándose en la semántica de objetos de alto nivel, la alineación global y el contexto de la escena. Estos modelos exhiben un desajuste de representación cuando se aplican a imágenes de documentos. Las imágenes de documentos se caracterizan por texto denso, trazos de caracteres finos, diseños complejos y una semántica que depende fuertemente de detalles visuales locales (p. ej., puntuación, superíndices, variaciones de trazo). Los modelos existentes suelen descartar estos detalles finos en favor de la abstracción semántica, lo que los hace inadecuados para la segmentación, comprensión y tareas relacionadas con documentos. Además, los conjuntos de datos de preentrenamiento orientados a documentos existentes son limitados en escala, diversidad lingüística y granularidad de anotación, cubriendo a menudo solo chino e inglés o careciendo de supervisión densa.

Metodología

1. Motor de Datos: MonkeyDoc v2

Para abordar la escasez de datos y la brecha de distribución, los autores construyeron MonkeyDoc v2, el corpus de preentrenamiento visual-textual orientado a documentos más grande conocido.

  • Escala: 113 millones de imágenes.
  • Diversidad: Cubre 17 idiomas (incluyendo chino simplificado/tradicional, inglés, árabe, alemán, etc.) y diversos tipos de documentos (artículos científicos, facturas, notas manuscritas, textos antiguos, fórmulas, tablas).
  • Composición: 61M de muestras del mundo real y 52M de muestras sintéticas.
  • Pipeline de Anotación: Utiliza un pipeline de acuerdo de múltiples expertos donde múltiples modelos de OCR complementarios transcriben elementos recortados; se retiene la predicción con el mayor acuerdo por pares para suprimir errores específicos del modelo. Las muestras de baja calidad se filtran mediante verificación de diseño y comprobaciones de consistencia lógica a través de modelos de lenguaje extensos (LLM).

2. Estrategia de Preentrenamiento: Generación y Reconstrucción Conjunta

MonkeyOCRv2 emplea una estrategia de preentrenamiento de doble objetivo para aprender representaciones visuales nativas de documentos:

  • Generación de Imagen a Texto: Alinea las representaciones visuales con el contenido textual utilizando una pérdida de entropía cruzada autorregresiva estándar (LtextL_{text}). Esto proporciona una supervisión densa para la comprensión semántica.
  • Reconstrucción de Documentos a Nivel de Píxel: Incentiva al codificador a preservar detalles visuales finos (trazos de caracteres, formas de glifos, estructuras de diseño) que podrían descartarse bajo una supervisión puramente textual. Esto se logra mediante una pérdida de Error Cuadrático Medio (MSE) (LpixL_{pix}) y, opcionalmente, una pérdida consciente de la estructura (LstructL_{struct}) que coincide con mapas de bordes y de distancia al borde.
  • Objetivo Combinado: Lpretrain=Ltext+λLrecL_{pretrain} = L_{text} + \lambda L_{rec}. El objetivo de reconstrucción actúa como un regularizador, asegurando que el codificador conserve la evidencia visual incluso cuando el contexto lingüístico es débil o inexistente.

3. Arquitectura

La familia de modelos incluye tres variantes de codificadores visuales entrenadas desde cero en MonkeyDoc v2:

  • MonkeyOCRv2-S: ViT-Small (28M de parámetros).
  • MonkeyOCRv2-B: ViT-Base (113M de parámetros).
  • MonkeyOCRv2-AS: ViTAEv2-Small (21M de parámetros), optimizado para tareas que se benefician de un sesgo inductivo multiescala (p. ej., detección, segmentación).

Principales Contribuciones

  1. MonkeyOCRv2: Un modelo fundacional visual-textual entrenado específicamente para la IA de documentos, abordando el desajuste de representación entre los codificadores de imágenes naturales y las imágenes de documentos mediante la generación de texto y la reconstrucción a nivel de píxel de forma conjunta.
  2. MonkeyDoc v2: Un corpus de preentrenamiento masivo, multilingüe (17 idiomas), multi-tipo (113M de imágenes) que supera significativamente la escala y diversidad de los conjuntos de datos de documentos existentes.
  3. Preentrenamiento de Doble Objetivo: Demuestra que acoplar la generación de imagen a texto con la reconstrucción a nivel de píxel mejora la robustez, particularmente cuando el contexto lingüístico se elimina o se degrada.

Resultados Experimentales

Rendimiento en Tareas de Aval (Downstream Tasks)

Reemplazar los codificadores originales por MonkeyOCRv2 produjo mejoras consistentes en cinco tareas representativas de análisis de documentos:

  • Reconocimiento de Texto: Mejoró la precisión de CRNN del 58.7% al 67.3% en benchmarks desafiantes. PARSeq con MonkeyOCRv2 alcanzó un rendimiento de estado del arte (SOTA) en Union14M y benchmarks chinos.
  • Reconocimiento de Fórmulas: Un modelo de 110M de parámetros (UniMERNet-T + MonkeyOCRv2) superó al UniMERNet-B de 325M, demostrando que un codificador más fuerte orientado a documentos puede compensar la reducción de la capacidad del modelo.
  • Detección de Texto: Ganancias consistentes en F-measure a través de ICDAR2015, ArT, Total-Text y CTW1500, superando tanto a los codificadores preentrenados en ImageNet como a oCLIP (un codificador específico de texto).
  • Detección de Manipulación de Documentos: Logró puntuaciones F1 de SOTA en DocTamper-Test, DocTamper-FCD y DocTamper-SCD, mostrando una fuerte generalización a través de cambios de dominio.
  • Segmentación de Texto Superpuesto: Mejoró el mIoU entre un 4.3% y un 6.3% en el conjunto de datos MOT.

Procesamiento y Comprensión de Documentos

  • Procesamiento de Documentos (MDPBench): MonkeyOCRv2-B-Parsing (0.7B de parámetros totales, 0.1B del codificador visual) logró un 83.3% en MDPBench, superando al SOTA de código abierto anterior (dots.mocr, 3B de parámetros) por un 2.8% absoluto, a pesar de utilizar un codificador visual aproximadamente 11 veces más pequeño. También superó a VLMs de propósito general más grandes como Qwen3-VL-235B y GPT-5.2 en OmniDocBench.
  • Comprensión de Documentos: En un entorno controlado (codificadores congelados emparejados con el mismo Qwen3-1.7B LLM), MonkeyOCRv2-B logró una puntuación promedio de 57.2 en ocho benchmarks, superando significativamente a CLIP, DINO, SAM y otros codificadores orientados a documentos.

Análisis de Robustez

  • Dependencia del Contexto Lingüístico: Un estudio controlado utilizando texto desordenado mostró que MonkeyOCRv2 es más robusto a la degradación de la resolución y a la eliminación del contexto lingüístico. El objetivo de reconstrucción de píxeles redujo la brecha de precisión entre el texto semánticamente coherente y el desordenado, indicando una mayor dependencia de la evidencia visual en lugar de los sesgos lingüísticos.
  • Alucinación: En CHAOS-Bench, MonkeyOCRv2-Parsing logró el mayor recall promedio por página para palabras perturbadas, demostando una fidelidad superior a la evidencia visual en comparación con modelos como HunyuanOCR-1.5 y PaddleOCR-VL-1.6.

Significado y Reivindicaciones

El artículo postula que el preentrenamiento visual orientado a documentos puede servir como una base para la inteligencia de documentos por derecho propio, en lugar de depender de codificadores construidos para escenas naturales.

  • Cambio Fundacional: Este trabajo desafía el paradigma de adaptar modelos de visión de propósito general a los documentos, argumentando que las estadísticas visuales únicas de los documentos (texto denso, trazos finos) requieren objetivos de preentrenamiento dedicados.
  • Eficiencia: Demuestra que un codificador compacto y nativo de documentos (0.1B) puede superar a enormes VLMs de propósito general (cientos de miles de millones de parámetros) en tareas específicas de documentos cuando la representación visual está optimizada para el dominio.
  • Preservación de la Evidencia Visual: El estudio valida que los objetivos de reconstrucción a nivel de píxel son críticos para preservar detalles finos, mejorando la robustez en escenarios donde el contexto lingüístico es ambiguo o está ausente.

Los autores concluyen que MonkeyOCRv2 y MonkeyDoc v2 proporcionan bases reutilizables para el OCR multilingüe, la comprensión de documentos y sistemas de inteligencia de documentos más amplios, estableciendo el texto como una "modalidad visual de primera clase".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →