← Últimos artículos
💬 NLP

Benchmarking Vision-Language Models for French PDF-to-Markdown Conversion

Este informe presenta un benchmark enfocado en documentos franceses complejos para evaluar la conversión de PDF a Markdown mediante Modelos Visuales-Lingüísticos, demostrando que, aunque los modelos propietarios son más robustos en escritura a mano y formularios, varios sistemas de pesos abiertos compiten eficazmente en diseños impresos estándar.

Autores originales: Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

Publicado 2026-02-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una pila enorme de documentos antiguos, facturas manuscritas, periódicos viejos y formularios complejos en francés. Quieres que una Inteligencia Artificial (IA) los lea y los convierta en un texto limpio y ordenado que puedas usar en tu computadora (como un archivo Markdown).

Este informe es como una prueba de estrés (un "examen de conducir" muy difícil) para ver qué tan bien funcionan las diferentes IAs modernas para hacer esta tarea, específicamente con documentos en francés.

Aquí tienes la explicación de los puntos clave, usando analogías sencillas:

1. El Problema: ¿Por qué es tan difícil?

Hasta ahora, la mayoría de las pruebas de IA se hacían con documentos en inglés o chino, y eran demasiado estrictas con cosas que no importan realmente.

  • La analogía: Imagina que un profesor te corrige un ensayo. Si escribes "Hola" en lugar de "hola" (con mayúscula), te quita puntos. Pero si el profesor te quita puntos porque pusiste un punto y coma en lugar de una coma, aunque el significado sea el mismo, eso es injusto.
  • El problema real: Las IAs a veces leen bien el texto pero lo organizan de forma un poco diferente (cambian un salto de línea o el orden de una lista). Las pruebas antiguas decían "¡Fallaste!" por eso, aunque la información estuviera correcta. Este nuevo informe quiere medir si la IA entiende y captura la información, no solo si copia el texto palabra por palabra.

2. La Prueba: "El Campo de Batalla Francés"

Los autores crearon un banco de pruebas especial con documentos franceses difíciles. No usaron documentos fáciles; buscaron los que más confunden a las máquinas.

  • Cómo lo hicieron: Usaron dos IAs diferentes para leer los mismos documentos. Si las dos IAs daban respuestas muy distintas, significaba que ese documento era un "nudo difícil". Esos fueron los que eligieron para la prueba.
  • Los tipos de documentos:
    • Letra manuscrita: Como una carta escrita a mano por un abuelo con mala letra.
    • Formularios: Documentos con casillas para rellenar a mano.
    • Tablas densas: Como una hoja de cálculo gigante que ocupa toda la página.
    • Gráficos: Imágenes con datos que la IA debe describir.

3. El Método de Evaluación: "El Juego de Detectives"

En lugar de comparar todo el documento de golpe (que es como intentar adivinar si un libro está bien escrito mirándolo de lejos), usaron un sistema de "pruebas unitarias" (como pequeños exámenes de sí/no).

  • La analogía: Imagina que le das a la IA un documento y luego le haces preguntas específicas:
    • "¿Está escrito el número de teléfono en la esquina?" (Sí/No).
    • "¿Está la tabla ordenada correctamente?" (Sí/No).
    • "¿Mencionó la IA el gráfico?" (Sí/No).
  • Si la IA pasa la mayoría de estas pequeñas pruebas, gana. Además, el sistema es inteligente: si la IA escribe "café" en lugar de "café" (con tilde), el sistema lo cuenta como correcto, pero si olvida la palabra "café" por completo, cuenta como error.

4. Los Resultados: ¿Quién ganó?

Probaron 15 modelos diferentes (algunos de empresas gigantes como Google y OpenAI, y otros de código abierto).

  • Los "Superhéroes" (Modelos Propietarios): Los modelos más potentes y caros (como Gemini 3 Pro) fueron los mejores. Se comportaron como un bibliotecario experto: podían leer letra manuscrita, entender tablas complejas y no se perdían en documentos largos.
  • Los "Héroes de Barrio" (Modelos Abiertos): Algunos modelos gratuitos o de código abierto (como Chandra) funcionaron muy bien con documentos de imprenta normal (como un periódico limpio), pero se frustraron mucho con la letra manuscrita o los formularios.
  • Los que se perdieron: Algunos modelos pequeños o rápidos fallaron estrepitosamente en la letra manuscrita, como si intentaran leer un mapa borroso con los ojos cerrados.

5. El Dilema: Velocidad vs. Precisión

  • La analogía: Es como elegir entre un Ferrari y un camión de mudanzas.
    • Los modelos pequeños (como MinerU o Docling) son muy rápidos (como un Ferrari), pero a veces se saltan partes del documento o se confunden con la letra mala.
    • Los modelos grandes (como Chandra) son muy precisos (como un camión que carga todo), pero tardan mucho más en procesar cada página.

6. Conclusión: ¿Qué nos dicen?

Este informe nos dice que, si quieres digitalizar documentos franceses complejos (facturas viejas, formularios manuscritos), necesitas usar los modelos más potentes y caros disponibles hoy en día. Los modelos gratuitos son buenos para documentos simples, pero aún no están listos para el trabajo sucio y difícil.

Los autores quieren que esta prueba no sea un "trofeo" que se queda en un estante, sino una herramienta viva donde la comunidad pueda seguir probando nuevas IAs y mejorando la forma en que leemos documentos en el futuro.

En resumen: Es un mapa para saber qué IA usar cuando tienes que leer documentos franceses difíciles sin volverte loco corrigiendo errores tontos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →