← Últimos artículos
🤖 AI

Towards Hierarchical Structure Understanding of Newspaper Images

Este artículo aborda el desafío de comprender los complejos diseños de periódicos proponiendo dos enfoques complementarios —un flujo modular ascendente y una novedosa arquitectura de transformador de extremo a extremo llamada Tiramisu— al tiempo que introduce un nuevo conjunto de datos, Finlam La Liberté, para evaluar la recuperación de información jerárquica en periódicos históricos.

Autores originales: William Mocaër, Solène Tarride, Thomas Constum, Merveilles Agbeti-Messan, Tom Simon, Clément Chatelain, Stéphane Nicolas, Pierrick Tranouez, Sébastien Cretin, Thierry Paquet

Publicado 2026-07-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: William Mocaër, Solène Tarride, Thomas Constum, Merveilles Agbeti-Messan, Tom Simon, Clément Chatelain, Stéphane Nicolas, Pierrick Tranouez, Sébastien Cretin, Thierry Paquet

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina intentar leer un cartel gigante y caótico que ha sido arrugado, manchado con café y luego vuelto a aplanar. Ahora, imagina que ese cartel es la página de un periódico antiguo, repleta de titulares diminutos, historias largas, anuncios extraños y fotos, todo amontonado sin líneas claras que te indiquen dónde termina una historia y comienza la siguiente. Esta es la realidad diaria para las computadoras que intentan "leer" la historia. Durante décadas, los científicos han enseñado a las máquinas a reconocer palabras (un proceso llamado OCR) y a comprender cómo se organiza una página. Pero los periódicos antiguos son un tipo especial de pesadilla: son densos, desordenados y están organizados en una jerarquía compleja donde una sección grande contiene artículos más pequeños, que a su vez están hechos de párrafos, que están hechos de palabras. Si una computadora se equivoca en el orden, podría leer el final de una historia antes que el principio, o mezclar dos noticias diferentes en un párrafo gigante y sin sentido. Darle sentido a esto no es solo cuestión de transcribir palabras; se trata de comprender la estructura de la página, como un bibliotecario que sabe exactamente qué libro va en qué estante, incluso cuando los libros están apilados en un montón.

Este artículo aborda precisamente ese desorden probando dos formas muy diferentes de enseñar a una computadora a desenredar una página de un periódico. Los investigadores, trabajando con la Biblioteca Nacional de Francia, querían ver si podían construir un sistema que pudiera determinar automáticamente el diseño, el orden de lectura y el contenido de estos documentos históricos. No se limitaron a adivinar; construyeron dos "robots" distintos para realizar la tarea y los enfrentaron entre sí.

El primer robot es un Pipeline de Abajo hacia Arriba (Bottom-Up). Piensa en esto como un equipo de detectives especializados trabajando en línea. Primero, un detective (un modelo llamado YOLO) escanea la página y señala cada objeto: "Eso es una imagen", "Eso es un título", "Eso es un párrafo". Luego, un segundo detective (LayoutReader) observa todos esos objetos dispersos y determina el orden en el que debes leerlos, como conectando los puntos. Finalmente, un tercer detective utiliza un libro de reglas personalizado para agrupar esos puntos en historias y secciones completas. Es un enfoque modular donde cada paso depende del anterior para pasar la estafeta.

El segundo robot es un Transformador de Arriba hacia Abajo (Top-Down) llamado Tiramisu. En lugar de un equipo de especialistas, Tiramisu es un cerebro único y superinteligente que observa la página completa de una sola vez e intenta comprender la jerarquía de arriba hacia abajo. Es como un maestro chef que no solo pica las verduras una por una, sino que ve toda la comida y comprende cómo encajan el aperitivo, el plato principal y el postre antes de siquiera tocar el cuchillo. Tiramisu trabaja en "pasadas": primero, identifica las grandes secciones; luego, hace zoom para encontrar los artículos dentro de esas secciones; después, encuentra los bloques dentro de los artículos; y finalmente, lee el texto. Hace todo esto de un solo golpe, aprendiendo la estructura sobre la marcha.

Para probar estos dos enfoques, el equipo creó un conjunto de datos completamente nuevo llamado Finlam La Liberté, que contiene 1.500 números completos de un periódico francés de la década de 1920. También construyeron un generador de periódicos "sintéticos" para crear páginas de periódicos falsas y perfectas que ayudaran a entrenar a la IA, ya que las páginas reales históricas suelen ser demasiado desordenadas o estar dañadas para enseñarle todo a una computadora.

Los resultados fueron un cuento de dos fuerzas muy diferentes. El Pipeline de Abajo hacia Arriba resultó ser el velocista y el experto en precisión. Fue increíblemente rápido (tomando menos de un segundo en una computadora potente) y fue el mejor para encontrar y etiquetar las piezas diminutas del rompecabezas, como párrafos individuales e imágenes. Logró el orden de lectura de los bloques pequeños el 87.20% de las veces. Sin embargo, es un poco como una máquina de Rube Goldberg; si el primer detective pasa por alto un punto, toda la cadena puede confundirse.

Tiramisu, el cerebro integral, fue más lento (tomando alrededor de 1.5 segundos) y a veces no detectaba los bloques pequeños por completo. Si pasaba por alto una sección en la primera pasada, se perdía todo lo que había dentro de esa sección. Sin embargo, cuando encontraba las cosas, era excelente comprendiendo el panorama general. Fue sorprendentemente bueno contando cuántos artículos y secciones había en una página, logrando acertar el "conteo" el 89% de las veces, lo cual es mejor que el pipeline. También hizo un trabajo fantástico ordenando las historias principales, logrando que la secuencia de artículos fuera correcta el 97.43% de las veces.

El artículo concluye que aún no existe una solución "perfecta". Si necesitas procesar millones de páginas rápidamente y necesitas saber exactamente dónde está cada pequeño párrafo, el Pipeline de Abajo hacia Arriba modular es el ganador. Pero si necesitas un sistema que pueda comprender la estructura general de un documento en un modelo único y unificado, y estás dispuesto a sacrificar un poco de velocidad y precisión de detección por esa elegancia, Tiramisu es una nueva dirección prometedora. Los investigadores están tan seguros de la velocidad y precisión del pipeline que planean usarlo para digitalizar más de 8 millones de documentos para la Biblioteca Nacional de Francia para finales de 2026, demostando que, a veces, un equipo de especialistas es la mejor manera de resolver un rompecabezas histórico y desordenado.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →