Towards Hierarchical Structure Understanding of Newspaper Images
Cet article aborde le défi de la compréhension des mises en page complexes de journaux en proposant deux approches complémentaires — un pipeline modulaire ascendant et une nouvelle architecture transformer de bout en bout appelée Tiramisu — tout en introduisant un nouveau jeu de données, Finlam La Liberté, pour évaluer la récupération d'informations hiérarchiques dans les journaux historiques.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez essayer de lire un immense panneau publicitaire chaotique qui aurait été froissé, taché de café, puis aplati à nouveau. Maintenant, imaginez que ce panneau est en réalité une page d'un vieux journal, truffée de petits titres, de longs articles, d'annonces bizarres et d'images, le tout entremêlé sans aucune ligne claire pour indiquer où une histoire s'arrête et où la suivante commence. C'est la réalité quotidienne des ordinateurs qui tentent de « lire » l'histoire. Pendant des décennies, les scientifiques ont appris aux machines à reconnaître les mots (un processus appelé OCR) et à comprendre comment une page est mise en page. Mais les vieux journaux sont un genre de cauchemar particulier : ils sont denses, désordonnés et organisés selon une hiérarchie complexe où une grande section contient des articles plus petits, qui sont eux-mêmes composés de paragraphes, qui sont composés de mots. Si l'ordinateur se trompe dans l'ordre, il pourrait lire la fin d'une histoire avant le début, ou mélanger deux articles différents en un seul paragraphe gigantesque et dénué de sens. Donner du sens à tout cela ne consiste pas seulement à taper des mots ; il s'agit de comprendre la structure de la page, comme un bibliothécaire qui sait exactement quel livre appartient à quelle étagère, même quand les livres sont empilés en désordre.
Cet article s'attaque précisément à ce désordre en testant deux manières très différentes d'apprendre à un ordinateur comment démêler une page de journal. Les chercheurs, travaillant avec la Bibliothèque nationale de France, voulaient voir s'ils pouvaient construire un système capable de déterminer automatiquement la mise en page, l'ordre de lecture et le contenu de ces documents historiques. Ils ne se sont pas contentés de deviner ; ils ont construit deux « robots » distincts pour accomplir la tâche et les ont opposés.
Le premier robot est un Pipeline Ascendant (Bottom-Up). Voyez cela comme une équipe de détectives spécialisés travaillant en file indienne. D'abord, un détective (un modèle appelé YOLO) scanne la page et signale chaque objet : « Ça, c'est une image », « Ça, c'est un titre », « Ça, c'est un paragraphe ». Ensuite, un deuxième détective (LayoutReader) examine tous ces objets éparpillés et détermine l'ordre dans lequel vous devez les lire, comme en reliant les points. Enfin, un troisième détective utilise un carnet de règles personnalisé pour regrouper ces points en histoires et sections complètes. C'est une approche modulaire où chaque étape dépend de la précédente pour lui passer le relais.
Le second robot est un Transformer Descendant (Top-Down) nommé Tiramisu. Au lieu d'une équipe de spécialistes, Tiramisu est un cerveau unique et super intelligent qui regarde la page entière d'un seul coup et tente d'en comprendre la hiérarchie de haut en bas. C'est comme un chef cuisinier expert qui ne se contente pas de couper les légumes un par un, mais qui voit l'ensemble du repas et comprend comment l'entrée, le plat principal et le dessert s'articulent avant même de toucher au couteau. Tiramisu travaille par « passes » : d'abord, il identifie les grandes sections ; ensuite, il zoome pour trouver les articles à l'intérieur de ces sections ; puis, il trouve les blocs à l'intérieur des articles ; et enfin, il lit le texte. Il fait tout cela en une seule opération, apprenant la structure au fur et à mesure.
Pour tester ces deux approches, l'équipe a créé un tout nouveau jeu de données appelé Finlam La Liberté, qui contient 1 500 numéros complets d'un journal français des années 1920. Ils ont également construit un générateur de journaux « synthétiques » pour créer de fausses pages de journaux parfaites afin d'aider à entraîner l'IA, puisque les vraies pages historiques sont souvent trop sales ou endommagées pour apprendre tout à un ordinateur.
Les résultats ont révélé des forces très différentes. Le Pipeline Ascendant s'est avéré être le champion de la vitesse et de la précision. Il était incroyablement rapide (prenant moins d'une seconde sur un ordinateur puissant) et était le meilleur pour trouver et étiqueter les minuscules pièces du puzzle, comme les paragraphes individuels et les images. Il a réussi l'ordre de lecture des petits blocs 87,20 % du temps. Cependant, c'est un peu une machine de Rube Goldberg ; si le premier détective manque un endroit, toute la chaîne peut être déroutée.
Tiramisu, le cerveau tout-en-un, était plus lent (prenant environ 1,5 seconde) et manquait parfois de détecter de petits blocs. S'il manquait une section lors de la première passe, il manquait tout ce qui se trouvait à l'intérieur de cette section. Cependant, lorsqu'il trouvait les choses, il excellait dans la compréhension de la vue d'ensemble. Il était étonnamment doué pour compter le nombre d'articles et de sections sur une page, réussissant le « compte » 89 % du temps, ce qui est supérieur au pipeline. Il a également fait un travail fantastique pour ordonner les sujets principaux, obtenant 97,43 % de réussite dans la séquence des articles.
L'article conclut qu'il n'existe pas encore de solution « parfaite ». Si vous avez besoin de traiter des millions de pages rapidement et que vous devez savoir exactement où se trouve chaque petit paragraphe, le Pipeline Ascendant modulaire est le vainqueur. Mais si vous avez besoin d'un système capable de comprendre la structure globale d'un document via un modèle unique et unifié, et que vous êtes prêt à sacrifier un peu de vitesse et de précision de détection pour cette élégance, Tiramisu est une nouvelle direction prometteuse. Les chercheurs sont si convaincus par la vitesse et la précision du pipeline qu'ils prévoient de l'utiliser pour numériser plus de 8 millions de documents pour la Bibliothèque nationale de France d'ici la fin de 2026, prouvant que, parfois, une équipe de spécialistes est le meilleur moyen de résoudre un puzzle historique complexe.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.