← Derniers articles
💻 computer science

Institutional Books - Visual Elements: An open-source pipeline for extracting, classifying, deduplicating, and captioning visual elements from digital book collections

Cet article présente un pipeline en libre accès et un nouveau jeu de données de 22,6 millions d'éléments visuels extraits de près d'un million de volumes de livres historiques, conçu pour automatiser la détection, la classification, la déduplication et la légendation du contenu non textuel afin de débloquer de nouvelles opportunités de recherche et d'entraînement de l'IA dans les collections de bibliothèques numérisées.

Auteurs originaux : Jimmy Mendez, Matteo Cargnelutti, David Lowry-Duda, Catherine Brobston, Salwa Ismail, Greg Leppert, Amanda Watson, Jonathan Zittrain

Publié 2026-08-20
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jimmy Mendez, Matteo Cargnelutti, David Lowry-Duda, Catherine Brobston, Salwa Ismail, Greg Leppert, Amanda Watson, Jonathan Zittrain

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les bibliothèques sont de vastes répertoires de l'histoire humaine, mais pendant des décennies, les versions numériques de leurs livres n'ont raconté qu'une moitié de l'histoire. Lorsque les institutions numérisent de vieux volumes pour les rendre consultables, elles se sont traditionnellement concentrées sur le texte, utilisant des logiciels pour lire les mots et les transformer en données. Ce processus, connu sous le nom de reconnaissance optique de caractères, est un triomphe, permettant aux chercheurs de parcourir des millions de pages en quelques secondes. Cependant, les images contenues dans ces livres — les illustrations, les photographies, les gravures et les bordures décoratives — sont restées largement invisibles pour les machines. Ces éléments visuels détiennent une couche unique de contexte et de nuance que le texte seul ne peut capturer, pourtant ils ont été difficiles à étudier à grande échelle car ils n'étaient pas structurés d'une manière que les ordinateurs pouvaient facilement comprendre. À mesure que les systèmes d'intelligence artificielle deviennent plus capables de « voir » et d'interpréter le monde, un fossé important est apparu : ces systèmes sont principalement entraînés sur des images modernes provenant d'Internet et peinent souvent à donner un sens à la culture visuelle historique. Pour combler ce fossé, les chercheurs ont besoin d'une collection massive et diversifiée d'images historiques, organisée et prête pour que les machines puissent apprendre.

Une équipe de chercheurs de l'Université de Harvard a relevé ce défi en construisant un nouveau système en libre accès (open-source) conçu pour trouver, trier et décrire les éléments visuels à l'intérieur de près d'un million de livres numérisés. Leur travail, détaillé dans un rapport technique, crée un pipeline qui agit comme un bibliothithecaire hautement qualifié capable de parcourir un livre, de repérer chaque image, de déterminer ce qu'elle est et d'en rédiger une courte description, le tout sans intervention humaine. Le résultat est un ensemble de données contenant plus de 22 millions d'éléments visuels extraits de 983 004 volumes. Cette collection comprend tout, des diagrammes scientifiques et partitions musicales aux portraits et arts décoratifs, chacun étant étiqueté avec des informations sur son type et, dans de nombreux cas, une légende générée par ordinateur. En rendant ces données disponibles, l'équipe espère aider les modèles d'intelligence artificielle à mieux comprendre les matériaux historiques, créant un cycle où de meilleurs outils mènent à plus de données, ce qui conduit à des outils encore meilleurs pour explorer notre passé commun.

Le processus commence par la tâche la plus basique : trouver les images. Les chercheurs ont développé un système qui scanne les pages numériques des livres pour localiser toute région contenant une image. Comme la collection est si vaste, contenant des centaines de millions de pages, le système devait être incroyablement efficace. Ils ont entraîné un modèle informatique spécialisé pour reconnaître les éléments visuels en lui montrant des milliers d'exemples de pages avec et sans images. Ce modèle a appris à ignorer le texte et à se concentrer sur les parties visuelles, en traçant un cadre autour de chaque illustration, photo ou diagramme trouvé. Lors de l'exécution finale, le système a traité l'ensemble de la collection et a identifié plus de 28 millions d'images potentielles. Pour garantir une haute qualité, les chercheurs ont appliqué des filtres stricts pour éliminer les fausses alertes, telles que les taches ou les erreurs de numérisation, laissant un ensemble final de 22,6 millions d'éléments visuels distincts.

Une fois les images trouvées, l'étape suivante consistait à comprendre ce qu'elles étaient. Le système a trié les 22,6 millions d'images en cinq catégories principales : illustrations générales et photographies, notation musicale, éléments décoratifs comme les ex-libris, graphiques et diagrammes, et artefacts de numérisation comme des doigts ou des trombones ayant accidentellement été capturés lors du scan. Les chercheurs ont entraîné un autre modèle pour faire ces distinctions, lui apprenant à différencier une partition musicale d'une page de texte, ou un bord décoratif d'un diagramme scientifique. Le système s'est avéré très précis, identifiant correctement la grande majorité des images. Par exemple, il pouvait distinguer la notation musicale avec une confiance quasi parfaite, bien qu'il ait trouvé certaines catégories, comme les bordures décoratives, légèrement plus difficiles à séparer d'autres types d'illustrations. Ce processus de tri est crucial car il permet aux chercheurs de poser des questions spécifiques, telles que « montrez-moi tous les graphiques du XVIIIe siècle » ou « trouvez chaque instance d'un ex-libris spécifique ».

Après le tri, l'équipe s'est attaquée au problème des doublons. Dans les grands projets de numérisation, la même image apparaît souvent plusieurs fois, soit parce qu'elle a été utilisée dans plusieurs éditions d'un livre, soit parce que le processus de numérisation a accidentellement capturé la même page deux fois. Pour nettoyer cela, les chercheurs ont utilisé deux méthodes différentes pour trouver les images correspondantes. La première méthode comparait les motifs de pixels des images pour trouver des copies exactes, tandis que la seconde examinait le sens profond des images pour trouver des quasi-doublons qui pourraient paraître légèrement différents en raison des variations de numérisation. En combinant ces approches, ils ont identifié et regroupé des millions d'images répétées, garantissant que l'ensemble de données final représentait un contenu visuel unique plutôt qu'une simple liste de chaque fois qu'une image apparaissait. Cette étape a réduit le nombre total d'éléments d'environ 20 %, laissant une collection plus propre et plus précieuse pour l'étude.

La partie finale et la plus expérimentale du projet a consisté à apprendre au système à écrire des descriptions pour les images. En utilisant un grand modèle de langage, les chercheurs ont demandé à l'ordinateur de générer une courte légende pour chaque image, expliquant ce qu'elle montrait. Pour aider l'ordinateur à comprendre le contexte, ils lui ont fourni le texte de la page environnante ainsi que l'image elle-même. Le système a reçu l'instruction d'être précis et d'éviter de deviner, en décrivant uniquement ce qui était clairement visible. Bien que les chercheurs aient noté que ces légendes sont expérimentales et doivent être utilisées avec prudence, ils ont réussi à générer près de 18 millions de descriptions. Ces légendes, rédigées dans la langue d'origine du livre chaque fois que possible, offrent un nouveau moyen de rechercher du contenu visuel, permettant aux utilisateurs de trouver des images en fonction de leur contenu plutôt que de simplement leurs noms de fichiers ou leurs catégories.

Les chercheurs ont également prêté une attention particulière à l'aspect pratique de cette entreprise massive, en veillant à ce que le processus soit efficace et puisse être reproduit par d'autres institutions. Ils ont constaté que le principal goulot d'étranglement n'était pas la capacité de réflexion de l'ordinateur, mais le temps nécessaire pour charger et préparer les images pour le traitement. En optimisant leur flux de travail, ils ont réussi à traiter l'ensemble de la collection en quelques semaines en utilisant des ressources informatiques standards. L'équipe a publié l'intégralité du pipeline, les modèles qu'ils ont entraînés et l'ensemble de données résultant en tant qu'outils en libre accès, invitant d'autres bibliothèques et chercheurs à utiliser et à améliorer leur travail. Ils ont également inclus des avertissements clairs concernant les limites de leurs données, notant que certaines images contiennent des biais historiques ou un langage offensant reflétant l'époque où elles ont été créées, et que les légendes générées par ordinateur ne sont pas parfaites.

Ce projet représente une étape significative pour rendre l'histoire visuelle de la culture humaine accessible à la fois aux humains et aux machines. En transformant une collection massive et non structurée d'images de livres en un ensemble de données de recherche, classifié et décrit, les chercheurs ont fourni un nouveau fondement pour l'étude du passé. L'ensemble de données comprend plus de 22 millions d'éléments visuels, offrant une ressource riche pour entraîner l'intelligence artificielle à comprendre les contextes historiques et pour permettre de nouvelles formes de recherche en humanités numériques. Ce travail démonte qu'avec une planification minutieuse et les bons outils, les trésors visuels cachés à l'intérieur de millions de vieux livres peuvent être mis en lumière, offrant de nouvelles perspectives sur les histoires qu'ils racontent.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →