Vidya: An AI-Driven Modular Pipeline for Archival Automation and Semantic Metadata Enrichment
Vidya est un pipeline modulaire et open-source développé à l'UEPG qui exploite des modèles de langage de grande taille contraints par des ontologies YAML et une validation Pydantic pour automatiser l'enrichissement sémantique et l'ingestion archivistique de « dark data » historiques, réduisant ainsi considérablement le temps de traitement de plusieurs décennies à quelques jours tout en garantissant la conformité aux normes internationales telles que NOBRADE et ISAD(G).
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous possédiez une immense bibliothèque de vieilles boîtes poussiéreuses remplies de documents historiques, de photos et de lettres. Vous avez passé des années à les numériser soigneusement pour les sauver de la décomposition. Mais voici le problème : vous vous retrouvez maintenant avec une montagne de fichiers numériques qui sont essentiellement des « données sombres ». Elles existent, mais personne ne peut les trouver car elles manquent d'étiquettes, de balises ou de descriptions. C'est comme avoir un gigantesque entrepôt rempli de boîtes mystère dont vous ignorez le contenu sans ouvrir chacune d'elles à la main.
Traditionnellement, engager des personnes pour lire chaque document et rédiger un résumé est incroyablement lent, coûteux et sujet aux erreurs. C'est ici qu'intervient Vidya.
Qu'est-ce que Vidya ?
Imaginez Vidya comme une bibliothécaire robotique ultra-intelligente et infatigable, conçue spécifiquement pour résoudre ce problème d'étiquetage. C'est un « pipeline », ce qui n'est qu'un mot pompeux pour désigner une chaîne de montage. Au lieu d'un humain assis à un bureau, Vidya prend vos fichiers numériques, les lit en utilisant l'intelligence artificielle (IA) et rédige automatiquement les descriptions nécessaires (métadonnées) afin que les gens puissent les rechercher et les retrouver plus tard.
Comment cela fonctionne-t-il ? (Le « camisole numérique »)
Vous pensez peut-être : « Attendez, l'IA peut être peu fiable. Elle invente parfois des choses ou « hallucine » des faits. » Les auteurs de l'article savaient que cela représentait un risque énorme pour les archives, où la précision est primordiale.
Pour remédier à cela, Vidya utilise une astuce ingénieuse qu'ils appellent une « camisole numérique ».
- Le problème : Imaginez demander à un écrivain créatif de décrire une photo. Il pourrait inventer des détails qui n'existent pas.
- La solution : Vidya ne laisse pas l'IA simplement « discuter ». Au lieu de cela, elle force l'IA à remplir un formulaire strict et préétabli (défini par un fichier YAML). C'est comme donner à l'IA une fiche à trous avec des règles spécifiques.
- La vérification : Avant que la réponse de l'IA ne soit acceptée, un gardien numérique (appelé Pydantic) vérifie le travail. Si l'IA tente d'écrire quelque chose qui ne correspond pas au formulaire ou qui enfreint les règles, le système le rejette. Cela garantit que la sortie est toujours structurée, précise et conforme aux règles internationales des bibliothèques (comme ISAD(G) et NOBRADE).
L'esprit « Maker »
Vidya n'a pas été construit dans un laboratoire d'entreprise high-tech avec un budget illimité. Il a été développé par une équipe d'une université au Brésil en utilisant les principes Maker.
- Faible coût : Il est conçu pour fonctionner sur des ordinateurs modestes et abordables (comme un bureau standard ou même un Raspberry Pi), et non sur des superordinateurs coûteux.
- Open Source : C'est un logiciel gratuit que n'importe qui peut examiner, corriger ou améliorer.
- Collaboration : Il réunit des historiens (qui connaissent l'histoire) et des informaticiens (qui maîtrisent le code) pour travailler ensemble.
Que ont-ils découvert ?
L'équipe a testé Vidya sur un tas de 50 documents (journaux et photos) et l'a comparé au travail manuel. Les résultats ont été spectaculaires :
- Vitesse : Ce qu'une équipe humaine mettrait 18,5 ans à traiter manuellement, Vidya peut le faire en environ 45 à 60 jours.
- Coût : L'approche assistée par IA ne coûte qu'environ 1,5 % de ce que coûterait le travail humain.
- Précision : Vidya atteint une précision d'environ 85 % sur les détails clés tels que les titres, les créateurs et les dates. Bien que ce ne soit pas parfait, c'est suffisant pour effectuer le gros du travail, laissant aux humains la tâche de simplement vérifier le travail plutôt que de tout recommencer à zéro.
- Accessibilité : En transformant ces images « sombres » en descriptions textuelles, Vidya rend ces archives accessibles aux personnes aveugles ou malvoyantes, qui utilisent des lecteurs d'écran pour naviguer sur le web.
La grande image
Vidya n'est pas seulement un outil ; c'est un moyen de déverrouiller l'histoire. Il prend les « données sombres » du passé — des fichiers qui gisaient dans l'obscurité, invisibles et invérifiables — et les transforme en un musée numérique lumineux, organisé et consultable. Il prouve que vous n'avez pas besoin d'un budget massif pour utiliser l'IA avancée ; il vous suffit d'une approche intelligente et structurée pour maintenir la technologie honnête et utile.
En résumé : Vidya est le pont qui transforme un tas chaotique de fichiers numériques en une bibliothèque utilisable et consultable, économisant des décennies de travail et rendant l'histoire accessible à tous.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.