← Derniers articles
💻 computer science

Digging Up Citations: FOSSIL, a Dataset and Workflow for Reference Extraction in Law and the Humanities

Cet article présente FOSSIL, un ensemble de données multilingue et un flux de travail l'accompagnant conçus pour améliorer l'extraction des citations basées sur des notes de bas de page dans les travaux de recherche en droit et en sciences humaines, démontrant qu'un pipeline spécialisé double presque la qualité d'extraction par rapport aux outils standards tout en soulignant les défis persistants liés à la gestion des renvois et des notes de bas de page à contenu mixte.

Auteurs originaux : Luca Foppiano, Christian Boulanger

Publié 2026-06-02
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Luca Foppiano, Christian Boulanger

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'organiser une bibliothèque massive. Dans les sciences naturelles (comme la biologie ou la physique), les livres ont une structure très nette et prévisible : l'histoire principale se trouve dans les chapitres, et toutes les « notes sources » sont rangées proprement dans une liste numérotée à la toute fin. C'est comme une recette où les ingrédients sont listés séparément des instructions de cuisson. Les ordinateurs sont très doués pour lire ces recettes.

Cependant, dans le Droit et les Humanités (histoire, philosophie, littérature), les « notes sources » sont désordonnées. Elles sont enfouies à l'intérieur même du texte, souvent dans les marges inférieures (notes de bas de page), mélangées aux pensées personnelles de l'auteur, à ses clarifications et à ses renvois. C'est comme une recette où les ingrédients sont cachés dans les phrases, du type : « Ajoutez deux tasses de farine (que j'ai achetée au marché mardi, voir page 4) tout en remuant ».

Ce document, intitulé « Digging Up Citations: FOSSIL », traite de la création d'une meilleure façon de trouver et d'organiser ces ingrédients cachés dans les livres de Droit et des Humanités.

Voici la décomposition de ce qu'ils ont fait, en utilisant des analogies simples :

1. Le Problème : La « Boîte Noire » et le « Sous-sol Désordonné »

Les auteurs expliquent que les programmes informatiques existants (modèles) sont entraînés sur le style ordonné des « sciences naturelles ». Lorsqu'ils essaient de lire les notes de bas de page du Droit et des Humanités, ils sont confus car les données sont mélangées.

Ils notent également que si les outils d'IA puissants (comme les grands chatbots commerciaux) peuvent parfois comprendre cela, ils sont risqués. C'est comme louer une excavatrice de haute technologie auprès d'une entreprise qui pourrait faire faillite demain, emportant vos données avec elle. Les auteurs voulaient un outil ouvert, gratuit, qui leur appartienne pour toujours.

2. La Solution : Le Projet « FOSSIL »

L'équipe a créé une boîte à outils complète pour déterrer ces citations. Ils appellent ce jeu de données FOSSIL (Footnote-based Open-access SSH Scientific Instance Labels). Considérez cela comme une vaste collection organisée d'exemples « avant et après » qui apprennent aux ordinateurs à lire les notes de bas de page désordonnées.

Ils ont construit quatre éléments principaux :

  • Un Établi Numérique (Éditeur PDF-TEI) : Un outil web qui permet aux humains et aux ordinateurs de travailler côte à côte. Il affiche le PDF original d'un côté et les données structurées de l'autre, permettant aux personnes de corriger les erreurs et d'enseigner à l'ordinateur ce qu'il doit chercher.
  • Un Manuel de Formation (Le Flux de Travail) : Un guide étape par étape sur la manière dont une équipe de sept personnes (comprenant des experts et des étudiants) a nettoyé et étiqueté les données.
  • Le Trésor (Le Jeu de Données) : Ils ont collecté 96 articles académiques de droit, d'histoire et de sciences sociales. Ces articles contiennent plus de 7 600 références cachées dans les notes de bas de page. Crucialement, ces données sont sous « licence ouverte », ce qui signifie que n'importe qui peut les utiliser sans problèmes juridiques.
  • Un Moteur Spécialisé (Spécialisation Grobid) : Ils ont pris un outil open-source existant appelé Grobid (qui est comme un scanner de bibliothèque standard) et lui ont donné une « lentille spécialisée » pour se concentrer spécifiquement sur les notes de bas de page complexes du Droit et des Humanités.

3. Le Défi : Pourquoi est-ce si difficile ?

Le document explique que les notes de bas de page dans ces domaines sont délicates car elles font cinq choses différentes à la fois :

  1. Juste un commentaire (sans citation).
  2. Une note biographique sur l'auteur.
  3. Une liste propre de livres.
  4. Une note de type « voir aussi » pointant vers une note de bas de page antérieure (comme « Voir note 5 »).
  5. Un mélange chaotique de tout ce qui précède.

C'est comme essayer de trier une pile de courrier où certaines enveloppes contiennent des lettres, d'autres des chèques, d'autres des photos, et certaines un mélange des trois, le tout écrit dans des langues et des styles d'écriture différents.

4. Les Résultats : De « Manquant » à « Trouvé »

L'équipe a testé leur nouveau moteur spécialisé par rapport à l'ancienne version standard.

  • L'Ancienne Méthode : L'outil standard était très exigeant. Il était presque parfait pour identifier une référence si il en trouvait une (haute précision), mais il manquait 70 à 80 % des références réelles parce qu'elles ne ressemblaient pas à des citations scientifiques standards (faible rappel). C'était comme un détecteur de métaux qui ne bipe que pour les pièces d'or mais ignore les pièces d'argent.
  • La Nouvelle Méthode : La version spécialisée « FOSSIL » a trouvé deux fois plus de références.
    • Elle est passée de seulement 21 % de dates de publication trouvées à 71 %.
    • Elle est passée de 23 % de noms d'auteurs trouvés à 60 %.
    • Globalement, la qualité de l'extraction a presque doublé (le score est passé de 0,36 à 0,72).

5. La Conclusion

Le document conclut qu'on ne peut pas simplement « ajuster » les paramètres d'un outil standard pour régler ce problème ; il faut un outil spécifiquement entraîné sur la réalité désordonnée des notes de bas de page du Droit et des Humanités.

FOSSIL est désormais un premier jalon. Il prouve qu'avec les bonnes données et un flux de travail spécialisé, les ordinateurs peuvent enfin commencer à lire ces notes de bas de page complexes avec précision. Les auteurs prévoient d'étendre cela à plus de langues et de s'attaquer à des problèmes encore plus difficiles, comme relier automatiquement un « Voir note 5 » à la note 5 originale.

En bref, ils ont construit une meilleure pelle et une carte pour déterrer les citations qui étaient auparavant enfouies dans la boue des notes de bas de page académiques.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →