Digging Up Citations: FOSSIL, a Dataset and Workflow for Reference Extraction in Law and the Humanities
Dit artikel introduceert FOSSIL, een meertalige dataset en een bijbehorende workflow die ontworpen zijn om de extractie van voetnoot-gebaseerde citaties in juridische en geesteswetenschappelijke wetenschap te verbeteren, waarbij wordt aangetoond dat een gespecialiseerde pijplijn de extractiekwaliteit bijna verdubbelt ten opzien van standaardtools, terwijl tegelijkertijd de resterende uitdagingen bij het verwerken van kruisverwijzingen en voetnoten met gemengde inhoud worden belicht.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme bibliotheek probeert te organiseren. In de Natuurwetenschappen (zoals biologie of natuurkunde) hebben boeken een zeer nette, voorspelbare structuur: het hoofdverhaal zit in de hoofdstukken, en alle "bronvermeldingen" zijn weggestopt in een overzichtelijke, genummerde lijst helemaal achterin. Het is als een recept waarbij de ingrediënten apart van de bereidingsinstructies worden vermeld. Computers zijn erg goed in het lezen van deze recepten.
In de Rechtswetenschappen en de Geesteswetenschappen (geschiedenis, filosofie, literatuur) zijn de "bronvermeldingen" echter rommelig. Ze zitten begraven in de tekst zelf, vaak in de onderste marges (voetnoten), vermengd met de persoonlijke gedachten, verduidelijkingen en kruisverwijzingen van de auteur. Het is als een recept waarbij de ingrediënten in de zinnen verborgen zitten, zoals: "Voeg twee koppen bloem toe (die ik op dinsdag op de markt heb gekocht, zie pagina 4) terwijl je roert."
Dit artikel, getiteld "Digging Up Citations: FOSSIL," gaat over het bouwen van een betere manier om die verborgen ingrediënten in boeken uit de Rechten en de Geesteswetenschappen op te sporen.
Hier is de onderverdeling van wat ze hebben gedaan, met behulp van eenvoudige analogieën:
1. Het Probleem: De "Black Box" en de "Rommelige Kelder"
De auteurs leggen uit dat bestaande computerprogramma's (modellen) zijn getraind op de nette "Natuurwetenschappelijke" stijl. Wanneer ze proberen de voetnoten van de Rechten en de Geesteswetenschappen te lezen, raken ze in de war omdat de data door elkaar staat.
Ze merken ook op dat krachtige AI-tools (zoals grote commerciële chatbots) dit soms wel kunnen ontrafelen, maar dat ze riskant zijn. Ze zijn als het huren van een hypermoderne graafmachine van een bedrijf dat morgen failliet kan gaan, waarbij ze je data met zich mee nemen. De auteurs wilden een tool die open is, gratis is en voor altijd bij hen blijft.
2. De Oplossing: Het "FOSSIL"-project
Het team heeft een complete toolkit ontwikkeld om deze citaties op te graven. Ze noemen de dataset FOSSIL (Footnote-based Open-access SSH Scientific Instance Labels). Denk aan dit als een enorme, georganiseerde collectie "voor en na" voorbeelden die computers leren hoe ze rommelige voetnoten moeten lezen.
Ze hebben vier hoofdzaken gebouwd:
- Een Digitale Werkbank (PDF-TEI Editor): Een webtool waarmee mensen en computers zij aan zij kunnen werken. Het toont de originele PDF aan de ene kant en de gestructureerde data aan de andere kant, waardoor mensen fouten kunnen herstellen en de computer kunnen leren waar hij naar moet zoeken.
- Een Trainingshandleiding (De Workflow): Een stapsgewijze handleiding over hoe een team van zeven mensen (inclusen experts en studenten) de data heeft schoongemaakt en gelabeld.
- De Schatkist (De Dataset): Ze hebben 96 academische artikelen verzameld uit de rechten, geschiedenis en sociale wetenschappen. Deze artikelen bevatten meer dan 7.600 referenties die verborgen zitten in voetnoten. Cruciaal is dat deze data onder een "open licentie" valt, wat betekent dat iedereen het kan gebruiken zonder juridische problemen.
- Een Gespecialiseerde Motor (Grobid Specialisatie): Ze hebben een bestaande open-source tool genaamd Grobid (die als een standaard bibliotheekscanner werkt) genomen en deze voorzien van een "gespecialiseerde lens" om zich specifelijk te concentreren op de rommelige voetnoten van de Rechten en de Geesteswetenschappen.
3. De Uitdaging: Waarom is dit zo moeilijk?
Het artikel legt uit dat voetnoten in deze vakgebieden lastig zijn omdat ze vijf verschillende dingen tegelijk doen:
- Alleen een opmerking (geen citatie).
- Een biografie over de auteur.
- Een schone lijst van boeken.
- Een "zie ook"-notitie die naar een eerdere voetnoot verwijst (zoals "Zie voetnoot 5").
- Een chaotische mix van al het bovenstaande.
Het is alsof je probeert een stapel post te sorteren waarbij sommige enveloppen brieven bevatten, sommige cheques, sommige foto's, en sommige een mix van alle drie, en dat allemaal in verschillende talen en handschriften.
4. De Resultaten: Van "Ontbrekend" naar "Gevonden"
Het team heeft hun nieuwe gespecialiseerde motor getest tegenover de oude, standaardversie.
- De Oude Manier: De standaardtool was erg kieskeurig. Hij was bijna perfect in het identificeren van een referentie als hij er een vond (hoge precisie), maar hij miste 70-80% van de werkelijke referenties omdat ze er niet uitzagen als standaard wetenschappelijke citaties (lage recall). Het was als een metaaldetector die alleen piept voor gouden munten, maar zilveren munten negeert.
- De Nieuwe Manier: De gespecialiseerde "FOSSIL"-versie vond twee keer zoveel referenties.
- Het ging van het vinden van slechts 21% van de publicatiedatums naar het vinden van 71%.
- Het ging van het vinden van 23% van de auteursnamen naar het vinden van 60%.
- Over het algal was de kwaliteit van de extractie bijna verdubbeld (de score ging van 0,36 naar 0,72).
5. De Conclusie
Het artikel concludeert dat je niet zomaar de instellingen van een standaardtool kunt "tweakken" om dit probleem op te lossen; je hebt een tool nodig die specifiek is getraind op de rommelige realiteit van voetnoten in de Rechten en de Geesteswetenschappen.
FOSSIL is nu een opstapje. Het bewijst dat je met de juiste data en een gespecialiseerde workflow computers eindelijk accuraat de complexe voetnoten kunnen laten lezen. De auteurs zijn van plan dit uit te breiden naar meer talen en nog moeilijkere problemen aan te pakken, zoals het automatisch koppelen van "Zie voetnoot 5" terug naar de oorspronkelijke voetnoot 5.
Kortom: Ze hebben een betere schep en een kaart gebouwd om citaties op te graven die voorheen begraven lagen in de modder van academische voetnoten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.