← Nieuwste papers
💬 NLP

Named Entity Recognition of Historical Texts via Large Language Model

Deze studie toont aan dat grote taalmodellen, gebruikmakend van zero-shot en few-shot prompting-strategieën, een haalbaar en efficiënt alternatief bieden voor Named Entity Recognition in historische teksten waar geannoteerde trainingsdata schaars is, met een redelijk sterke prestatie ondanks dat ze onderdoen voor volledig toezichtmodellen.

Oorspronkelijke auteurs: Shibingfeng Zhang, Giovanni Colavizza

Gepubliceerd 2026-04-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shibingfeng Zhang, Giovanni Colavizza

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek hebt met oude, stoffige kranten en handgeschreven brieven uit de 18e en 19e eeuw. Je wilt snel elke vermelding vinden van een specifieke persoon, stad of organisatie daarin. Dit is de taak van Named Entity Recognition (NER): een computer leren namen zoals "Napoleon", "Parijs" of "The Times" te herkennen en te labelen in een blok tekst.

Het probleem is dat deze oude documenten een nachtmerrie zijn voor computers. Ze zijn geschreven in vreemde, archaïsche talen, hebben inconsistente spelling (zoals "shew" in plaats van "show") en zitten vol met typefouten uit het scanproces. Om een computer dit te leren, heb je meestal een menselijk expert nodig die duizenden pagina's leest en elke naam handmatig labelt. Dit is duur, traag en vaak onmogelijk omdat er gewoon niet genoeg experts of geld zijn om dit te doen.

De Nieuwe Aanpak: De "Laat Zien, Vertel Niet" Strategie

Dit artikel test een nieuwe manier om dit probleem op te lossen met behulp van Large Language Models (LLM's). Denk aan een LLM als een superintelligente, welgelezen robot die bijna alles op internet heeft gelezen. In plaats van de robot te dwingen een zware training te doorlopen (die die dure gelabelde voorbeelden vereist), probeerden de onderzoekers een andere aanpak: Prompting.

Ze behandelden de robot als een nieuwe werknemer die nog niet was opgeleid voor de specifieke baan. Ze gaven de robot een "spiekbriefje" (een prompt) en vroegen hem het werk te doen. Ze testten twee hoofdstrategieën:

  1. Zero-Shot (De "Blinde" Test): Ze vertelden de robot simpelweg: "Hier is een tekst. Vind de mensen en plaatsen." Er werden geen voorbeelden gegeven.
  2. Few-Shot (De "Laat Het Mij Zien" Test): Ze gaven de robot eerst een klein voorbeeld van het werk. Ze zeiden: "Hier is een zin: 'Napoleon ging naar Parijs.' In deze zin is 'Napoleon' een Persoon en 'Parijs' een Locatie. Kijk nu naar deze nieuwe zin en doe hetzelfde."

Het Experiment: De "Eén Voorbeeld" Verrassing

De onderzoekers testten dit op een verzameling historische teksten in vijf verschillende talen (Duits, Frans, Engels, Zweeds en Fins). Ze probeerden de robot verschillende aantallen voorbeelden te geven: 1, 3 of 5. Ze probeerden ook verschillende manieren om die voorbeelden te kiezen, zoals ze willekeurig te kiezen of ze te kiezen die erg leken op de tekst die de robot ging lezen.

Hier is wat ze vonden, met behulp van enkele simpele analogieën:

  • Eén Voorbeeld is het Sweet Spot: Verrassend genoeg werkte het geven van de robot slechts één voorbeeld beter dan het geven van drie of vijf. Het is alsof je een spel uitlegt aan een kind: één duidelijk voorbeeld is vaak genoeg. Als je hen vijf voorbeelden geeft, raken ze misschien in de war door de extra ruis of de lengte van de instructies. De robot presteerde het beste met een enkele, duidelijke demonstratie.
  • Hoe Je Het Voorbeeld Kiest Maakt Niet Veel Uit: De onderzoekers vroegen zich af of het kiezen van een voorbeeld dat exact leek op de doeltekst (zoals het vinden van een tweeling) meer zou helpen dan het kiezen van een willekeurig exemplaar. Ze ontdekten dat het er niet echt toe deed. Of het voorbeeld nu een perfecte match was of gewoon een willekeurig voorbeeld, de robot leerde even goed van één enkel voorbeeld. Het is alsof de robot zo slim is dat hij de regels van het spel kan uitzoeken aan de hand van bijna elk enkel voorbeeld, ongeacht hoe vergelijkbaar het is met de taak.
  • De "Groepsstemming" Truc: Omdat AI soms wat onvoorspelbaar kan zijn (zoals het gooien van een muntje), vroegen de onderzoekers de robot de taak drie keer te doen en namen ze vervolgens het antwoord dat het vaakst voorkwam (Meerderheidsstemming). Dit hielp iets, net als een comité dat het eens wordt over een beslissing, maar de verbetering was klein.

De Resultaten: Goed, Maar Niet Perfect

De robot deed het aardig. Het was veel beter in het vinden van namen wanneer het zelfs één voorbeeld kreeg, vergeleken met wanneer het helemaal geen voorbeelden kreeg. Het kon echter nog steeds niet winnen van de "gouden standaard" systemen die maandenlang door mensen waren getraind op enorme hoeveelheden gelabelde data.

  • De Uitzondering: Er was één dataset (een verzameling Duitse teksten genaamd "Sonar") waar de robot eigenlijk beter presteerde dan de vorige beste methoden.
  • Het Gat: Voor de meeste andere teksten bleef de robot achter bij de experts die het zware werk van handmatige training hadden gedaan.

De Conclusie

Dit artikel bewijst dat je niet altijd een enorm team van menselijke labelers nodig hebt om een computer oude geschiedenisboeken te laten lezen. Je kunt een slimme AI gebruiken en hem gewoon één voorbeeld laten zien om verrassend goede resultaten te krijgen.

Hoewel deze "one-shot" methode nog niet perfect is en de meest accurate, door mensen getrainde systemen niet kan vervangen, is het een krachtig, gratis en snel hulpmiddel. Het stelt onderzoekers in staat om direct te beginnen met het verkennen van historische archieven, zelfs als ze niet het budget of de tijd hebben om een enorme trainingsdataset te creëren. Het is alsof je een behulpzame assistent hebt die de oude boeken met je kan lezen, zelfs als ze een snelle herinnering nodig hebben waar ze naar moeten zoeken voordat ze beginnen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →