← Nieuwste papers
💬 NLP

ICE-ID: A Novel Historical Census Dataset for Longitudinal Identity Resolution

Dit artikel introduceert ICE-ID, een uniek historisch dataset met bijna één miljoen records uit 220 jaar IJslandse volkstellingen, die is ontworpen om de uitdagingen van longitudinale identiteitsoplossing te adresseren en als benchmark dient voor entiteitenreconstructie.

Oorspronkelijke auteurs: Gonçalo Hora de Carvalho, Lazar S. Popov, Sander Kaatee, Mário S. Correia, Kristinn R. Thórisson, Tangrui Li, Pétur Húni Björnsson, Eiríkur Smári Sigurðarson, Jilles S. Dibangoye

Gepubliceerd 2026-02-25
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Gonçalo Hora de Carvalho, Lazar S. Popov, Sander Kaatee, Mário S. Correia, Kristinn R. Thórisson, Tangrui Li, Pétur Húni Björnsson, Eiríkur Smári Sigurðarson, Jilles S. Dibangoye

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, oude familiefotoalbum probeert te ordenen. Maar dit is geen gewone album: het bevat foto's van bijna een miljoen mensen uit IJsland, genomen over een periode van 220 jaar (van 1703 tot 1920). En het ergste deel? De mensen op de foto's hebben vaak dezelfde naam, wonen op plekken die in de loop der tijd van naam zijn veranderd, en sommige foto's zijn beschadigd of missen stukjes.

Dit is precies het probleem dat de onderzoekers in dit papier proberen op te lossen met hun nieuwe dataset, ICE-ID.

Hier is een simpele uitleg van wat ze hebben gedaan, vertaald naar alledaagse taal:

1. Het Grote Puzzelprobleem

In de computerwereld heet het "Entity Resolution": het vinden van twee stukjes informatie die eigenlijk over dezelfde persoon gaan.

  • Het oude probleem: Meestal kijken computers naar producten (bijv. "Is dit een iPhone op Amazon hetzelfde als die op Google?"). Dat is makkelijk, want een iPhone is altijd een iPhone.
  • Het nieuwe probleem (ICE-ID): Mensen veranderen. Een man heet in 1750 misschien "Jón Jónsson", maar in 1850 heet zijn zoon ook "Jón Jónsson". Ze wonen misschien op dezelfde boerderij, maar de naam van de boerderij is veranderd. En soms is de geboortedatum op het formulier verkeerd ingevuld.

De onderzoekers hebben een enorme database gemaakt met 984.028 van deze "mensen-records". Ze hebben er zelfs 226.864 unieke personen in geïdentificeerd door handmatig (door experts) te kijken wie wie is.

2. Waarom is dit zo moeilijk? (De "Naam-Clash")

In IJsland gebruiken ze een heel specifiek systeem: patroniemen. Dat betekent dat je achternaam niet je vaders achternaam is, maar "de zoon/dochter van [vader]".

  • Als je vader Jón heet, heet jij Jónsson.
  • Als je vader ook Jón heet, heet jij ook Jónsson.

Stel je voor dat je in een zaal staat met 15.000 mensen die allemaal "Jón Jónsson" heten. Hoe weet de computer nu wie wie is?

  • De oplossing: De computer moet kijken naar andere hints: Op welke boerderij woonde hij? Wie was zijn vrouw? Wat was zijn geboortejaar?
  • De analogie: Het is alsof je twee mensen met dezelfde naam en hetzelfde T-shirt moet onderscheiden. Je moet kijken naar hun schoenen (geografie), hun vrienden (familie) en hun horloge (tijd).

3. De "Tijdmachine" (Tijdreizen)

De meeste oude databases zijn als een foto: ze zijn statisch. ICE-ID is als een tijdmachine.

  • De dataset laat zien hoe een persoon verandert van 1703 tot 1920.
  • De onderzoekers hebben de data opgesplitst: de computer mag "leren" van de oude data (voor 1870) en moet dan "toetsen" krijgen met de latere data (na 1890).
  • Waarom? Omdat de wereld verandert. Wat in 1800 werkte om iemand te vinden, werkt misschien niet in 1900. Dit test of slimme computers echt kunnen "leren" en niet alleen maar dingen uit het hoofd leren.

4. Wat ontbreekt er? (De lege plekken)

Niet alles is perfect. In de oude boeken ontbreken veel stukjes:

  • Familie: Soms staat er wie de vader is, maar vaak staat die kolom leeg (ongeveer 93% van de tijd!).
  • Namen: Soms is de naam niet volledig geschreven.
  • Grenzen: Dorpen en provincies kregen nieuwe namen of werden samengevoegd.

De onderzoekers hebben een dashboard gemaakt (een soort interactief spelletje) waar je kunt zien hoe deze lege plekken eruitzien en hoe de computer probeert de puzzel op te lossen.

5. Waarom is dit belangrijk?

Voorheen konden wetenschappers alleen maar gissen over hoe mensen in het verleden leefden, verhuisden of overleden, omdat het te moeilijk was om hun sporen door de tijd heen te volgen.
Met ICE-ID kunnen onderzoekers nu:

  • Kijken hoe mensen verhuisden.
  • Onderzoeken hoe ziektes zich verspreidden.
  • Kijken hoe sociale netwerken eruitzagen.

Kortom:
De onderzoekers hebben een gigantische, digitale tijdschets gemaakt van IJslandse families. Ze hebben de regels voor het oplossen van deze puzzel vrijgegeven, zodat andere wetenschappers hun slimme computers kunnen testen. Het is als het geven van een nieuwe, super-moeilijke puzzel aan de wereld, zodat we allemaal beter kunnen leren hoe we mensen door de tijd heen kunnen herkennen, zelfs als hun naam, adres en gezicht veranderen.

Het is een stap voorwaarts om de geschiedenis niet alleen te lezen, maar echt te begrijpen door de levens van gewone mensen te volgen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →