← Nieuwste papers
💻 computer science

Linking Hadith Narrator Identities Across Heterogeneous Arabic Biographical Databases: A Multi-Signal Entity Resolution Pipeline

Dit artikel presenteert een tweefasige entity resolution-pipeline die succesvol meer dan 185.000 unieke varianten van Hadith-verteller namen uit de Sanadset-corpus koppelt aan twee belangrijke biografische databases, waardoor een verenigde, met metadata verrijkte transmissiegraaf wordt gecreëerd en de resulterende gekoppelde data als een open bron wordt vrijgegeven.

Oorspronkelijke auteurs: Taufiq Wirahman

Gepubliceerd 2026-07-08
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Taufiq Wirahman

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, eeuwenoude puzzel probeert op te lossen. De puzzelstukjes zijn de namen van duizenden vertellers van meer dan duizend jaar geleden. Deze vertellers, bekend als Hadith-overleveraars, gaven religieuze verhalen door van leraar op student.

Het probleem is dat deze namen verspreid liggen over drie verschillende digitale bibliotheken en ze spreken niet dezelfde taal. De ene bibliotheek noemt een man misschien "De Vader van Wijsheid", terwijl een andere hem "Omar, zoon van Ali, zoon van Ahmed" noemt, of een derde hem simpelweg "Omar" noemt. Het zijn allemaal dezelfde persoon, maar de computers weten dat niet.

Dit artikel beschrijft een nieuw "vertaler"- en "matchmaker"-systeem dat is gebouwd om deze verspreide bibliotheken met elkaar te verbinden. Zo werkt het, in eenvoudige stappen onderverdeeld:

De Drie Bibliotheken

Beschouw de drie databases als drie verschillende archieven:

  1. Het Verhaalarchief (Sanadset): Dit is een gigantische collectie van 650.000 verhalen. Het vermeldt wie het verhaal aan wie heeft verteld, maar het bevat geen biografie. Het is als een gastenlijst voor een feestje waar je alleen voornamen hebt, geen foto's of geboortedata.
  2. Het Biografiearchief A (Hawramani): Dit is een enorme directory van 100.000 overleveraars met details zoals hun sterfjaar en hoe betrouwbaar zij werden beschouwd.
  3. Het Biografiearchief B (Muslimscholars): Dit is een kleinere, gecureerde lijst van 25.000 geleerden met vergelijkbare details, maar geschreven in een iets ander formaat.

Een Twee-Fasige Matchmaking-Pipeline

De auteurs hebben een tweestaps-proces gebouwd om deze archieven aan elkaar te koppelen.

Fase 1: De "Naam-Alleen" Gissing

Omdat het Verhaalarchief (Sanadset) geen extra details heeft (zoals sterfjaren), kan het systeem alleen naar de namen kijken.

  • De Uitdaging: Arabische namen zijn lastig. Ze kunnen verschillende spellingen hebben, extra letters voor nadruk, of op een andere manier geschreven zijn.
  • De Oplossing: Het systeem "reinigt" eerst de namen door decoratieve tekens te verwijderen en letters te standaardiseren (zoals alle variaties van de letter "A" omzetten naar één standaardversie).
  • De Match: Het zoekt vervolgens naar "bigrammen" (woordparen) in de namen. Als het Verhaalarchief "Muhammad ibn Ismail" zegt en het Biografiearchief zegt "Muhammad ibn Ismail", dan is er een match.
  • Het Resultaat: Het heeft ongeveer 51% van de namen uit het Verhaalarchief gekoppeld aan het Biografiearchief. Het gaf deze koppelingen een betrouwbaarheidsscore: "Hoog" (zeer zeker) of "Gemiddeld" (vrij zeker).

Fase 2: De "Detective" Cross-Check

Nu het Verhaalarchief gekoppeld is aan Biografiearchief A, probeert het systeem Biografiearchief A te koppelen aan Biografiearchief B.

  • Het Voordeel: Ditmaal heeft het systeem meer aanwijzingen. Het kan vergelijken:
    1. Namen: Klinken ze hetzelfde?
    2. Sterfjaren: Zijn ze rond dezelfde tijd overleden? (Dit is een enorme aanwijzing voor veelvoorkomende namen zoals "Muhammad").
    3. Reputatie: Werd iemand als "betrouwbaar" beschreven en de ander als "zwak"?
  • Het Resultaat: Omdat het meer aanwijzingen had, kon het systeem 94,7% van de vermeldingen in Biografiearchief A koppelen aan Biografiearchief B.

De Grote Verbinding

Door deze twee stappen aan elkaar te koppelen, creëert het systeem een "transitieve" link.

  • Als Verhaalarchief Naam A overeenkomt met Biografie A Naam B, en Biografie A Naam B komt overeen met Biografie B Naam C...
  • Dan is Verhaalarchief Naam A verbonden met Biografie B Naam C.

Dit stelt onderzoekers in staat om een simpele naam uit een verhaal te nemen en direct gedetailleerde biografische gegevens op te halen uit twee andere bronnen.

Het Eindproduct: Een Reusachtige Kaart

Het uiteindelijke resultaat van dit werk is een enorme, gerichte kaart (een graaf) met:

  • 185.000 knooppunten (de unieke vertellers).
  • 814.000 randen (de lijnen die leraren met studenten verbinden).

Deze kaart is nu "verrijkt". Voorheen was het slechts een kaart van verbindingen. Nu is elk punt op de kaart voorzien van extra informatie (zoals sterfjaren en betrouwbaarheidscijfers) die uit de andere databases is gehaald.

Waarom Dit Belangrijk Is (Volgens het Papier)

Het artikel stelt dat onderzoekers voorheen vastzaten aan het bekijken van deze databases in isolatie. Ze konden de betrouwbaarheid van een overlever niet gemakkelijk over verschillende boeken heen vergelijken, omdat de computers niet wisten dat de namen naar dezelfde persoon verwezen.

Dit artikel biedt de eerste grootschalige "brug" tussen deze databases. De auteurs stellen de gegevens vrij als open bronnen, waardoor andere onderzoekers de geschiedenis van deze verhalen kunnen bestuderen met een veel duidelijker, meer verbonden beeld.

Kortom: De auteurs hebben een slim systeem gebouwd dat rommelige Arabische namen heeft opgeschoond, een tweestaps-matchingproces heeft gebruikt om drie verschillende databases te verbinden, en de grootste kaart van islamitische vertellers ooit heeft gemaakt, compleet met biografische details bij elke naam.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →