← Nieuwste papers
💬 NLP

Structure-Guided Entity Resolution: Fine-Tuning LLMs for Robust Name Matching in Complex Linguistic Contexts

Dit artikel introduceert Structure-Guided Entity Resolution (SGER), een tweefasig curriculum-finetuningkader voor Large Language Models dat state-of-the-art nauwkeurigheid bereikt bij het matchen van complexe, meertalige persoonsnamen en momenteel op grote schaal wordt ingezet voor KYC-compliance op het Dream11-platform.

Oorspronkelijke auteurs: Shivam Chourasia, Hitesh Kapoor, Nilesh Patil

Gepubliceerd 2026-05-25
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Shivam Chourasia, Hitesh Kapoor, Nilesh Patil

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert de namen van twee mensen op elkaar af te stemmen, maar de namen zijn op een chaotische, slordige manier geschreven. De ene persoon staat misschien vermeld als "Rajesh Kumar", een andere als "Kumar Rajesh", een derde als "RajeshKumar" (zonder spatie) en een vierde als "Rajeshbhai" (met een vriendelijke titel toegevoegd). In een land zo divers als India, waar namen veranderen afhankelijk van de regio, de taal en zelfs hoe een ambtenaar ze heeft getypt, is dit een nachtmerrie voor computers.

Dit artikel introduceert een nieuw systeem genaamd SGER (Structure-Guided Entity Resolution) dat dit probleem oplost met een slimme trainingsmethode in twee stappen. Hieronder wordt uitgelegd hoe het werkt, in eenvoudige bewoordingen:

Het Probleem: De "Slordige Naam"-Puzzel

In de wereld van "Know Your Customer" (KYC)-controles – waarbij bedrijven verifiëren wie je bent voordat ze je toestaan spellen te spelen of rekeningen te openen – falen computers vaak.

  • De Oude Manier: Traditionele computers gebruiken eenvoudige regels, zoals tellen hoeveel letters verschillen tussen twee namen. Het is alsof je probeert een puzzel op te lossen door alleen naar de kleur van de stukjes te kijken en de vorm te negeren. Als iemand "Shubham" schrijft in plaats van "Subham", raakt de computer in de war.
  • De Nieuwe Manier (LLM's): Grote Taalmodellen (AI) zijn slim, maar als je ze gewoon vraagt "Zijn deze twee namen dezelfde persoon?", gokken ze soms verkeerd omdat ze eerst de grammatica van namen niet hebben geleerd. Ze proberen tegelijkertijd de structuur en het antwoord te leren, wat vergelijkbaar is met het vragen aan een student om tegelijkertijd een proefschrift te schrijven en een wiskundeprobleem op te lossen.

De Oplossing: Een Tweefasige "School" voor AI

De auteurs hebben een curriculum (een lesplan) ontwikkeld om hun AI-model, gebaseerd op het systeem Llama 3, in twee distincte fasen te onderwijzen. Denk hierbij aan het trainen van een nieuwe medewerker:

Fase 1: De "Naam-Architect"-Klas
Voordat de AI probeert namen op elkaar af te stemmen, wordt het geleerd om ze op te splitsen.

  • De Taak: Je geeft de AI een slordige naam zoals "Kirtan Singh Rathore".
  • De Les: De AI moet een nette, gestructureerde lijst (zoals een JSON-bestand) uitvoeren waarin staat: Voornaam: Kirtan, Middenaam: Singh, Achternaam: Rathore.
  • De Analogie: Stel je voor dat je een kind leert een rommelige stapel Lego-blokken te sorteren in "wielen", "ramen" en "muren" voordat je probeert een auto te bouwen. De AI leert dat "Singh" vaak een middenaam of familienaam is, en "Rathore" de familienaam, ongeacht de volgorde waarin ze verschijnen.

Fase 2: De "Detective"-Klas
Nu de AI begrijpt hoe namen zijn opgebouwd, wordt het gepromoveerd tot de rol van detective.

  • De Taak: Je geeft het twee namen (bijvoorbeeld "Rajeshk" en "Rajesh Kumar") en vraagt: "Zijn dit dezelfde persoon?"
  • Het Voordeel: Omdat de AI al weet hoe het namen moet ontleeden uit Fase 1, hoeft het niet tegelijkertijd de structuur te raden terwijl het de beslissing neemt. Het kan zich volledig richten op de matching.
  • Het Resultaat: Het wordt ongelooflijk nauwkeurig in het opsporen dat "Rajeshk" gewoon een typefout of afkorting is van "Rajesh Kumar".

De Resultaten: Een Super-Nauwkeurig Systeem

Het team testte dit systeem op 50.000 real-world voorbeelden uit India, een plek die bekendstaat om enkele van de meest complexe en gevarieerde naamgevingstradities ter wereld.

  • Oude Methoden: Haalden ongeveer 57% tot 85% nauwkeurigheid.
  • Standaard AI (zonder de tweestaps-training): Haalde ongeveer 91% nauwkeurigheid.
  • SGER (Het Nieuwe Systeem): Bereikte 99,02% nauwkeurigheid.

Dit betekent dat het systeem bijna perfect is in het bepalen of twee namen tot dezelfde persoon behoren, zelfs wanneer de namen verkeerd gespeld zijn, verwisseld zijn of spaties missen.

Real-world Impact: Dream11

Dit is niet zomaar een theorie; het werkt al. Het systeem is ingezet bij Dream11, het grootste fantasy-sportplatform ter wereld, dat meer dan 250 miljoen gebruikers bedient.

  • Voorheen: Wanneer de computer niet zeker was, moest het geval naar een mens worden gestuurd om handmatig te worden gecontroleerd. Dit was traag en duur.
  • Na: De AI regelt bijna alles automatisch.
  • Het Voordeel: Het bedrijf bespaart meer dan $500.000 per jaar omdat ze geen mensen hoeven te betalen om deze gevallen te controleren, en legitieme gebruikers worden direct geverifieerd zonder te hoeven wachten.

Samenvatting

Het artikel betoogt dat je, om AI goed te maken in een specifiek, rommelig werk (zoals het matchen van namen in India), niet zomaar data op het systeem moet gooien. In plaats daarvan moet je het eerst de regels van het spel leren (hoe namen zijn gestructureerd), en daarna leren hoe het het spel moet spelen (de namen matchen). Deze "curriculum"-benadering heeft een goede AI veranderd in een bijna perfecte, waarmee een enorme hoofdpijn voor een wereldwijd bedrijf is opgelost.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →