← Nieuwste papers
💻 computer science

Author Name Disambiguation in Portuguese Scientific Publications: The SBC-AND dataset

Dit artikel introduceert SBC-AND, een gecureerde dataset van 442 Portugese wetenschappelijke publicatiegegevens, ontworpen om de ondervertegenwoordiging van niet-Engelse talen in onderzoek naar het disambiguëren van auteursnamen aan te pakken en te dienen als een uitdagende benchmark voor het evalueren van meertalige disambiguatiemodellen.

Oorspronkelijke auteurs: Natan de S. Rodrigues, Samuel Gomes dos Santos, Vitória Maria Diniz, Sirlene A. Rodrigues Costa

Gepubliceerd 2026-07-09
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Natan de S. Rodrigues, Samuel Gomes dos Santos, Vitória Maria Diniz, Sirlene A. Rodrigues Costa

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Naamkaartjes" Verwarring

Stel je voor dat je een enorme bibliotheek binnenloopt waar miljoenen mensen boeken hebben geschreven. Het probleem is dat veel mensen dezelfde naam hebben, zoals "John Smith" of "Maria Silva."

In de wereld van de wetenschap is dit een enorme hoofdpijn. Als een onderzoeker genaamd "Maria Silva" een artikel schrijft over computers, en een andere "Maria Silva" schrijft een artikel over geschiedenis, kan de bibliotheek per ongeluk denken dat ze dezelfde persoon zijn. Dit verpest hun reputatie, hun citatiescores en de manier waarop we begrijpen met wie zij samenwerken. Deze taak om uit te zoeken welke "Maria Silva" welk artikel heeft geschreven, wordt Author Name Disambiguation (AND) genoemd.

De Kloof: Het "Engelssprekende Feestje"

Al een lange tijd bouwen wetenschappers tools om deze verwarring op te lossen, maar die hebben vooral geoefend met Engelse namen. Het is alsof je een feestplanner hebt die geweldig is in het organiseren van Engelstalige gasten, maar nog nooit iemand met een Portugese naam heeft ontmoet.

Portugese namen zijn lastig. Ze hebben vaak meerdere achternamen (zo's als "Silva" of "Santos") en kleine verbindingswoorden zoals "de," "da," of "dos." Bovendien worden deze namen in wetenschappelijke registers vaak afgekort of inconsistent geschreven (bijv. "A. Silva" vs. "Ana Silva"). Daarom hebben de bestaande tools moeite wanneer ze met Portugese publicaties te maken krijgen.

De Oplossing: De SBC-AND "Trainingsgym"

De auteurs van dit artikel hebben een nieuwe tool gemaakt genaamd SBC-AND. Zie dit als een gespecialiseerde trainingsgym voor computerprogramma's.

  • Wat zit erin? Het is een collectie van 442 echte wetenschappelijke artikelen uit Braziliaanse computerwetenschappelijke tijdschriften.
  • Hoe is het georganiseerd? De auteurs hebben deze artikelen genomen en ze gesorteerd in "ambigue blokken." Stel je een doos voor met het label "Silva." In die doos zitten artikelen van 232 verschillende echte mensen die allemaal diezelfde achternaam delen.
  • Het Doel: De dataset is "gecureerd", wat betekent dat een mens al heeft gecontroleerd en gelabeld welke artikelen precies bij welke echte persoon horen. Dit geeft de computer een "correct antwoordmodel" om zichzelf tegen te testen.

Het Experiment: Het Brein van de Computer Testen

De onderzoekers hebben de dataset niet alleen gemaakt; ze hebben hem ook op de proef gesteld. Ze gebruikten een flexibel computersysteem (genaamd ADAN) dat probeert de artikelen terug te sorteren in de juiste groepen.

Ze testten het systeem met twee verschillende "brein"-modellen (AI-modellen die taal begrijpen):

  1. BAAI/bge-m3: Een meertalig model.
  2. IBM Granite: Een ander meertalig model.

Ze pasten ook de "diepte" van het systeem aan (hoeveel lagen denkwerk het doet) en hoe lang het oefende (training epochs).

De Resultaten: Een Moeilijke Uitdaging

Dit is wat er gebeurde toen de computer probeerde de artikelen te sorteren:

  • Het "Grote Plaatje" vs. de "Details": De computer was eigenlijk best goed in het gescheiden houden van de groepen van elkaar (zoals de "Silva"-doos uit de buurt houden van de "Oliveira"-doos). Echter, het had moeite om de artikelen binnen de "Silva"-doos correct te sorteren.
  • De Score: De computer behaalde een redelijke score op de algemene structuur (ongeveer 90% nauwkeurigheid), maar wanneer het kwam op het matchen van specifieke paren artikelen aan de juiste auteur, daalde de score aanzienlijk (ongeveer 45%).
  • Waarom? Het artikel legt uit dat dit komt omdat veel van de echte auteurs in de dataset slechts één of twee artikelen vermeld hebben staan. Het is alsof je probeert een persoon te identificeren op een feestje wanneer je diegene slechts één keer ziet; het is erg moeilijk om diegene te onderscheiden van iemand anders die er vergelijkbaar uitziet.
  • De Winnaar: Het IBM Granite-model presteerde iets beter dan het andere, vooral wanneer het een specifieke hoeveelheid "denkdiepte" gebruikte (twee lagen). Het systeem "dieper" maken (drie lagen) hielp niet; het maakte de boel juist rommeliger.

De Conclusie

Het artikel concludeert dat SBC-AND een zeer zware test is voor de huidige technologie. Het benadrukt dat hoewel computers steeds beter worden in het organiseren van wetenschappelijke gegevens, ze nog steeds worstelen met talen zoals Portugees, waarbij namen complex zijn en auteurs vaak niet veel publicaties hebben om hen te helpen identificeren.

De auteurs hebben deze dataset online beschikbaar gesteld, zodat andere onderzoekers deze kunnen gebruiken om betere tools te bouwen, zodat in de toekomst elke "Maria Silva" de erkenning krijgt die zij verdient voor haar eigen werk.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →