← Nieuwste papers
💻 computer science

A Global Author-Identity Map for the World of Code:62.7M Developer Identities from 106.8M Author Strings over 5.87B Commits

Dit artikel introduceert een gecureerde, hoog-precieze globale auteur-identiteitskaart voor de World of Code (V2604) die 106,8 miljoen auteur-strings oplost in 62,7 miljoen canonieke identiteiten over 5,87 miljard commits door prioriteit te geven aan het voorkomen van foutieve "clumping" boven eenvoudige recall, waardoor de betrouwbaarheid van grootschalige software-repository-analyse en wetenschappelijke auteur-graaf-joins aanzienlijk wordt verbeterd.

Oorspronkelijke auteurs: Audris Mockus

Gepubliceerd 2026-07-08
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Audris Mockus

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je de hele geschiedenis van softwareontwikkeling voor als een enorme, chaotische bibliotheek met bijna 6 miljard boeken (code commits). In deze bibliotheek zet iedereen zijn naam onder de pagina's die hij schrijft. Maar hier is het probleem: de handtekeningen zijn een puinhoop.

Iemand kan tekenen als "Jane Doe", dan als "j.doe", dan als "jane.doe@work.com", en later als "jane@personal.org". Ondertussen tekenen duizenden verschillende vreemden hun pagina's als "root" of "user" of "Je Naam".

Als je probeerde te tellen hoeveel unieke auteurs er zijn door alleen naar deze handtekeningen te kijken, zou je een volkomen fout antwoord krijgen. Je zou denken dat er miljoenen meer mensen zijn dan er in werkelijkheid zijn (omdat één persoon er als tien lijkt), of je zou missen dat veel "mensen" eigenlijk robots of bots zijn.

Dit artikel presenteert een Gigantische Identiteitskaart die deze bibliotheek opruimt. Het neemt 106 miljoen slordige handtekeningen en organiseert ze in 62,7 miljoen echte mensen.

Dit is hoe ze het deden, met behulp van eenvoudige analogieën:

1. Het Probleem: De "Mega-Cluster" Valstrik

De auteurs leggen uit dat eerdere pogingen om dit probleem op te lossen leken op het proberen aan elkaar lijmen van puzzelstukjes op basis van alleen kleur. Als je simpelweg zegt: "Als twee namen een gemeenschappelijke letter of e-mail delen, moeten ze dezelfde persoon zijn," dan lijm je uiteindelijk miljoenen ongerelateerde mensen aan elkaar tot één gigantische, monsterlijke klomp.

Ze noemen dit een "Mega-Cluster". Stel je een bibliotheek voor waar, omdat iedereen het woord "De" in hun titel gebruikte, de bibliothecaris besloot dat elk boek in het gebouw door dezelfde persoon was geschreven. Dat is wat er in eerdere kaarten gebeurde: ze voegden per ongeluk 3 miljoen ongerelateerde ontwikkelaars samen tot één gigantische "super-auteur".

2. De Oplossing: Een Zesstappen Detective-pipeline

Om dit op te lossen, bouwden de auteurs een zesfasig detectiveproces om de handtekeningen te sorteren zonder die grote fout te maken:

  • Stap 1: De Initiële Aanwijzing: Ze beginnen met het koppelen van handtekeningen die overduidelijke overeenkomsten hebben, zoals exact hetzelfde e-mailadres.
  • Stap 2: De "Bad Actor" Filter: Ze negeren namen die duidelijk generiek zijn (zoals "root" of "admin") of toebehoren aan robots. Dit zijn als "geesten" in de bibliotheek; ze mogen niet worden gebruikt om echte mensen met elkaar te verbinden.
  • Stap 3: De Structurele Snede (De Magische Truc): Dit is de belangrijkste stap. Ze bekeken de verbindingen als een kaart van bruggen. Ze vonden een paar specifieke "brug"-handtekeningen die enorme, ongerelateerde groepen mensen bij elkaar hielden. Ze sneden die bruggen door. Dit loste de gigantische "Mega-Cluster" direct op in kleinere, beheersbare groepen.
  • Stap 4: De Slimme Classificatie: Ze gebruikten een computerprogramma (getraind op miljoenen echte voorbeelden) om te beslissen of twee vergelijkbaar klinkende namen daadwerkelijk dezelfde persoon zijn of gewoon een toevalstreffer (zoals twee mensen genaamd "John Smith").
  • Stap 5: Het Herstel van de Recall: Na het doorsnijden van de slechte verbindingen, voegden ze zorgvuldig enkele verbindingen die ze eerder hadden genegeerd weer toe, door gebruik te maken van een andere methode (kijken naar hoe namen in stukjes zijn gespeld) om er zeker van te zijn dat ze niet te veel echte vrienden misten.
  • Stap 6: De Definitieve Labeling: Ze kozen de "beste" versie van elke naam (meestal degene met een echte naam en een echt e-mailadres) om de officiële ID voor die persoon te worden.

3. Waarom dit ertoe doet: De "Bus Factor" en Productiviteit

Het artikel laat zien dat als je deze namen niet herstelt, je wiskunde niet klopt. Ze voerden verschillende experimenten uit om het verschil aan te tonen:

  • Mensen tellen: Zonder de namen te herstellen, lijkt de bibliotheek 66% meer auteurs te hebben dan in werkelijkheid het geval is. Het is alsof je dezelfde persoon 10 keer telt omdat diegene zich op 10 verschillende manieren heeft ondertekend.
  • Teamveiligheid (De Bus Factor): Stel je een project voor waarbij je moet weten: "Als één persoon door een bus wordt geraakt, gaat het project dan dood?"
    • Zonder de namen te herstellen: Het project lijkt veilig omdat het werk verspreid is over 10 verschillende "namen".
    • Met het herstellen van de namen: Je realiseert je dat al die 10 namen bij één persoon horen. Het project is in werkelijkheid in groot gevaar.
    • Het Resultaat: Het artikel vond dat 96% van de projecten daadwerkelijk afhankelijk is van één persoon (een "Single Point of Failure"), terwijl de rommelige data het liet lijken alsof slechts 90% dat was.
  • Centraliteit (De "Belangrijkste" Mensen): In de rommelige data waren de "belangrijkste" mensen in het netwerk vaak robots of generieke accounts (zoals "root"). Zodra ze de namen herstelden, waren de "belangkrijkste" mensen daadwerkelijke menselijke ontwikkelaars.

4. De "Gold Standard" Controle

De auteurs hebben niet gewoon geraden; ze hebben hun kaart getest tegen twee verschillende "antwoordsleutels":

  1. Menselijke Review: Een kleine groep mensen controleerde of de kaart correct was.
  2. GitHub Data: Ze gebruikten gegevens van GitHub-accounts om te zien of ze alle aliassen hadden gevonden.

Ze ontdekten dat hun nieuwe kaart 88% precies is (het verwisselt zelden vreemden) en 70% compleet (het vindt de meeste aliassen). Cruciaal is dat ze bewezen dat de oude kaarten er perfect uitzagen (95% precies) alleen omdat ze de gigantische "Mega-Clusters" negeerden waar de fouten zich verborgen.

5. Code Verbinden met Wetenschap

Ten slotte suggereren de auteurs dat deze kaart kan worden gebruikt als een "universele sleutel" om softwareontwikkelaars te verbinden met academische onderzoekers. Aangezien veel mensen zowel code als wetenschappelijke artikelen schrijven, kan deze kaart helpen om het onderzoekswerk van een ontwikkelaar te koppelen aan hun wetenschappelijke publicaties. Ze waarschuwen echter dat dit erg moeilijk is omdat namen zo algemeen voorkomen (bijv. "John Smith" in code en "John Smith" in een paper), en dat men uiterst voorzichtig moet zijn om niet per ongeluk de verkeerde mensen aan elkaar te koppelen.

Samenvatting

Dit artikel is een gids voor het opschonen van een enorme, rommelige database van software-auteurs. Het bewijst dat het negeren van de rommel leidt tot verkeerde conclusies over wie er werkt, hoe productief ze zijn en hoe veilig projecten zijn. Hun nieuwe kaart is de eerste die erin slaagt om de valstrik te vermijden om miljoenen vreemden aan elkaar te plakken tot één enkele, valse identiteit.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →