← Nieuwste papers
💻 computer science

Identifying unique developers in OSS projects: A family of models

Dit artikel stelt een schaalbare pijplijn voor voor het de-dupliceren van OSS-ontwikkelaarsidentiteiten door een grote, gevalideerde dataset te creëren om klassieke machine learning-modellen te trainen en te vergelijken, wat uiteindelijk leiding geeft aan de optimale afweging tussen nauwkeurigheid en computationele kosten voor grootschalige mining.

Oorspronkelijke auteurs: Ruoyu Su, Alexander Bakhtin, Matteo Esposito, Davide Taibi, Valentina Lenarduzzi

Gepubliceerd 2026-06-09
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ruoyu Su, Alexander Bakhtin, Matteo Esposito, Davide Taibi, Valentina Lenarduzzi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert te tellen hoeveel unieke mensen werken aan een gigantisch, wereldwijd constructieproject (zoals het bouwen van de Linux-kernel). Je hebt een enorm logboek met elke gelegde baksteen, elke gelaste balk en elk ondertekend blauwdruk. Maar hier komt de adder onder het gras: het logboek bevat geen foto's of ID-kaarten. Het bevat alleen namen en e-mailadressen die door de werkers zelf zijn ingevuld.

Het probleem? Mensen zijn slordig.

  • Eén werker tekent op maandag als "John Smith" en op dinsdag als "J. Smith".
  • Een ander gebruikt "john.smith@work.com" voor zijn dagbaan en "jsmith123@gmail.com" voor zijn hobby in het weekend.
  • Soms zijn er twee totaal verschillende mensen die toevallig dezelfde naam hebben.

Als je dit niet oplost, klopt je telling niet. Je denkt misschien dat "John Smith" en "J. Smith" twee verschillende mensen zijn, of dat je denkt dat "John Smith" en "Jane Smith" dezelfde persoon zijn. Dit verstoort je begrip van wie met wie werkt, hoe teams verbonden zijn en hoe het project evolueert.

Dit artikel is een recept voor een "Naamdetective" die deze chaos kan oplossen.

Hier is hoe de auteurs van plan zijn hun detective-team op te bouken, simpel uitgelegd:

1. De "Superbrein"-proef (AI gebruiken om het antwoordmodel te maken)

Eerst willen de onderzoekers kijken of moderne Large Language Models (LLM's) — hetzelfde soort AI dat gedichten schrijft of vragen beantwoordt — kunnen optreden als de ultieme detective.

  • De analogie: Stel je voor dat je een zeer slimme, goed geïnformeerde bibliothecaris twee namen laat zien en vraagt: "Zijn dit dezelfde personen?" De bibliothecaris kijkt naar de context, de spellingwijzigingen en de e-mailpatronen om een gok te doen.
  • Het doel: Ze zullen verschillende "superbreinen" (verschillende AI-modellen) vragen dit te doen. Ze willen zien of ze het allemaal met elkaar eens zijn of dat sommige beter zijn dan andere.
  • De output: Zodra de AI goed wordt in het raden, zullen de onderzoekers de antwoorden van de AI gebruiken om een enorme "Antwoordsleutel" (een dataset van bevestigde duplicaten) te maken. Dit is alsof de AI het zware werk doet om duizenden voorbeelden te labelen, zodat mensen dit niet één voor één hoeven te doen.

2. De "Snelle Leerlingen" (Kleinere, snellere modellen trainen)

Het draaien van die "superbrein"-AI's is traag en duur (zoals het inhuren van een team van Nobelprijswinnende detectives voor elke naam). Dat kun je niet doen voor een project met miljoenen commits.

  • De analogie: Daarom willen de onderzoekers een team van snelle, goedkope leerlingen trainen (klassieke Machine Learning-modellen). Ze zullen deze leerlingen onderwijzen met behulp van de "Antwoordsleutel" die door de superbreinen is gemaakt.
  • Het doel: Ze willen zien of deze leerlingen de patronen goed genoeg kunnen leren om duplicaten zelfstandig te herkennen, maar dit veel sneller en met veel minder energie te doen dan de superbreinen.
  • De afweging: Ze zoeken naar het "Goldilocks"-model: een model dat accuraat genoeg is om op te vertrouwen, maar snel genoeg om miljoenen namen te verwerken zonder de computerbatterij leeg te trekken.

3. De "Activiteitetracker" (Extra aanwijzingen toevoegen)

Soms zijn namen en e-mails te verwarrend om het puzzelstukje alleen op te lossen.

  • De analogie: Stel je twee mensen voor genaamd "Alex" die beide aan hetzelfde specifieke type motoronderdeel werken. Zelfs als hun namen verschillend lijken, zijn hun werkpatronen identiek.
  • Het doel: De onderzoekers willen een nieuwe aanwijzing toevoegen: Cosine Similarity. Dit is een chique wiskundige manier om te zeggen: "Hoe vergelijkbaar zijn hun werkpatronen?" Als "Alex A" en "Alex B" beide precies dezelfde bestanden op precies hetzelfde moment hebben aangeraakt, zijn ze waarschijnlijk dezelfde persoon. Ze zullen testen of het toevoegen van deze "werkpatroon"-aanwijzing de detectives helpt om vaker het juiste te raden.

Het Grotere Plaatje

Het artikel beweert niet dat het de taak al heeft voltooid; het is een geregistreerd rapport, wat betekent dat het een gedetailleerd plan is voor een studie die nog niet volledig is uitgevoerd.

Wat ze beloven te leveren:

  1. Een Benchmark: Een duidelijke vergelijking van welke "detective" (AI vs. Klassieke ML) het beste is voor de klus.
  2. Een Kostenhandleiding: Een gids over hoeveel tijd en energie elke methode kost, zodat onderzoekers de juiste tool voor de omvang van hun project kunnen kiezen.
  3. Een Herbruikbare Toolkit: Een set regels en gegevens die andere onderzoekers kunnen gebruiken om hun eigen softwareprojecten op te schonen, zodat wanneer zij de samenwerking tussen teams bestuderen, ze ook daadwerkelijk echte mensen bestuderen, en geen spook-duplicaten.

Kortom, dit artikel gaat over het bouwen van een schaalbaar, energie-efficiënt en accuraat systeem om de rommelige naamkaartjes op de grootste softwareprojecten ter wereld op te schonen, zodat we eindelijk kunnen begrijpen hoe de mensen achter de code daadwerkelijk samenwerken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →