← Nieuwste papers
🤖 AI

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

Dit artikel introduceert NAICS-GH, een hoogwaardige, publiekelijk vrijgegeven corpus van 6.588 GitHub-repositories gelabeld met NAICS 2022 industrieel sectoren middels een retrieve-and-verify-pipeline die BAAI/bge-large-en embeddings en GPT-4.1 combineert, wat een door mensen gevalideerde precisie van 96,98% bereikt en dient als een benchmark voor industriële classificatie in onderzoek naar open-source innovatie.

Oorspronkelijke auteurs: Kevin Xu, Alexander Quispe

Gepubliceerd 2026-07-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kevin Xu, Alexander Quispe

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je GitHub voor als een enorme, chaotische bibliotheek met honderden miljoenen boeken (code-repositories). Het probleem is dat de bibliotheek wel de titel van elk boek kent, maar geen "Duitsalig Systeem" heeft om aan te geven voor welk type bedrijf of industrie dit boek eigenlijk is. Is deze code voor een bank? Een boerderij? Een videogame-studio? Zonder dit label is het voor economen, beleidsmakers of bedrijven moeilijk om te begrijpen hoe verschillende industrieën open-source software gebruiken.

Dit paper introduceert NAICS-GH, een nieuw systeem dat fungeert als een superintelligente bibliothecaris om deze boeken te organiseren volgens het North American Industry Classification System (NAICS) — het standaard classificatiesysteem dat wordt gebruikt door overheden in de VS, Canada en Mexico.

Hier is hoe ze het hebben gebouwd, eenvoudig uitgelegd:

1. Het "Visnet" (Retrieval)

Eerst kon het team niet elk afzonderlijk boek in de bibliotheek lezen (er zijn meer dan 1,3 miljoen kandidaten). Daarom gebruikten ze een digitaal visnet genaamd BGE embeddings en FAISS.

  • De Metafoor: Stel je voor dat je een lijst hebt van 1.000 specifieke trefwoorden (zoals "oogstopbrengst", "beveiliging van bankwezen" of "planning in de zorg"). Je gooit deze trefwoorden in de bibliotheek, en het net grijpt direct de top 20 boeken die het meest op elk trefwoord lijken.
  • Het Resultaat: Dit net ving ongeveer 31.000 potentiële matches op. Ze wierpen een breed net uit om er zeker van te zijn dat ze niets misten, maar ze vingen ook enkele "bijna-matches" (boeken die qua klank leken, maar niet helemaal de juiste waren).

2. De "Deskundige Rechter" (Verification)

Het net was te losmazig, dus ze hadden een strikte rechter nodig om de vangsten te verifiëren. Ze huurden GPT-4.1 (een zeer geavanceerde AI) in om als domeinexpert te fungeren.

  • De Metafoor: Denk aan GPT-4.1 als een ervaren inspecteur. Voor elk boek dat het net heeft gevangen, leest de inspecteur de cover, de samenvatting en de eerste paar pagina's (de beschrijving van de repository en de README).
  • Het Rubriek: De inspecteur gokt niet zomaar; hij gebruikt een strikte checklist (een "rubriek"). Hij vraagt zich af: "Lost deze code daadwerkelijk een probleem op voor deze specifieke industrie?"
    • Als het antwoord een duidelijk "Ja" is, geeft de inspecteur een score van 9 of 10.
    • Als het een "Misschien" is, is de score lager.
    • Als het een generiek hulpmiddel is dat door iedereen wordt gebruikt (zoals een basis rekenmachine), krijgt het een lage score.
  • De Afkapgrens: Ze hielden alleen de boeken over die een score van 8 of hoger kregen. Dit zorgde ervoor dat ze alleen de matches met een hoog vertrouwen behielden.

3. De "Definitieve Collectie" (The Dataset)

Nadat de AI-rechter de zwakke matches had weggefilterd, bleven er 6.588 hoogwaardige repositories over.

  • Deze zijn verspreid over 19 verschillende industrieën (zoals landbouw, productie, gezondheidszorg en financiële dienstverlening).
  • Ze hebben bewust één categorie weggelaten ("Management van bedrijven") omdat er niet genoeg duidelijke voorbeelden waren om een betrouwbare groep te vormen.
  • Cruciaal: Ze hebben de namen van de eigenaren verwijderd om de privacy te beschermen, waarbij alleen de inhoud van de code en het industrie-label zijn behouden.

4. Werkte het? (Validation)

Om te controleren of de AI-rechter niet aan het hallucineren was, huurde het team menselijke onderzoeksassistenten in om willekeurig 2.421 van deze gelabelde boeken te controleren.

  • Het Resultaat: De menselijke beoordelaars waren het in 96,98% van de gevallen eens met de AI.
  • De Nuance: De AI was bijna perfect voor duidelijk afgebakende industrieën zoals "Openbaar Bestuur" of "Kunst & Entertainment". De AI had echter iets meer moeite met "Productie" en "Groothandel", waar software soms generiek kan lijken. Het paper merkt op dat wanneer de score-eis wordt verhoogd naar een 9 of 10, de nauwkeurigheid in die lastige industrieën nog hoger wordt.

5. Het "Leermiddel" (Benchmark)

Ten slotte gebruikte het team deze nieuwe, gelabelde bibliotheek om zes verschillende AI-modellen te leren hoe ze code zelfstandig kunnen classificeren.

  • Ze testten modellen zoals RoBERTa, ModernBERT en DeBERTa.
  • De Winnaar: Een model genaamd RoBERTa-large leerde het best en behaalde een nauwkeurigheid van 86,45% op een testset die het nog nooit eerder had gezien.
  • De Les: Dit bewijst dat zodra je een goede "gelabelde bibliotheek" hebt, je kleinere, snellere AI-modellen kunt trainen om het classificatiewerk in de toekomst automatisch uit te voeren.

Samenvatting

Het paper presenteert een publiek toegankelijke dataset die GitHub-code koppelt aan real-world industrieën. Deze is gebouwd door:

  1. Een breed net uit te gooien om potentiële matches te vinden.
  2. Een strikte AI-rechter in te zetten om deze te verifiëren aan de hand van een gedetailleerde checklist.
  3. Mensen de controle te laten doen om de nauwkeurigheid van 97% te waarborgen.
  4. De data en de code vrij te geven zodat iedereen kan bestuderen hoe verschillende industrieën open-source software gebruiken.

De auteurs geven expliciet aan dat dit een Noord-Amerikaans classificatiesysteem is dat wereldwijd wordt toegepast, en ze waarschuwen dat hoewel de labels zeer accuraat zijn, ze niet perfect zijn voor elke enkele industrie (met name productie en groothandel). Ze merken ook op dat het systeem momenteel het beste werkt met Engelstalige codebeschrijvingen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →