← Ultimi articoli
🤖 AI

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

Questo articolo introduce NAICS-GH, un corpus ad alta precisione e rilasciato pubblicamente di 6.588 repository GitHub etichettati con i settori industriali NAICS 2022 tramite una pipeline di recupero e verifica che combina gli embedding BAAI/bge-large-en e GPT-4.1, il quale raggiunge una precisione validata da umani del 96,98% e funge da benchmark per la classificazione industriale nella ricerca sull'innovazione open-source.

Autori originali: Kevin Xu, Alexander Quispe

Pubblicato 2026-07-08
📖 5 min di lettura🧠 Approfondimento

Autori originali: Kevin Xu, Alexander Quispe

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate GitHub come una biblioteca massiccia e caotica che contiene centinaia di milioni di libri (repository di codice). Il problema è che, sebbene la biblioteca conosca il titolo di ogni libro, non possiede un "Sistema Dewey" che possa dirvi a quale tipo di business o settore appartenga effettivamente quel libro. Questo codice è per una banca? Per un'azienda agricola? Per uno studio di videogiochi? Senza questa etichetta, è difficile per economisti, decisori politici o aziende capire come i diversi settori utilizzino il software open-source.

Questo articolo presenta NAICS-GH, un nuovo sistema che agisce come un bibliotecario super intelligente per organizzare questi libri nel North American Industry Classification System (NAICS) — il sistema di classificazione standard utilizzato dai governi di Stati Uniti, Canada e Messico.

Ecco come l'hanno costruito, spiegato in modo semplice:

1. La "Rete da Pesca" (Retrieval)

In primo luogo, il team non poteva leggere ogni singolo libro della biblioteca (ci sono oltre 1,3 milioni di candidati). Così, hanno utilizzato una rete digitale chiamata BGE embeddings e FAISS.

  • La Metafora: Immaginate di avere una lista di 1.000 parole chiave specifiche (come "resa dei raccolti", "sicurezza bancaria" o "pianificazione ospedaliera"). Lanciate queste parole chiave nella biblioteca e la rete cattura istantaneamente i 20 libri che suonano più simili a ciascuna parola chiave.
  • Il Risultato: Questa rete ha catturato circa 31.000 potenziali corrispondenze. È stata lanciata una rete molto ampia per assicurarsi di non perdere nulla, ma ha anche catturato alcuni "quasi-errori" (libri che suonavano simili ma non erano del tutto corretti).

2. L' "Esperto Giudice" (Verification)

La rete era troppo larga, quindi avevano bisogno di un giudice severo per verificare le catture. Hanno assunto GPT-4.1 (un'IA molto avanzata) per agire come esperto di dominio.

  • La Metafora: Pensate a GPT-4.1 come a un ispettore esperto. Per ogni libro catturato dalla rete, l'ispettore legge la copertina, il riassunto e le prime pagine (la descrizione del repository e il file README).
  • La Griglia di Valutazione: L'ispettore non si limita a indovinare; utilizza una checklist rigorosa (una "rubrica"). Chiede: "Questo codice risolve davvero un problema per questo settore specifico?"
    • Se la risposta è un "Sì" chiaro, l'ispettore assegna un punteggio di 9 o 10.
    • Se è un "Forse", il punteggio è più basso.
    • Se è uno strumento generico usato da tutti (come una calcolatrice di base), riceve un punteggio basso.
  • Il Taglio: Hanno tenuto solo i libri che hanno ottenuto un punteggio di 8 o superiore. Questo ha garantito di mantenere solo le corrispondenze ad alta confidenza.

3. La Collezione Finale (The Dataset)

Dopo che il giudice IA ha filtrato le corrispondenze deboli, sono rimasti 6.588 repository di alta qualità.

  • Questi sono distribuiti in 19 diversi settori (come Agricoltura, Manifattura, Sanità e Finanza).
  • Hanno intenzionalmente escluso una categoria ("Gestione di Aziende") perché non c'erano abbastanza esempi chiari per creare un gruppo affidabile.
  • Fondamentale: Hanno rimosso i nomi dei proprietari per proteggere la privacy, mantenendo solo il contenuto del codice e l'etichetta del settore.

4. Ha Funzionato? (Validation)

Per assicurarsi che il giudice IA non stesse allucinando, il team ha assunto assistenti di ricerca umani per controllare casualmente 2.421 di questi libri etichettati.

  • Il Risultato: I giudici umani sono stati d'accordo con l'IA il 96,98% delle volte.
  • La Sfumatura: L'IA è stata quasi perfetta per settori netti come "Pubblica Amministrazione" o "Arti e Intrattenimento". Tuttavia, ha avuto un po' più di difficoltà con "Manifattura" e "Commercio all'Ingrosso", dove il software può talvolta apparire generico. L'articolo nota che se si alza il requisito del punteggio a 9 o 10, l'accuratezza in questi settori complicati aumenta ulteriormente.

5. Lo "Strumento di Insegnamento" (Benchmark)

Infine, il team ha utilizzato questa nuova biblioteca etichettata per insegnare a sei diversi modelli di IA come classificare il codice autonomamente.

  • Hanno testato modelli come RoBERTa, ModernBERT e DeBERTa.
  • Il Vincitore: Un modello chiamato RoBERTa-large ha imparato meglio, raggiungendo un'accuratezza dell'86,45% su un set di test che non aveva mai visto prima.
  • La Conclusione: Questo dimostra che una volta ottenuta una buona "biblioteca etichettata", è possibile addestrare modelli IA più piccoli e veloci per svolgere il lavoro di classificazione in modo automatico in futuro.

Riassunto

L'articolo presenta un dataset disponibile pubblicamente che mappa il codice di GitHub ai settori del mondo reale. È stato costruito:

  1. Lanciando una rete ampia per trovare potenziali corrispondenze.
  2. Utilizzando un rigoroso giudice IA per verificarle rispetto a una checklist dettagliata.
  3. Facendo doppie verifiche umane per garantire un'accuratezza del 97%.
  4. Rilasciando i dati e il codice affinché chiunque possa studiare come i diversi settori utilizzano il software open-source.

Gli autori dichiarano esplicitamente che questo è un sistema di classificazione nordamericano applicato globalmente, e avvertono che, sebbene le etichette siano altamente accurate, non sono perfette per ogni singolo settore (specificamente manifattura e commercio all'ingrosso). Notano anche che il sistema attualmente funziona meglio con le descrizioni del codice in lingua inglese.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →