← Derniers articles
🤖 AI

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

Cet article présente NAICS-GH, un corpus de haute précision, publié publiquement, comprenant 6 588 dépôts GitHub étiquetés avec les secteurs industriels NAICS 2022 via un pipeline de recherche et de vérification combinant les plongements BAAI/bge-large-en et GPT-4.1, lequel atteint une précision validée par l'humain de 96,98 % et sert de référence pour la classification industrielle dans la recherche sur l'innovation en code source ouvert.

Auteurs originaux : Kevin Xu, Alexander Quispe

Publié 2026-07-08
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Kevin Xu, Alexander Quispe

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez GitHub comme une bibliothèque immense et chaotique contenant des centaines de millions de livres (des dépôts de code). Le problème est que, bien que la bibliothèque connaisse le titre de chaque livre, elle ne possède pas de « système Dewey » pour vous dire quel type d'entreprise ou d'industrie ce livre est destiné. Ce code est-il pour une banque ? Une ferme ? Un studio de jeux vidéo ? Sans cette étiquette, il est difficile pour les économistes, les décideurs politiques ou les entreprises de comprendre comment différentes industries utilisent le logiciel libre.

Ce document présente NAICS-GH, un nouveau système qui agit comme un bibliothécaire ultra-intelligent pour organiser ces livres selon le système de classification des industries de l'Amérique du Nord (SCIAN) — le système de classement standard utilisé par les gouvernements des États-Unis, du Canada et du Mexique.

Voici comment ils l'ont construit, expliqué simplement :

1. Le « Filet de pêche » (Récupération)

Tout d'abord, l'équipe ne pouvait pas lire chaque livre de la bibliothèque (il y a plus de 1,3 million de candidats). Ils ont donc utilisé un filet numérique appelé embeddings BGE et FAISS.

  • La métaphore : Imaginez que vous avez une liste de 1 000 mots-clés spécifiques (comme « rendement des cultures », « sécurité bancaire » ou « planification hospitalière »). Vous jetez ces mots-clés dans la bibliothèque, et le filet attrape instantanément les 20 livres qui semblent les plus proches de chaque mot-clé.
  • Le résultat : Ce filet a capturé environ 31 000 correspondances potentielles. Il a jeté un large filet pour s'assurer de ne rien manquer, mais il a aussi attrapé des « quasi-matches » (des livres qui sonnaient de manière similaire mais qui n'étaient pas tout à fait corrects).

2. L' « Expert Juge » (Vérification)

Le filet était trop lâche, il fallait donc un juge strict pour vérifier les prises. Ils ont engagé GPT-4.1 (une IA très avancée) pour agir en tant qu'expert de domaine.

  • La métaphore : Considérez GPT-4.1 comme un inspecteur chevronné. Pour chaque livre capturé par le filet, l'inspecteur lit la couverture, le résumé et les premières pages (la description du dépôt et le README).
  • La grille d'évaluation : L'inspecteur ne se contente pas de deviner ; il utilise une liste de contrôle stricte (une « grille »). Il demande : « Ce code résout-il réellement un problème pour cette industrie spécifique ? »
    • Si la réponse est un « Oui » clair, l'inspecteur donne une note de 9 ou 10.
    • Si c'est un « Peut-être », la note est plus basse.
    • S'il s'agit d'un outil générique utilisé par tout le monde (comme une calculatrice de base), il reçoit une note faible.
  • Le seuil de coupure : Ils n'ont conservé que les livres ayant obtenu un score de 8 ou plus. Cela garantissait qu'ils ne gardaient que les correspondances de haute confiance.

3. La Collection Finale (Le Jeu de Données)

Après que le juge IA a filtré les correspondances faibles, il restait 6 588 dépôts de haute qualité.

  • Ceux-ci sont répartis dans 19 industries différentes (comme l'Agriculture, l'Industrie manufacturière, la Santé et la Finance).
  • Ils ont intentionnellement laissé de côté une catégorie (« Gestion d'entreprises ») car il n'y avait pas assez d'exemples clairs pour constituer un groupe fiable.
  • Crucialement : Ils ont supprimé les noms des propriétaires pour protéger la vie privée, ne conservant que le contenu du code et l'étiquette de l'industrie.

4. Est-ce que cela a fonctionné ? (Validation)

Pour s'assurer que le juge IA n'hallucinait pas, l'équipe a engagé des assistants de recherche humains pour vérifier aléatoirement 2 421 de ces livres étiquetés.

  • Le résultat : Les juges humains étaient d'accord avec l'IA 96,98 % du temps.
  • La nuance : L'IA était presque parfaite pour les industries claires comme l'« Administration publique » ou les « Arts et divertissements ». Cependant, elle a eu un peu plus de mal avec l'« Industrie manufacturière » et le « Commerce de gros », où le logiciel peut parfois paraître générique. Le document note que si vous augmentez l'exigence de score à 9 ou 10, la précision dans ces industries délicates augmente encore davantage.

5. L' « Outil d'enseignement » (Benchmark)

Enfin, l'équipe a utilisé cette nouvelle bibliothèque étiquetée pour enseigner à six modèles d'IA différents comment classifier le code par eux-mêmes.

  • Ils ont testé des modèles comme RoBERTa, ModernBERT et DeBERTa.
  • Le gagnant : Un modèle appelé RoBERTa-large a le mieux appris, atteignant une précision de 86,45 % sur un ensemble de test qu'il n'avait jamais vu auparavant.
  • La conclusion : Cela prouve qu'une fois que vous avez une bonne « bibliothèque étiquetée », vous pouvez entraîner des modèles d'IA plus petits et plus rapides pour effectuer le travail de classification automatiquement à l'avenir.

Résumé

Le document présente un jeu de données accessible au public qui fait correspondre le code GitHub aux industries du monde réel. Il a été construit en :

  1. Jetant un large filet pour trouver des correspondances potentielles.
  2. Utilisant un juge IA strict pour les vérifier par rapport à une liste de contrôle détaillée.
  3. Faisant vérifier le travail par des humains pour garantir une précision de 97 %.
  4. Publiant les données et le code afin que quiconque puisse étudier comment différentes industries utilisent les logiciels libres.

Les auteurs déclarent explicitement qu'il s'agit d'un système de classification nord-américain appliqué mondialement, et ils avertissent que, bien que les étiquettes soient très précises, elles ne sont pas parfaites pour chaque industrie (spécifiquement l'industrie manufacturière et le commerce de gros). Ils notent également que le système fonctionne actuellement mieux avec les descriptions de code en langue anglaise.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →