← Últimos artigos
🤖 AI

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

Este artigo apresenta o NAICS-GH, um corpus de alta precisão, lançado publicamente, de 6.588 repositórios do GitHub rotulados com setores industriais NAICS 2022 utilizando um pipeline de recuperação e verificação que combina embeddings BAAI/bge-large-en e GPT-4.1, o qual alcança 96,98% de precisão validada por humanos e serve como um benchmark para classificação industrial em pesquisas de inovação de código aberto.

Autores originais: Kevin Xu, Alexander Quispe

Publicado 2026-07-08
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Kevin Xu, Alexander Quispe

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine o GitHub como uma biblioteca massiva e caótica contendo centenas de milhões de livros (repositórios de código). O problema é que, embora a biblioteca conheça o título de cada livro, ela não possui um "Sistema Dewey" para dizer qual é o tipo de negócio ou indústria aquele livro realmente atende. Este código é para um banco? Uma fazenda? Um estúdio de videogames? Sem esse rótulo, é difícil para economistas, formuladores de políticas ou empresas entenderem como diferentes setores estão utilizando o software de código aberto.

Este artigo apresenta o NAICS-GH, um novo sistema que atua como um bibliotecário superinteligente para organizar esses livros no North American Industry Classification System (NAICS) — o sistema de arquivamento padrão usado por governos nos EUA, Canadá e México.

Veja como eles construíram isso, explicado de forma simples:

1. A "Rede de Pesca" (Recuperação)

Primeiro, a equipe não pôde ler cada um dos livros da biblioteca (existem mais de 1,3 milhão de candidatos). Por isso, usaram uma rede de pesca digital chamada embeddings BGE e FAISS.

  • A Metáfora: Imagine que você tem uma lista de 1.000 palavras-chave específicas (como "rendimento de safra", "segurança bancária" ou "agendamento hospitalar"). Você lança essas palavras-chave na biblioteca e a rede agarra instantaneamente os 20 livros que soam mais semelhantes a cada palavra-chave.
  • O Resultado: Esta rede capturou cerca de 31.000 correspondências potenciais. Eles lançaram uma rede ampla para garantir que nada fosse perdido, mas também pegaram alguns "quase-acertos" (livros que soavam semelhantes, mas não eram exatamente o que se buscava).

2. O "Juiz Especialista" (Verificação)

A rede era muito frouxa, então eles precisavam de um juiz rigoroso para verificar as capturas. Eles contrataram o GPT-4.1 (uma IA muito avançada) para atuar como um especialista de domínio.

  • A Metáfora: Pense no GPT-4.1 como um inspetor experiente. Para cada livro que a rede capturou, o inspetor lê a capa, o resumo e as primeiras páginas (a descrição do repositório e o README).
  • A Rubrica: O inspetor não apenas adivinha; ele usa uma lista de verificação rigorosa (uma "rubrica"). Ele pergunta: "Este código realmente resolve um problema para este setor específico?"
    • Se a resposta for um "Sim" claro, o inspetor dá uma nota 9 ou 10.
    • Se for um "Talvez", a nota é menor.
    • Se for uma ferramenta genérica usada por todos (como uma calculadora básica), recebe uma nota baixa.
  • O Corte: Eles mantiveram apenas os livros que obtiveram uma pontuação de 8 ou superior. Isso garantiu que mantivessem apenas correspondências de alta confiança.

3. A Coleção Final (O Conjunto de Dados)

Após o juiz de IA filtrar as correspondências fracas, restaram 6.588 repositórios de alta qualidade.

  • Estes estão espalhados por 19 setores diferentes (como Agricultura, Manufatura, Saúde e Finanças).
  • Eles deixaram de fora intencionalmente uma categoria ("Gestão de Empresas") porque não havia exemplos claros suficientes para formar um grupo confiável.
  • Crucialmente: Eles removeram os nomes dos proprietários para proteger a privacidade, mantendo apenas o conteúdo do código e o rótulo do setor.

4. Funcionou? (Validação)

Para garantir que o juiz de IA não estava alucinando, a equipe contratou assistentes de pesquisa humanos para verificar aleatoriamente 2.421 desses livros rotulados.

  • O Resultado: Os juízes humanos concordaram com a IA 96,98% das vezes.
  • A Nuance: A IA foi quase perfeita para setores claros como "Administração Pública" ou "Artes e Entretenimento". No entanto, ela teve um pouco mais de dificuldade com "Manufatura" e "Comércio Atacadista", onde o software às vezes pode parecer genérico. O artigo observa que, se você elevar o requisito de pontuação para 9 ou 10, a precisão nesses setores complicados aumenta ainda mais.

5. A "Ferramenta de Ensino" (Benchmark)

Finalmente, a equipe usou esta nova biblioteca rotulada para ensinar seis modelos de IA diferentes a classificar código por conta própria.

  • Eles testaram modelos como RoBERTa, ModernBERT e DeBERTa.
  • O Vencedor: Um modelo chamado RoBERTa-large aprendeu melhor, alcançando 86,45% de precisão em um conjunto de teste que nunca tinha visto antes.
  • A Lição: Isso prova que, uma vez que você tem uma boa "biblioteca rotulada", pode treinar modelos de IA menores e mais rápidos para realizar o trabalho de classificação automaticamente no futuro.

Resumo

O artigo apresenta um conjunto de dados disponível publicamente que mapeia o código do GitHub para setores do mundo real. Foi construído por:

  1. Lançar uma rede ampla para encontrar correspondências potenciais.
  2. Usar um juiz de IA rigoroso para verificá-los contra uma lista de verificação detalhada.
  3. Ter humanos conferindo o trabalho para garantir 97% de precisão.
  4. Liberar os dados e o código para que qualquer pessoa possa estudar como diferentes setores utilizam o software de código aberto.

Os autores afirmam explicitamente que este é um sistema de classificação norte-americano aplicado globalmente e alertam que, embora os rótulos sejam altamente precisos, eles não são perfeitos para todos os setores (especificamente manufatura e comércio atacadista). Eles também observam que o sistema funciona melhor atualmente com descrições de código em língua inglesa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →