← 최신 논문
🤖 AI

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

이 논문은 BAAI/bge-large-en 임베딩과 GPT-4.1을 결합한 검색 및 검증 파이프라인을 통해 96.98%의 인간 검증 정밀도를 달도한, NAICS 2022 산업 부문으로 라벨링된 6,588개의 GitHub 저장소로 구성된 고정밀 공개 코퍼스인 NAICS-GH를 소개하며, 이는 오픈 소스 혁신 연구의 산업 분류를 위한 벤치마크 역할을 한다.

원저자: Kevin Xu, Alexander Quispe

게시일 2026-07-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kevin Xu, Alexander Quispe

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

GitHub를 수억 권의 책(코드 저장소)이 담긴 거대하고 혼란스러운 도서관이라고 상상해 보십시오. 문제는 이 도서관이 모든 책의 제목은 알고 있지만, 그 책이 실제로 어떤 비즈니스나 산업을 위한 것인지 알려주는 '듀이 십진 분류법'이 없다는 점입니다. 이 코드가 은행을 위한 것일까요? 농장을 위한 것일까요? 아니면 비디오 게임 스튜디오를 위한 것일까요? 이러한 라벨이 없다면, 경제학자, 정책 입안자 또는 기업들이 서로 다른 산업에서 오픈 소스를 어떻게 사용하는지 이해하기 어렵습니다.

이 논문은 이러한 책들을 북미 산업 분류 체계(NAICS)—미국, 캐나다, 멕시코 정부에서 사용하는 표준 분류 시스템—로 정리하는 스마트한 사서 역할을 하는 새로운 시스템인 NAICS-GH를 소개합니다.

이들이 이를 어떻게 구축했는지 쉽게 설명하면 다음과 같습니다.

1. "그물 던지기" (검색/Retrieval)

먼저, 팀은 도서관의 모든 책을 다 읽을 수 없었습니다(후보가 130만 개 이상입니다). 그래서 그들은 **BGE 임베딩(embeddings)**과 FAISS라는 디지털 그물을 사용했습니다.

  • 비유: 여러분에게 1,000개의 특정 키워드(예: "작물 수확량", "은행 보안", "병원 스케줄링") 목록이 있다고 상상해 보십시오. 이 키워드들을 도서관에 던지면, 그물은 각 키워드와 가장 유사하게 들리는 상위 20권의 책을 즉시 낚아챕니다.
  • 결과: 이 그물은 약 31,000개의 잠재적 일치 항목을 잡아냈습니다. 놓치는 것이 없도록 그물을 넓게 던졌지만, 그 과정에서 약간 어긋난 것들(비슷하게 들리지만 정확하지는 않은 책들)도 함께 잡혔습니다.

2. "전문 심판" (검증/Verification)

그물이 너무 느슨했기 때문에, 잡힌 것들을 검증할 엄격한 심판이 필요했습니다. 그들은 매우 발전된 AI인 GPT-4.1을 고용하여 도메인 전문가 역할을 맡겼습니다.

  • 비유: GPT-4.1을 숙련된 검사관이라고 생각하십시오. 검사가 잡은 모든 책에 대해, 검사관은 표지, 요약, 그리고 처음 몇 페이지(저장소의 설명과 README)를 읽습니다.
  • 평가 기준(Rubric): 검사관은 단순히 추측하는 것이 아니라 엄격한 체크리스트를 사용합니다. 그들은 다음과 같이 질문합니다: "이 코드가 실제로 이 특정 산업의 문제를 해결하는가?"
    • 답이 명확한 "예"라면, 검사관은 9점 또는 10점을 줍니다.
    • "글쎄요(Maybe)"라면, 점수는 더 낮아집니다.
    • 만약 누구나 사용하는 기본적인 계산기처럼 범용적인 도구라면, 낮은 점수를 받습니다.
  • 차단 지점: 그들은 점수가 8점 이상인 책들만 남겼습니다. 이를 통해 높은 신뢰도의 일치 항목만을 확보했습니다.

3. 최종 컬렉션 (데이터셋/The Dataset)

AI 심판이 약한 일치 항목들을 걸러낸 후, 6,588개의 고품질 저장소가 남았습니다.

  • 이들은 19개의 서로 다른 산업(농업, 제조업, 의료, 금융 등)에 걸쳐 있습니다.
  • 신뢰할 수 있는 그룹을 만들 만큼 사례가 충분하지 않았기 때문에 "기업 경영(Management of Companies)" 카테고리는 의도적으로 제외했습니다.
  • 중요한 점: 개인정보 보호를 위해 소유자의 이름은 제거하고, 코드 내용과 산업 라벨만 남겼습니다.

4. 효과가 있었는가? (검증/Validation)

AI 심판이 환각 현상(hallucination)을 일으키지 않았는지 확인하기 위해, 팀은 연구 보조원들을 고용하여 무작위로 2,421개의 라벨링된 책을 검사했습니다.

  • 결과: 인간 심판은 AI와 **96.98%**의 일치율을 보였습니다.
  • 미묘한 차이: AI는 "공공 행정"이나 "예술 및 엔터테인먼트"와 같이 명확한 산업에서는 거의 완벽했습니다. 하지만 소프트웨어가 때때로 범용적으로 보일 수 있는 "제조업" 및 "도매업"에서는 조금 더 어려움을 겪었습니다. 논문은 점수 요구 사항을 9점이나 10점으로 높이면, 이러한 까다로운 산업에서의 정확도가 훨씬 더 높아진다고 언급합니다.

5. "학습 도구" (벤치마크/The Teaching Tool)

마지막으로, 팀은 이 새로운 라벨링된 도서관을 사용하여 6가지 서로 다른 AI 모델이 스스로 코드를 분류하는 방법을 가르쳤습니다.

  • 그들은 RoBERTa, ModernBERT, DeBERTa와 같은 모델들을 테스트했습니다.
  • 승자: RoBERTa-large라는 모델이 가장 잘 학습하여, 한 번도 본 적 없는 테스트 세트에서 86.45%의 정확도를 달성했습니다.
  • 시사점: 일단 좋은 "라벨링된 도서관"이 있으면, 미래에 자동 분류 작업을 수행할 수 있는 더 작고 빠른 AI 모델을 훈련할 수 있다는 것을 이 결과는 증명합니다.

요 요약

이 논문은 GitHub 코드를 실제 산업과 연결하는 공개적으로 사용 가능한 데이터셋을 제시합니다. 이는 다음과 같이 구축되었습니다:

  1. 잠재적 일치 항목을 찾기 위해 넓은 그물을 던졌습니다.
  2. 상세한 체크리스트를 바탕으로 검증하기 위해 엄격한 AI 심판을 사용했습니다.
  3. 97%의 정확도를 보장하기 위해 인간이 작업을 재검토했습니다.
  4. 누구나 서로 다른 산업이 오픈 소스를 어떻게 사용하는지 연구할 수 있도록 데이터와 코드를 공개했습니다.

저자들은 이것이 전 세계적으로 적용되는 북미 분류 체계임을 명시하며, 라벨이 매우 정확하지만 모든 산업(특히 제조업 및 도매업)에 완벽하지는 않다고 경고합니다. 또한 현재 시스템은 영어로 된 코드 설명에서 가장 잘 작동한다고 언급합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →