← 最新论文
🤖 AI

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

本文介绍了 NAICS-GH,这是一个高精度的公开数据集,包含 6,588 个使用 NAICS 2022 行业部门进行标注的 GitHub 仓库,该数据集通过结合 BAAI/bge-large-en 嵌入与 GPT-4.1 的检索并验证流水线构建而成,实现了 96.98% 的人工验证精度,并作为开源创新研究中行业分类的基准。

原作者: Kevin Xu, Alexander Quispe

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Kevin Xu, Alexander Quispe

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将 GitHub 想象成一座巨大的、混乱的图书馆,其中包含了数亿本“书”(代码仓库)。问题在于,虽然图书馆知道每本书的书名,但它没有一套“杜威分类法”来告诉你每本书究竟属于哪种业务或行业。这本书是为银行编写的吗?还是为农场?或者是为游戏工作室?如果没有这些标签,经济学家、政策制定者或公司就很难理解不同行业是如何使用开源软件的。

本论文介绍了 NAICS-GH,这是一个全新的系统,它像一位超级聪明的图书管理员,负责将这些书籍整理进北美行业分类体系(NAICS)——这是美国、加拿大和墨西哥政府使用的标准分类系统。

以下是他们构建该系统的过程,以简单易懂的方式进行解释:

1. “捕鱼网”(检索)

首先,团队无法阅读图书馆里的每一本书(共有超过 130 万个候选对象)。因此,他们使用了一个名为 BGE 嵌入(embeddings)FAASS 的数字捕鱼网。

  • 比喻: 想象你有一个包含 1,000 个特定关键词的列表(例如“作物产量”、“银行安全”或“医院调度”)。你将这些关键词投入图书馆,这张网会瞬间抓取与每个关键词听起来最相似的前 20 本书。
  • 结果: 这张网捕捉到了大约 31,000 个潜在匹配项。它撒了一个大网,以确保不会遗漏任何内容,但也同时抓到了一些“似是而非”的书(听起来很像但并不完全正确的书)。

2. “专家法官”(验证)

由于这张网抓取的范围太广,他们需要一位严格的法官来验证捕获的内容。他们聘请了 GPT-4.1(一种非常先进的 AI)来充当领域专家。

  • 比喻: 把 GPT-4.1 想象成一位资深的检查员。对于网中捕捉到的每一本书,检查员都会阅读封面、摘要和前几页(即仓库的描述和 README 文件)。
  • 评分标准: 检查员不仅仅是靠直觉猜测;他们使用一份严格的清单(“评分量表”)。他们会询问:“这段代码是否真的解决了该特定行业的问题?”
    • 如果答案是明确的“是”,检查员会给出 9 分或 10 分。
    • 如果是“可能”,分数会较低。
    • 如果是一个通用的工具(比如一个基础计算器),得分则会很低。
  • 截断点: 他们只保留了得分在 8 分或以上 的书籍。这确保了他们只保留高置信度的匹配项。

3. 最终收藏(数据集)

在 AI 法官过滤掉弱匹配项后,最后剩下了 6,588 个高质量的仓库

  • 这些仓库分布在 19 个不同的行业 中(如农业、制造业、医疗保健和金融业)。
  • 他们特意剔除了一个类别(“企业管理”),因为没有足够的清晰案例来构成一个可靠的组别。
  • 至关重要的一点是: 他们删除了所有者的名称以保护隐私,仅保留了代码内容和行业标签。

4. 它奏效了吗?(验证)

为了确保 AI 法官没有产生“幻觉”,团队聘请了人类研究助理,对随机抽取的 2,421 本 已标记书籍进行了人工核查。

  • 结果: 人类评审员与 AI 的一致率高达 96.98%
  • 细微差别: 对于像“公共管理”或“艺术与娱乐”这样界限清晰的行业,AI 表现得近乎完美。然而,在处理“制造业”和“批发贸易”等较为棘手的行业时,AI 的表现稍显吃力,因为这些行业的软件有时看起来非常通用。论文指出,如果将评分要求提高到 9 分或 10 分,这些复杂行业的准确率会变得更高。

5. “教学工具”(基准测试)

最后,团队利用这个新的、带有标签的“图书馆”来教导六种不同的 AI 模型如何自主进行代码分类。

  • 他们测试了包括 RoBERTaModernBERTDeBERTa 在内的模型。
  • 优胜者: 一个名为 RoBERTa-large 的模型学得最好,在从未见过的测试集上达到了 86.45% 的准确率
  • 启示: 这证明了只要拥有一个优秀的“带标签图书馆”,你就可以训练更小、更快的 AI 模型来自动完成未来的分类工作。

总结

该论文展示了一个公开可用的数据集,该数据集将 GitHub 代码映射到现实世界的行业。它的构建过程如下:

  1. 撒大网 以寻找潜在匹配。
  2. 使用严格的 AI 法官 根据详细的清单进行验证。
  3. 通过人工双重检查 以确保 97% 的准确率。
  4. 发布数据和代码,以便任何人都可以研究不同行业如何使用开源软件。

作者明确指出,这是一个应用于全球的北美分类系统,并警告说,虽然这些标签高度准确,但并非对每一个行业(特别是制造业和批发业)都完美无缺。他们还指出,该系统目前在处理英文代码描述时效果最好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →