← 最新论文
💬 NLP

Building a Custom Taxonomy of AI Skills and Tasks from the Ground Up with Job Postings

本文介绍了 TaxonomyBuilder,这是一个框架,它表明在利用大语言模型增强的聚类工具处理之前先对职位发布数据进行过滤,能够生成比直接使用未过滤语料库更清晰、更具领域针对性的 AI 技能分类体系。

原作者: Stephen Meisenbacher, Peter Norlander

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Stephen Meisenbacher, Peter Norlander

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图整理一座庞大而混乱的图书馆,馆内藏有数百万本关于人工智能(AI)的书籍。你的目标是创建一张清晰、易读的地图(即分类法),帮助人们精准找到他们所需的内容:特定的 AI 技能与任务。

本文的作者 Stephen Meisenbacher 和 Peter Norlander 构建了一个名为TAXONOMYBUILDER的新工具,以自动完成这项工作。他们利用来自美国劳动力市场的两堆海量真实数据——数百万份招聘启事——对该工具进行了测试。

以下是他们发现的简要故事:

问题:“越多越好”的陷阱

通常,当人们试图整理一团巨大的混乱时,他们的本能是将所有内容都混入其中。他们会想:“如果我纳入更多的招聘启事,我的地图就会更完整。”他们甚至可能尝试复制粘贴相似的句子,使数据堆变得更大(这一过程称为数据增强)。

作者们问道:这真的有帮助吗?还是仅仅让图书馆变得更加混乱?

实验:用不同食材烹饪

为了找到答案,他们使用 TAXONOMYBUILDER 工具进行了 24 项不同的实验。他们改变了食谱中的三种主要“食材”:

  1. 数据增强(增加数量):他们是否在混合数据中添加了额外的相似句子,以使数据集更大?
  2. 过滤(去除噪声):他们是否丢弃了“最弱”或最模糊的职位描述,仅保留最清晰的 25%、50% 或 75%?
  3. 软聚类(模糊分组):他们是否为了保险起见,强行将那些不太符合任何分组的“嘈杂”项目纳入其中?

大惊喜:少即是多

结果出乎意料。团队发现,添加更多数据实际上使地图变得更差

  • “增强”的失误:当他们添加额外数据以扩大数据堆时,生成的地图变得混乱且准确性降低。这就像试图通过添加更多仅仅是同一故事略有不同版本的书籍来整理图书馆;结果只是制造了杂乱。
  • “过滤”的胜利:最好的地图是在他们严格筛选时创建的。他们丢弃了模糊、低质量的职位描述(仅保留最佳数据的 75% 或 50%)。通过去除“噪声”,AI 能够更清晰地看到明显的模式。
  • “软聚类”的细微差别:只有在最初没有添加额外数据的情况下,强行将杂乱项目归入分组才有帮助。如果添加了额外数据,强行纳入杂乱项目反而会使情况恶化。

类比:淘金测试

想象你在一条巨大的河流(招聘启事)中淘金(AI 技能)。

  • 旧方法:你舀起你能找到的每一桶水、泥浆和岩石,希望能获得更多黄金。结果你得到了一大堆泥泞的混合物,根本无法从中看到黄金。
  • 新方法(TAXONOMYBUILDER 的发现):你首先仔细筛分水流。你丢弃那些泥泞、无用的桶(过滤)。你只保留那些看起来有希望的桶。然后,你淘洗这些桶。最终你得到了一堆更小的物质,但它是纯金

结论

该论文得出结论:当从海量文本中构建复杂技能的地图时,质量胜过数量

  • 不要试图包含你能找到的每一个数据片段。
  • 有选择性。过滤掉薄弱或嘈杂的信息。
  • 让 AI 专注于清晰、高质量的示例,以构建一张真正有用且易于理解的地图。

简而言之:如果你想要一张清晰的 AI 就业市场地图,你不需要阅读现存的所有招聘启事。你只需要仔细研读最好的那些即可。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →