← 最新论文
💬 NLP

From 124 Million Tokens to 1,021 Neologisms: A Large-Scale Pipeline for Automatic Neologism Detection

本文提出了一种可扩展的模块化流程,结合基于规则的过滤与大语言模型分类,处理了 5.27 亿篇 Reddit 帖子,成功将 1.246 亿个独特词元缩减至 1,021 个新词候选项,其中 58.7% 经人工验证确认为真正的词汇创新。

原作者: Diego Rossini, Lonneke van der Plas

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Diego Rossini, Lonneke van der Plas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一座藏有5.27 亿本书(2005 年至 2024 年的 Reddit 帖子)的图书馆。在这座文字大山中,散布着几千个人们刚刚发明出来的全新词汇。你的目标就是找到它们。

如果你试图阅读图书馆里的每一个单词来寻找新词,那你余生都将忙于此事。你找到的大多数“奇怪”单词并非新发明;它们只是拼写错误、人们未加空格将两个单词连在一起打字,或是来自其他语言的词汇。

本文描述了一种智能的多阶段过滤器,旨在从这座文字大山中筛选出内容,并交给你一个微小且可管理的“嫌疑人”堆,这些才是真正的新词。

以下是该流程逐步的工作原理:

1. 巨型筛子(基于规则的过滤)

将第一阶段想象成一系列巨型筛子。你将 1.24 亿个独特单词逐一倒入这些筛子中。

  • “旧词”筛子:如果一个单词在 2015 年之前就已存在于词典中,它就会被丢弃。我们只关心新东西。
  • “胡言乱语”筛子:如果一个单词看起来像是键盘乱按(例如"asdfgh")、拼写错误,或是一串重复的字母,它就会被扔掉。
  • “粘合”筛子:如果两个单词在没有空格的情况下粘在了一起(如"datingapp"),系统会尝试将它们分开。如果它们只是错误,就会被扔进垃圾桶。
  • “外语”筛子:如果系统认为一个单词是西班牙语或他加禄语,它会被搁置一旁(尽管一些棘手的双语混合词可能会漏网)。

结果:这一阶段效率极高。它丢弃了99.99%的单词。它将 1.24 亿个候选词缩减至约17.5 万个潜在新词。

2. 法官团(大语言模型分类)

现在我们有 17.5 万个嫌疑人。我们还无法手动阅读所有单词,因此我们请一个由四位不同 AI“法官”(大语言模型)组成的陪审团来审视每一个单词。

  • 法官们被要求将每个单词归入以下四个类别之一:
    1. 新造词:真正的新词(例如"doomscrolling")。
    2. 实体:人名、品牌或地名(例如"Elon")。
    3. 外语:来自其他语言的单词。
    4. :仅仅是拼写错误、用户名或垃圾内容。
  • 投票系统:为了避免某个 AI 过于懒惰或过于疯狂,它们进行投票。如果多数意见认为某个单词是“新造词”,它就会进入下一轮。如果意见不一,为了安全起见,该单词通常会被丢弃。

3. 最终检查员(验证)

即使在 AI 陪审团投票之后,仍有约 10,000 个“新造词”候选者。这对人类来说仍然太多,无法快速检查。
因此,一位最终、极其严格的 AI 法官(Claude)再次审视这份名单。这位法官非常保守。它表示:“如果我不 100% 确定这是一个新词,我就将其标记为‘无’。”

  • 这一步将名单从 10,000 个缩减至仅1,021个候选者。

最终揭晓

研究人员随后手动检查了这最终的1,021个单词。

  • 好消息:其中58.7%(599 个单词)是真正的新发明!
  • 坏消息:其余的要么是事物名称(实体),要么是漏网的外语单词,或者仅仅是错误。

他们发现了什么样的新词?

该研究发现,新词主要通过两种方式创造:

  1. “守规者”:人们在现有单词上添加前缀或后缀(例如在"woke"后添加"-ism"构成"wokeism")。
  2. “破规者”:人们为了好玩将单词拼接或修改(例如将"Barbie"和"Oppenheimer"融合成"Barbenheimer",或将"thick"改为"thiccest"以示强调)。

这为何重要

该论文的主要成就不仅仅是找到这些单词;而是压缩。他们将一项人类无法完成的任务(阅读 1.24 亿个单词)压缩成一项人类可以在一天内完成的任务(检查 1,021 个单词)。

该论文没有做到的是

  • 它不预测语言的未来。
  • 它不为用户修复拼写错误。
  • 它不适用于短语(如"touch grass")(它只寻找单个单词)。
  • 它无法捕捉那些含义改变但拼写保持不变的单词(例如"Karen"变成俚语侮辱),因为系统认为"Karen"只是一个旧名字。

简而言之,这是一台高效的淘金机器。它在巨大的数字尘土山中进行挖掘,过滤掉岩石和尘土,并交给你一小桶金块(新词),这些金块已准备好供人类专家进行打磨。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →