← 最新论文
💻 computer science

Beyond the pale: Assessing prevalence and contents of extremist speech in LLM training data

本文调查了 Dolma 训练语料库中极端言论的流行情况,揭示了其中可能包含数十万份含有仇恨言论和暴力煽动的内容文档,从而凸显了对数据策展和大型语言模型(LLM)安全性的关键影响。

原作者: Dmitry Nikolaev, Ashley A. Mattheis

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Dmitry Nikolaev, Ashley A. Mattheis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是当今许多人工智能工具背后的引擎,从回答问题的聊天机器人到辅助编写代码的系统。这些机器并非通过在教室里学习规则来学习;相反,它们通过阅读来自互联网、书籍和其他数字来源的海量文本来进行学习。这个过程被称为训练。为了让一个模型变得流利且博学,它必须“吞噬”一个规模庞大的文本库,其容量之大,人类即便用一生去阅读也无法完成。研究人员长期以来一直关注如何构建这些模型,以及如何在初始学习之后对其进行微调,以确保其安全且有用。然而,一个关键的问题一直未被充分探讨:模型最初阅读的究竟是哪种类型的材料?如果训练库中包含了有害、仇恨或危险的思想,模型就可能会学会重复这些内容,即使其创造者随后试图教导它更好的行为方式。这不仅仅是一个技术故障,更是一个公共安全问题,因为这些系统正越来越多地被包括儿童在内的各年龄段人群使用,而他们可能会在毫无预警的情况下接触到危险的观点。

曼彻斯特大学的一个研究小组着手调查了一个对科学界而言最重要的开源文本集之一的训练数据内容。这个被称为 Dolma 的集合,是名为 OLMo 的一系列先进语言模型的基础。研究人员想要了解这个庞大的图书馆是否包含极端主义言论——即那些宣扬暴力、仇视或推翻民主制度的文本。为了回答这个问题,他们并没有仅仅靠猜测或依赖单一的计算机程序。相反,他们建立了一个细致的多步骤流程来寻找这些文档。他们首先从 Dolma 集合中抽取了 20 万份文档的随机样本,这代表了该模型所训练的 3 万亿个单词中一个极小但具有统计意义的切片。随后,他们使用几种不同的计算机模型来扫描这些文档,要求每个模型识别符合特定极端主义定义的文本。这些定义来自于英国政府的官方指南以及研究恐怖主义和政治暴力的学术专家。

该流程的设计非常保守,这意味着研究人员在将某物标记为极端主义之前,力求做到万无一失。他们使用了一种称为“并集检查”(union check)的技术,即如果某个文档符合任何一种不同的极端主义定义,他们就会要求计算机模型将其标记出来。这有助于确保模型正确理解了任务。一旦计算机标记了潜在的匹配项,研究人员就会对其进行进一步的审查。他们使用了一个更强大的人工智能系统来过滤掉误报,最后,他们引入了一位专门研究极端主义言论的人类专家,对标记出的文本样本进行仔细阅读。这种人工审查至关重要,因为现实世界中的文本往往非常杂乱,充满了隐晦的代码语言,或者以机器难以解读的方式编写。专家通过阅读这些文档,来确认它们是否真的包含了研究人员正在寻找的危险叙事。

这项调查的结果清晰且令人担忧。研究人员发现,Dolma 训练集几乎肯定包含了数十万份具有极端主义内容的文档。根据他们的保守估计,他们计算出在随机样本中,大约每 2000 份文档中就有一份包含极端主义叙事或仇恨言论。当他们将这一比例投射回整个数据集(由数十亿份文档组成)时,数据指向了一个巨大的有害材料库。该研究识别了多种类型的危险内容,包括直接的暴力煽动、针对特定种族或宗教群体的仇恨言论,以及旨在破坏民主制度的叙事。有趣的是,研究人员发现,用于搜索数据的特定极端主义定义会改变结果。其中一种定义侧重于“内群体”与“外群体”之间的冲突,其覆盖范围非常广泛,捕捉到了许多虽然带有仇恨色彩但在政治意义上并不一定属于极端主义的文本。另一种基于政府官方标准的定义则更为精确,但仍然识别出了大量的有害材料。

一个显著的发现是样本中缺失了某种特定类型的极端主义。尽管互联网具有全球性,但研究人员在样本中几乎没有发现与圣战恐怖主义相关的文本,仅出现了一篇关于此类事件的新闻报道。这表明,针对恐怖组织的严格监管和企业政策可能已经成功地从喂养这些模型的公共数据集中移除了这类特定内容。然而,研究发现右翼极端主义叙事更为普遍,常以政治博客、论坛评论和阴谋论的形式出现。研究人员还注意到,他们发现的许多内容属于“边缘性”内容——即高度两极分化、暴力或充满仇恨,但并不总是符合严格的极端主义法律定义。这种灰色地带尤其危险,因为其更难被过滤,但仍能让模型吸收并使极端观点常态化。

这些发现的影响超出了构建模型的技术细节本身。研究人员认为,仅仅试图在模型学习完这些数据后再去修复模型是无法解决问题的。如果一个模型记住了数千份呼吁暴力或宣扬仇恨的文档,那么即使经过额外的安全训练,它也可能难以“忘掉”这些模式。这项研究强调,训练数据的构成是一个根本性问题,需要构建这些系统的人员给予紧迫关注。仅仅关注模型发布后的行为是不够的;最终产品的安全性很大程度上取决于在初始学习阶段喂给它的内容。研究人员总结道,需要针对哪些类型的内容可以被纳入人工智能训练库进行更广泛的讨论,尤其是当这些库被用于创建与公众日常互动的工具时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →