← 最新论文
💬 NLP

Characterizing Narrative Content in Web-scale LLM Pretraining Data

本文引入了一个全新的框架和数据集 NarraDolma,旨在刻画大规模语言模型预训练数据中细粒度的叙事结构,并揭示了叙事特性虽然在可测量范围内存在,但在不同来源和主题之间的分布并不均衡,而当前的清洗实践却忽视了这一点。

原作者: Teagan Johnson, Elliott Ash, Andrew Piper, Maria Antoniak

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Teagan Johnson, Elliott Ash, Andrew Piper, Maria Antoniak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在为一场盛大的派对烘焙一个巨大的蛋糕。食谱要求使用“面粉”,但你不知道手里的究竟是什么样的面粉。是细腻丝滑的蛋糕粉?还是粗糙的全麦粉?还是里面混了沙子?

长期以来,构建“大语言模型”(LLM,即像聊天机器人这样聪明的 AI 大脑)的科学家们,一直在混合他们的“面粉”(用于训练的互联网文本),却并不真正了解其中的具体成分。他们知道有些部分是“有毒的”或“关于数学的”,但对于其中的故事(stories)却知之甚少。

这篇论文就像是一群食品科学家,决定用显微镜去观察那堆巨大的面粉。他们想要回答:其中到底含有多少叙事性,以及它呈现出什么样的形态?

以下是他们调查过程的拆解:

1. 食谱手册(框架)

研究人员并没有仅仅询问“这是一个故事吗?”(是/否)。相反,他们根据人类讲述故事的方式,创建了一个详细的风味轮廓。他们将“叙事”分解为三个主要成分:

  • 行动者(主体性/Agency): 谁在进行动作?我们是在通过他们的眼睛看世界吗?我们能感受到他们的情绪或听到他们的想法吗?(把这想象成故事的“心”)。
  • 舞台(设定/Setting): 这发生在何时何地?是一个模糊的“某处”,还是 1920 年代巴黎的一个尘土飞扬的房间?(把这想象成“背景”)。
  • 情节(事件/Plot): 究竟发生了什么?事情发生了变化吗?是否存在因果链,还是仅仅是一连串的事物清单?(把这想象成“动作”)。

他们将这些转化为了 11 个具体的“旋钮”或滑块,评分范围从 1 到 5。

2. 味觉测试(数据)

他们选取了一个名为 DOLMA 的庞大互联网文本库(规模巨大——拥有 3 万亿个单词,就像一个需要用一生去阅读的图书馆)。

  • 第一步: 他们无法阅读全部内容。因此,他们构建了一个机器人助手(一个名为 NARRABERT 的模型)来协助他们。
  • 第二步: 首先,他们聘请了人类专家阅读 400 个随机片段,并根据那 11 个旋钮进行评分。这就是“金标准”。
  • 第三步: 他们教会了机器人助手模仿人类。
  • 第四步: 机器人处理了 300 万个片段并对它们进行了评分。他们创建了一张新的地图,名为 NARRADOLMA

3. 令人惊讶的发现

当他们观察这张地图时,发现了三件大事:

A. 故事并不是“开”或“关”的关系。
它不像灯的开关那样,一段文本要么是故事,要么不是。它更像是一个调光开关。有些文本非常暗淡(枯燥的事实),有些非常明亮(戏剧性的小说),而大多数则介于两者之间。研究人员发现,“叙事性”在互联网中是一个连续的、多维度的景观,而不是一个简单的类别。

B. “面粉”的混合并不均匀。
如果你认为“Reddit”充满了故事而“维基百科”充满了事实,你大致是对的,但情况更复杂。

  • Reddit 和书籍 就像是一个充满了“内心感受”和“角色思想”的香料架。它们在“行动者”旋钮上的数值很高。
  • 维基百科和新闻 就像是一张地图。它们在“事件”和“时间/地点”上很高,但在“情感”上很低。
  • 旅游和美食博客 就像是一幅画。它们在“感官细节”(气味、视觉)上很高,但在“冲突”上很低。

C. 你不能仅仅通过增加书籍来“增加更多故事”。
研究人员发现,即使在同一个来源(如 Reddit)内部,“叙事性”也会发生剧烈变化。有些 Reddit 帖子是纯粹的戏剧,而另一些只是技术性问题。

  • 隐喻: 想象一下,如果你想让你的蛋糕变得更“蓬松”。你可能会想:“我只要再加点蛋糕粉就好了!”但如果那袋面粉实际上包含了蛋糕粉、沙子和碎石的混合物,那么仅仅增加这袋东西并不能保证蛋糕会变得更蓬松。你需要知道这袋东西里哪一部分才是好的面粉。

4. 为什么这很重要

论文得出结论:构建 AI 模型的人一直将他们的数据源(如“Reddit”或“新闻”)视为同一种类型的叙述者。但事实并非如此。

如果一个 AI 主要接受“新闻”(高事件性、低情感性)的训练,它可能擅长报道事实,但不擅长理解人类情感。如果它主要接受“Reddit”(高情感性、低结构性)的训练,它可能擅长共情,但不擅长逻辑性的因果关系。

底线是:
这篇论文并没有发明一种新的 AI,也没有修复一个损坏的 AI。相反,它构建了一把测量互联网故事的卷尺。它向我们展示了,我们数据中的“故事”部分是混乱、多样且分布不均的。在我们能够教 AI 讲出更好的故事之前,我们必须首先准确了解目前混合在一起的究竟是哪种故事。

研究人员已经发布了他们的测量工具(模型)和地图(数据集),供任何人使用,这样我们以后都能开始烘焙出更好的蛋糕。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →