← 最新论文
💬 NLP

Pretraining Language Models on Historical Text

本文介绍了 TypewriterLM,这是一个专门在 1913 年以前的英文文本上训练的 7.24B 参数语言模型,以及与之相关的 54B token 的 TypewriterCorpus、词汇扎根的后训练数据集和 History-Event 基准测试,旨在解决历史语言模型在数据质量、时间泄露和评估方面面临的挑战。

原作者: Xiaoxi Luo, Zachary Shinnick, Niclas Griesshaber, Yixuan Wang, Junchi Yu, Freda Shi, Philip Torr, Yao Lu

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoxi Luo, Zachary Shinnick, Niclas Griesshaber, Yixuan Wang, Junchi Yu, Freda Shi, Philip Torr, Yao Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一名时空旅行者如何像生活在 1912 年的人那样说话和思考。如果你给他一本现代教科书,或者让他浏览互联网,他会无意中学到关于飞机、互联网和爱因斯坦相对论的知识。这样一来,他可能会自信满满地告诉你,所谓的“计算机”(computers)就是你地下室里的那些大机器,而没有意识到在 1912 年,“computer”其实是指从事手工计算的人。

这正是这篇论文作者试图解决的问题。他们构建了一个特殊的 AI,名为 TYPEWRITERLM,它被严格禁止了解 1913 年之后发生的任何事情。

以下是他们实现这一目标的做法,通过简单的类比来解释:

1. “时间胶囊”图书馆(数据)

为了训练这个 AI,研究人员不能使用现代互联网。相反,他们建立了一个庞大的数字图书馆,称为 TYPEWRITERCORPUS

  • 来源: 他们收集了来自 1700 年至 1913 年间的书籍、议会记录、科学论文和法庭笔录中的 540 亿个单词。
  • 清洗: 计算机扫描的旧书经常会出现“故障”(比如出现“由 Google 数字化”或现代页码等字样)。团队充当了严厉的图书管理员,清除了每一个现代痕迹、URL 或时代错误的注释,以确保图书馆是纯粹的历史产物。
  • 结果: 一个代表了第一次世界大战前真实世界的庞大文本库。

2. “严格图书管理员”规则(指令微调)

通常,当我们教 AI 遵循指令时,我们会使用现代示例,或者要求一个超级智能的现代 AI 来编写答案。但那会破坏这位“时空旅行者”的“时代准确性”。

因此,研究人员发明了一种新方法,称为词汇锚定的指令微调(Lexically Grounded Instruction Tuning)

  • 类比: 想象你在玩一个游戏,你必须仅使用特定旧书中的词汇来回答问题。你不能发明新词,也不能使用现代俚语。
  • 过程: 他们创建了两个新的数据集(HISTORY-LIMAHISTORY-SELFINSTRUCT)。对于 AI 被问到的每一个问题,答案都是直接从 1913 年时代的文档文本中构建的。如果源文本中没有“飞机”(airplane)这个词,AI 就不被允许使用它。这确保了 AI 不会无意中将现代知识“泄露”到它的回答中。

3. “惊喜测试”(评估)

你如何知道这个 AI 真的不知道未来?你用一个名为 HISTORY-EVENT 的“惊喜测试”来测试它。

  • 测试: 他们向 AI 展示了一些历史事件的描述。
    • 事件 A: 发生在 1850 年(截止日期之前)。
    • 事件 B: 发生在 1950 年(截止日期之后)。
  • 反应: 他们测量了 AI 在阅读文本时的“惊讶程度”。
    • 当 AI(TYPEWRITERLM)阅读 1950 年的事件时,它表现得非常困惑和惊讶,仿佛从未听说过这些事情。
    • 相比之下,标准的现代 AI(如 Llama)完全没有感到惊讶;它知道这些事实,因为在训练过程中它已经读到了它们。
  • 泄露检查: 他们还检查了 AI 是否意外知道了它不该知道的事实。他们发现,虽然该 AI 非常擅长停留在过去,但仍有极小极小的比例的现代信息“泄露”了进来(不到 1%),这证明了要让一台时光机保持完美密封是多么困难。

4. 结果

  • 时空旅行者: 最终得到的 AI(TYPEWRITERLM)是一个拥有 72.4 亿参数的模型,它说话和推理的方式就像一个 1913 年的人。
  • 对比: 在进行一般逻辑谜题测试时,尽管其训练数据量远少于现代模型,但它在与其他历史 AI 的竞争中表现出了竞争力。
  • 教训: 这篇论文证明,只要你对喂给 AI 的数据以及如何教它回答问题极其谨慎,你就可以构建出一个对未来“盲目”的智能 AI。

简而言之: 作者构建了一台数字时光机。他们只喂给它旧书,教它仅使用这些书中出现的词汇来回答问题,并证明了它确实不知道 1913 年之后发生了什么。这使得历史学家和研究人员能够研究过去,而不必担心 AI 会用现代知识“剧透”情节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →