← 最新论文
💬 NLP

The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora

本文认为,结构化公告的存在而非其特定的记法,是影响预训练语料库中模型行为的关键变量,并据此提出了一种将这些公告分离为可逆侧车(sidecars)的新型数据格式,同时优先考虑能力驱动的格式选择而非保真度维护。

原作者: E. M. Freeburg

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: E. M. Freeburg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

无形的地图与机器人读者

想象一下,你正在教一个机器人阅读。你不是直接把书递给它,而是喂给它海量的、无穷无尽的文本流,并将这些文本切成微小的块,以便机器人学习单词是如何组合在一起的。这就是现代人工智能模型进行训练的方式。但存在一个隐藏的问题:我们准备文本的方式比我们想象的要重要得多。

把一本书想象成一座城市。单词是建筑,而章节标题、页码和“第一章”这样的标题则是街道标志和地图标记。它们告诉你身在何处,以及何时进入了一个新的街区。长期以来,科学家们一直认为,如果他们只是清理文本——移除那些杂乱的格式,使其变成流畅、纯净的单词流——机器人就能学得很好。他们认为这些“标志”仅仅是装饰。但如果这些标志实际上是课程中最重要的一部分呢?如果机器人学习的并不是故事本身,而仅仅是在通过记忆这些标志来预测接下来的内容呢?本论文研究了我们是否在无意中通过剥离故事的地图,从而教会了机器人忽略故事的结构。


伟大的“清理”错误

本文作者 E. M. Freeburg 决定调查一个 AI 训练中奇怪的差距。他们注意到,虽然我们知道使用哪些工具将书籍转化为文本,但我们从未真正测量过这些工具留下了什么。这就像一位厨师确切知道自己用了哪把刀来切蔬菜,却从未检查过蔬菜是依然完整,还是已经被捣成了泥。

为了理解这个问题,作者观察了一本经典著作《白鲸记》。在其原始形式中,这本书有 143 行“家具”——包括章节编号、标题和页眉。如果你删除所有这些内容,就会剩下一个由 283,267 个单词组成的平滑、连续的流。对于人类读者来说,这看起来没问题;你仍然可以跟随故事。但对于机器人来说,这是一个噩梦。机器人习惯于每隔几千个单词看到一个写着“此处为新章节!”的标志。当这个标志消失时,机器人必须仅通过观察单词来猜测故事在哪里发生了变化。这就像是在开车穿过一座所有街道标志都被涂掉的城市。

论文引入了一种新的衡量方法,称为**“洁净窗口生存率”(Clean-Window Survival)**。想象一个宽度为 8,192 个单词的窗口。如果你在文本中滑动这个窗口,“生存率”是指窗口滑动经过的文本段落中,不包含任何结构性标志(如标题或项目符号)部分的百分比。

  • 在著名的 C4 数据集中(一个巨大的网络文本集合),生存率为 0.889。这意味着机器人看到的都是没有路标的长段文本。
  • 在一个由视觉模型转换的 PDF 组成的新数据集中(Dolma 3),生存率降至 0.153。在这里,机器人不断被标志、标题和格式轰炸。

作者发现,这种“稀缺资源”并不是没有标志的文本,而是没有标志的长文本。大多数网络文本是短小且混乱的。但书籍是长篇且连贯的。问题在于,现代 AI 训练正在失去接触这些长篇、无标志文本的机会,取而代之的是那些不断用格式大喊“看我!”的文本。

重大发现:是信号,而非符号

作者运行了一系列聪明的实验,以弄清楚机器人到底在关心什么。他们测试了同一文本的三种不同版本:

  1. 标记版(Marked): 带有完整格式的文本(例如 ## 第一章)。
  2. 扁平版(Flat): 移除了格式符号但保留了单词的文本(例如,仅仅是“第一章”这几个字单独占一行)。
  3. 静默版(Silent): 将“第一章”这一行完全删除,留下空白空间。

以下是令人惊讶的结果:机器人并不在乎符号。
当他们把花哨的 ## 换成普通的文本行时,机器人的表现没有任何变化。无论标志是井号还是仅仅是一个句子,机器人都觉得没问题。

然而,当他们完全删除这一行(“静默版”)时,机器人变得困惑了。预测下一个单词变得明显更加困难。机器人需要那个小小的“公告”行来知道一个新章节正在开始。

这导致了一个重大的认知:机器人学习的不是标志的风格(Markdown 符号);它学习的是公告的存在本身。标志作为一个线索,在说:“停下你正在做的事;这里有一个新的边界。”如果你移除这个标志,机器人就必须付出更多努力来自行推断结构。

“纯框架”解决方案

作者提出了一种新的数据准备方法,称为**“纯框架”(Pure Frame)**。
想象你有一本书。你保留所有段落的正确顺序。但你删除了每一个章节标题、页眉和“第一部分”标签。你用“无”来替换它们——仅仅是一个空白行。

  • 为什么要这样做? 为了强迫机器人从故事本身去推断结构,而不是仅仅阅读路标。
  • 这安全吗? 是的。作者创建了一个“侧边栏”文件来保存每一个被删除的行。这意味着你可以完美地重建原始书籍。这是可逆的。

他们在 27 本公有领域书籍上进行了测试。“纯框架”版本比原始版本少了 0.713% 的 Token,因为他们删除了页眉。但更重要的是,“洁净窗口生存率”跃升至 1.000。这意味着机器人现在被迫在一个长而连续的思想流中航行,而这正是作者认为它需要更好地学习的东西。

机器人不会做的事

论文还检查了机器人是否会“修复”文本。如果你给机器人一个没有章节标题的故事,它会开始把标题写回来吗?

  • 答案是: 不会。
    当研究人员要求基础模型(未经微调的原始机器人)在删除章节标题后继续写作时,它们并没有把标题补回去。它们甚至没有尝试重建结构。它们只是继续写作。这表明,看到页眉的习惯是我们给予它们的,而不是它们自然创造出来的。

结论:选择你想教的东西

论文为 AI 训练的未来提出了一个大胆的建议。目前,数据科学家根据**保真度(Fidelity)来选择工具——即工具如何完美地保留原始文档的外观。作者认为,我们应该根据能力(Capability)**来选择工具——即我们希望机器人学习哪些特定技能。

如果我们想要能够理解长篇复杂故事的机器人,我们应该停止喂给它们那些不断用格式大喊“新章节!”的文本。相反,我们应该喂给它们“纯框架”——干净、连贯的文本,强迫它们自己去做理清故事结构这项艰苦的工作。

作者承认这是一个需要最后一次昂贵测试的假设:在这一新格式上训练一个机器人,看看它是否真的变得更聪明。但目前的证据表明,我们添加的这些“路标”可能弊大于利,它们充当了防止机器人学会独立行走的拐杖。

简而言之: 论文认为,通过剥离书籍结构的视觉“标志”,我们实际上可能在更好地教 AI 理解故事,而不是仅仅让它死记硬背目录。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →