Register Always Matters: Analysis of LLM Pretraining Data Through the Lens of Language Variation
本研究证明,预训练数据的语言语域显著影响大语言模型的性能,揭示出虽然新闻文本并非最优,但纳入观点、操作指南和信息性描述等语域可显著提升模型能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个年幼的孩子说话和理解世界。你拥有一个庞大的图书馆,但你决定不是随意地递给他们一堆书,而是按体裁对书籍进行分类:有些是食谱,有些是新闻报道,有些是歌词,有些是充满观点的博客文章,还有些是科学教科书。
这篇论文提出了一个简单却深刻的问题:你用来教孩子的“哪类书”重要吗?
大多数构建人工智能(大语言模型)的人认为“数据越多越好”,并且认为只要过滤掉“坏”内容(如垃圾邮件或仇恨言论),其余部分就同样优秀。这项研究却说:不,文本的“风味”至关重要。
以下是他们研究发现的日常类比解析:
1. “单一体裁”实验
研究人员构建了几个小型人工智能模型。每个模型在其整个训练过程中仅接受一种类型(一种“语域”)的文本。
- “食谱”模型:仅接受“操作指南”类文本训练。
- “新闻”模型:仅接受新闻文章训练。
- “歌词”模型:仅接受歌词训练。
- “观点”模型:仅接受评论和博客文章训练。
令人惊讶的是:
- “新闻”模型令人失望。 你可能会认为阅读新闻能让人变聪明,但仅接受新闻训练的模型表现相当差。这就像一个只读每日头条却从未学习如何解决问题或理解深层概念的学生。
- “观点”模型是明星。 这是最大的冲击。充满观点、评论和辩论的文本(如 Yelp 评论或政治博客)使模型表现极其出色。看来,学习如何辩论、说服和表达观点是人工智能的一项秘密超能力。
- “歌词”模型表现挣扎。 由于他们使用的测试涉及逻辑和事实,仅接受诗歌和歌曲训练的模型不知道如何回答这些问题。(作者指出,这并不意味着诗歌无用,只是它对这些特定测试没有帮助。)
2. “混合搭配”的突破
随后,研究人员尝试将表现最佳的体裁混合在一起。他们不是把所有东西扔进搅拌机,而是精心挑选了优胜者。
- 获胜配方:他们发现,结合操作指南、信息性描述(如维基百科)和观点,创造出的模型比在“整个混乱的互联网”上训练的模型更聪明。
- “新闻”和“聊天”的陷阱:当他们在混合中加入新闻或“互动讨论”(如论坛聊天)时,模型在这些测试中的表现反而变差了。这就像在汤里加了太多水;它稀释了原本有效的风味。
3. 专业化超能力
该研究还表明,不同的体裁教会了人工智能不同的“肌肉”:
- 操作指南使人工智能在物理推理方面表现出色(例如,“如果我打碎一个玻璃杯,它会碎吗?”),但在通用常识问答方面表现糟糕。
- 叙事/讲故事使人工智能在理解社会情境方面更好,但在回答科学问题方面更差。
- 观点提升了人工智能理解常识和社会互动的能力。
核心结论
作者得出结论:语域始终重要。
将预训练数据想象成饮食。你不能只吃一般的“食物”;你需要特定混合的营养素。
- 如果你只吃“新闻”,你的人工智能会变得有点无聊且缺乏创造力。
- 如果你只吃“歌词”,你的人工智能会变得富有诗意,但无法做数学题。
- 如果你混合指南(事物如何运作)、描述(事物是什么)和观点(人们对事物的感受),你就能得到一个全面发展、高性能的人工智能。
这对未来的意义(根据该论文):
与其仅仅试图从互联网上抓取更多数据,我们更应该谨慎选择何种类型的数据。通过理解文本的“体裁”,我们可以用更少的浪费构建更好的人工智能模型,而不是仅仅指望一堆更大的随机文本最终会起作用。
注:作者强调,这项研究是在小型模型上进行的,以测试这些理论。他们未在现实世界的医疗建议、法律建议或其他高风险应用中测试这些模型,因此我们尚不知道这些特定的“饮食”在这些复杂、现实世界的场景中会表现如何。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。