CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data
本文介绍了 CuraWeb,这是一个通过一个平衡质量、冗余度和多样性的联合优化框架构建而成的 2T token 英文语料库,旨在克服单一目标策选的局限性,从而实现更全面的数据分布,并显著提升大语言模型在知识密集型和推理任务上的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人如何理解世界。为了实现这个目标,你不仅仅是给它几本教科书,而是把整个互联网都倾倒进它的脑子里。这就是现代人工智能(AI)学习的方式。科学家们称之为“预训练”。机器人阅读了来自网站、新闻文章和论坛的数十亿个句子,以此来学习人类如何说话、思考以及解决问题。但问题在于:互联网是混乱的。它充满了垃圾信息、复制粘贴的废话和重复的广告。如果你给机器人喂食“垃圾食品”,它会生病,无法清晰地思考。因此,研究人员必须扮演严格的营养师,过滤掉坏的东西,只保留高质量、多样化且有趣的信息。他们一直苦苦思索的大问题是:如何在清理互联网的同时,不会意外地丢弃那些让机器人真正变得聪明的稀有、古怪且卓越的思想?
于是,由美团研究人员提出的新项目 CuraWeb 应运而生,它试图解决这个混乱的问题。把之前的方法想象成使用一个巨大的、粗糙的筛子去过滤沙子。如果你用力摇晃筛子,也会把金块连同泥土一起丢掉。旧的数据清洗方式就像那样:它使用简单的规则来过滤“糟糕”的文本,但在这样做时,往往会将复杂的数学、编程和科学文章也一并扔掉,因为它们看起来很“奇怪”。CuraWeb 团队意识到,要构建一个真正卓越的 AI,你需要一种更细腻的方法。他们不仅想清洗数据,还想像博物馆馆长一样进行策展,确保收藏品是高质量的、不重复的,并且涵盖了人类知识的每一个角落。
“一刀切”式筛子的弊端
长期以来,准备 AI 数据的标准方式有点像工厂的流水线。首先,你让文本通过一个基于规则的过滤器(比如检查页面是否包含过多的数字或奇怪的符号)。然后,你通过一个模型来猜测文本是否“好”。最后,你去除重复项。作者发现,问题的关键在于这种流水线对所有主题都一视同 la。这就像一个图书管理员,因为书名太长或词汇太复杂就决定把书扔掉,因为它看起来很“凌乱”。
事实上,一本数学教科书或一本编程手册与一篇随性的博客文章相比,确实是“凌乱”的。它拥有公式、符号和特殊的格式。旧的过滤器将这些视为错误并将其删除。这意味着 AI 失去了从那些使其变得聪明的知识中学习的机会:即复杂的推理和专业知识。旧方法还倾向于创造一种“同质化”的饮食,导致 AI 只阅读娱乐或购物等热门话题,而错失了在科学、法律和分众爱好领域中发现的“长尾知识”。
CuraWeb 解决方案:智能多轨厨房
CuraWeb 团队提出了一种新的“烹饪”数据的方法,将单一、粗糙的过滤器转变为对三项指标的联合优化:质量(它好吗?)、冗余度(它是副本吗?)以及多样性(它是独特的吗?)。他们构建了一个框架,就像一支各司其职的专家厨师团队,共同协作,为 AI 准备一场 2 万亿 token 的饕餮盛宴。
1. 定制化筛子(领域感知过滤)
CuraWeb 不再对所有内容使用同一套规则,而是使用一个知道博客文章与数学题区别的“智能筛子”。
- 旧方法: 如果一个文档包含太多符号(如
+、-、=),旧规则会认为它是垃圾并将其删除。 - CuraWay: 他们意识到,对于数学和代码来说,这些符号是必不可少的。因此,他们创建了一个“优先级旁路”。如果系统检测到文档是关于数学、科学或编程的,它会跳过严格的“禁止符号”规则。它允许这些复杂的文档进入下一阶段,确保 AI 不会失去进行微积分运算或编写代码的能力。他们还优化了规则,使其不再那么激进,从而保留了更多以往过滤器会丢弃的有用的知识片段。
2. “软性”重复检测器
想象你有一个图书馆,有人一直在不停地打印同一份表格,只是修改了上面的名字。一个简单的扫描仪可能会漏掉这些,因为文本并不完全相同。
- 旧方法: 旧系统使用“硬阈值”。如果两个文档看起来 95% 相似,就会删除其中一个。但这很危险。在专业领域,专家经常使用相同的技术术语,这使得他们的写作看起来非常相似,即使他们表达的内容不同。硬性删除会抹杀掉这些宝贵且独特的见解。
- CuraWay: 他们引入了一种**软语义去重(Soft Semantic Deduplication)**策略。他们不是在文档看起来相似时立即删除它,而是使用一套“投票系统”。他们从多个角度检查文档的相似度。如果一个文档真的非常相似(比如纯粹的复制粘贴),它会受到重罚。但如果它仅仅是因为讨论同一个技术话题而显得相似,它受到的惩罚就会较轻。只有当“惩罚分数”过高时,文档才会被删除。这就像一位图书管理员,不会仅仅因为一本书的主题与另一本相同就扔掉它;只有当它真的是同一个故事时,他才会扔掉它。这种方法在最棘手的情况下,将误删率(即扔掉好东西)从 37.5% 降低到了 28.03%。
3. 智能采样器(幂律采样)
一旦数据清洗完毕,你就必须决定实际喂给机器人的内容。你不能喂给它所有东西,所以你必须挑选最好的。
- 旧方法: 一些系统只是随机挑选高质量文档。另一些系统试图平衡质量与多样性,但往往得到的是一种平庸的混合物。
- CuraWay: 他们创建了一种幂律采样(Power Sampling)方法。想象一场抽奖,最有价值、最有趣的文档(如深度科学论文或巧妙的推理任务)拥有的彩票号码非常多,因此被抽中的概率大大增加。他们根据两点对文档进行评分:写作质量(写得好吗?)和内容价值(它是否教授了新知识?)。他们结合这些分数,并使用“幂函数”来放大那些优秀的文档。这意味着 AI 获得的饮食是富含高价值、多样化知识的,而不是仅仅充斥着大量平庸的内容。
结果:一个更聪明的机器人
研究人员通过在其开发的 30 亿参数 AI 模型上测试了他们的新数据集 CURAWEB。他们将该模型与在 FineWeb-Edu 和 DCLM 等著名数据集上训练的模型进行了对比。
结果显而易见:CuraWeb 表现更好。
- 整体性能: 在 10 个不同的基准测试中,基于 CuraWeb 训练的模型平均得分达到 48.07%,超过了之前的最优水平(DCLM)1.82%。
- 推理与知识: 在需要深度思考的任务中,提升最为显著。在名为 GSM8K 的数学测试中,CuraWeb 模型比排名第二的模型高出了 4.39%。在通用知识测试(MMLU)中,它提升了 6.61%。
- “专家效应”: 研究表明,虽然一些旧数据集在特定领域(如教科书)表现出色,但在其他领域表现较差,但 CuraWeb 在各方面都很强。它并没有以牺牲一种技能来换取另一种技能,而是提升了机器人进行推理和理解复杂话题的能力,同时没有丧失其通用的智能。
为什么这很重要
论文指出,AI 的未来不仅仅在于喂给它更多的数据,而在于喂给它更好的数据。过去那种“清洗”数据的做法往往意味着通过移除任何看起来不像标准句子的内容来使数据“降智”。CuraWeb 表明,通过在过滤、去重和选择数据方面变得更加聪明,我们可以构建出不仅更准确,而且更擅长处理人类所关心的那些困难、创造性和专业化任务的 AI 模型。
简而言之,作者们不仅找到了一种更好的清洗互联网的方法,还找到了一种保留其灵魂——即那些使我们成为人类的奇特、复杂且卓越的部分——并将其传递给机器的方法。他们的实验表明,如果你细心对待数据,尊重其多样性和复杂性,AI 学习得会更快,思考得也会更深。这提醒我们,在人工智能的竞赛中,食材的质量与锅的大小同样重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。