← 最新论文
💬 NLP

UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing

UltraX 是一个函数调用框架,它通过引入具有插入、删除和修改能力的自适应程序化编辑,增强了大规模预训练数据的精炼,从而克服了现有基于规则和基于大语言模型方法的效率与可靠性局限,以实现卓越的数据效率和模型性能。

原作者: Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个超级聪明的机器人如何说人类语言。长期以来,秘诀一直在于更多的数据。你会把成堆的书籍、网站和文章投喂给机器人,希望它能通过 sheer volume(单纯的数量)来学习一切。但现在,我们撞到了墙。我们几乎已经抓取了互联网上所有有用的文本。这种“越多越好”的规则开始失效,就像电池电量耗尽一样。

那么,我们该怎么办?我们停止囤积,开始清洗

由此诞生了 UltraX,这是一个全新的工具,旨在充当机器人训练书籍的微观、超高速编辑师。但这里的转折在于:它并不只是删除坏句子或重写整个段落(这既慢又冒险),而是使用了一个巧妙的技巧,叫做函数调用(function calling)

“乐高大师” vs. “拆迁队”

把旧有的数据清洗方式想象成一支拆迁队。

  • 基于规则的方法就像是拿着锤子和清单的工人。它们会砸碎任何看起来像广告或奇怪符号的东西。但它们很笨拙;有时仅仅因为某个东西看起来像一堆砖头,就会把它砸掉一座美丽的雕塑(有价值的信息)。
  • 大型 AI 编辑器则像是艺术家,它们会为了让故事完美而重写整个故事。但它们既慢又贵,而且有时会把情节改得面目全非。

UltraX 则不同。它像是一位拥有特定工具集的乐高大师。它不会重写整本书,而是给机器人一份精简的指令列表:

  1. 删除这一行垃圾信息(比如广告)。
  2. 替换这个奇怪的错别字为正确的单词。
  3. 插入一段在混乱中丢失的缺失信息。

论文明确反对那种认为需要重写整个文本才能修复它的观点。它表明,仅仅删除东西(像其他工具那样)是不够的,因为你可能会误删好东西。它还指出,尝试生成整个新段落对于训练这些机器人所需的庞大规模数据来说,既太慢也不够可靠。UltraX 证明了,精准的、外科手术式的编辑才是关键。

它如何运作:“食谱”与“厨师”

这个过程分为两个主要阶段:

第一幕:训练(教导厨师)
首先,研究人员需要教会他们的小型“精炼”模型如何成为一名优秀的编辑。他们并没有靠直觉瞎猜,而是使用了一个“聪明厨师”(一个强大的 AI)来为混乱的网页编写完美的、干净的版本。然后,他们使用一种特殊的映射技巧,将这些干净的版本转化为一套指令的食谱(例如“删除第 5 行”、“修复第 12 个词”)。他们过滤掉了混乱的食谱,并教会他们的小模型完美地执行这些指令。

第二幕:清洗(规模化)
现在,他们带着这个训练好的“精炼师”去处理数十亿个网页。它阅读一段文本,预测出修复它所需的精确指令列表,然后由一个计算机程序瞬间执行这些动作。因为模型只需要输出一段简短的命令列表(如“删除第 3 行”)而不是写出一个全新的故事,所以它速度极快且不会疲劳。

结果:更快、更聪明、更高效

研究人员通过从头开始训练一个 10 亿参数的机器人,并使用不同类型的清洗后数据进行了测试。以下是他们的发现:

  • 更高的分数: 在一项包含 10 种不同技能(如回答科学问题或理解笑话)的测试中,使用 UltraX 数据训练的机器人得分高于使用原始数据或被其他方法清洗后的数据训练的机器人。事实上,在他们尝试的所有五种不同类型的互联网数据中,UltraX 都是表现最好的。
  • “2%”的提升: 在多个数据集上,UltraX 带来了超过 2% 的相对提升。在 AI 领域,这是一个巨大的飞跃。
  • 事半功倍: 这是最酷的部分。使用 UltraX 训练的机器人使用更少的训练 token(更少的单词)就达到了同样的高性能水平。这表明 UltraX 让数据中的有用信息变得更加“稠密”,从而让机器人学得更快。

他们没做的事(以及他们不确定的地方)

了解这些局限性很重要。这篇论文并不声称这能永远解决所有问题。

  • 他们只在英语网络数据上进行了测试。他们承认尚未在中文或其他语言上进行测试,在这些语言中,“噪声”的外观可能完全不同。
  • 他们训练的是一个 10 亿参数的模型。他们尚未证明这种方法是否以同样的方式适用于即将到来的、规模达万亿参数的巨型模型。
  • 他们暗示收益来自于在去除噪声与保留好信息之间取得平衡,但他们并未声称自己拥有针对每一种互联网混乱情况的完美公式。

底线

UltraX 表明,教导 AI 的未来不在于寻找更多的数据,而在于更聪明地利用我们现有的数据。通过使用一种基于指令的、精确的、可以删除、修复和插入特定文本的部分,它比旧方法更快、更好地清理了机器人的图书馆。这是一种从“把所有东西都扔向墙壁”到“外科手术式地移除垃圾”的转变,而结果表明,一点点聪明的清洗就能产生巨大的影响。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →