Epiplexity Guided Data Selection and Generation for Out-of-Distribution Generalization
本文提出了一种通过将“复性”(epiplexity)——一种可提取结构信息的度量——作为一种自适应信号,用于选择自然数据领域并指导合成数据生成,从而最大化所学表示的可迁移性,以此来提升分布外泛化能力的框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人理解世界。长期以来,科学家们认为教导机器人的最佳方式是向它喂入尽可能多的数据,希望它最终能自行领悟。但现在,我们正面临着“真实”数据枯竭的困境。我们正撞上一堵墙:机器人几乎已经读遍了互联网上的所有内容,但当被要求做一些它从未见过的任务时(比如解开一种新型谜题或理解一个奇怪的笑话),它仍然显得力不从心。这就是“分布外”(Out-of-Distribution)泛化问题:如何让一个智能系统在面对全新的、未预见的场景时依然能够游刃有余?
为了解决这个问题,我们需要重新思考该给机器人喂食什么。这不仅仅是关于数量,更是关于信息的“风味”。把数据想象成食物:如果你只给机器人喂白米饭(简单、重复的数据),它会吃饱,但学不到任何新东西;如果你只给它喂纯粹的噪音(收音机的静电声),它会感到困惑,同样学不到任何东西。但如果喂给它一锅层次丰富、需要咀嚼和消化的复杂美味炖菜,它就会学会如何处理各种食材。在人工智能领域,这种“可消化的复杂性”被称为信息复杂度(Epiplexity)。这是一个高级词汇,指的是一段数据中包含的、计算机实际可以学习到的有用结构化信息的量。研究人员正在探讨的核心问题是:我们能否利用这种“可消化复杂度”的概念,来挑选出最能教导机器人的数据,甚至创造出能让机器变得更聪明的新数据?
这篇题为《以信息复杂度引导用于分布外泛化的数据选择与生成》的论文给出了肯定的回答。来自纽约大学和 Inherent 的作者团队提出了一种通过关注这种“信息复杂度”来训练 AI 模型的新方法。他们建议,与其只是从互联网上随机抓取文本块,不如主动选择那些恰好能挑战模型、让它既能努力工作又不至于放弃的数据。他们测试了两个主要思路:首先是一种选择现有最佳数据的策略,其次是一种生成专门为教导模型而设计的全新合成数据的策略。
以下是通过几个简单的故事对他们的“信息复杂度”系统进行的解释:
数据选择的“压力测试”(EpiSelect)
想象你是一位老师,正在为一名需要通过一场极其困难且未知的考试的学生准备学习指南。你拥有一个充满书籍的图书馆:有些是简单的图画书,有些是枯燥的数字列表,而有些则是充满深刻思想的复杂小说。
作者发现,如果你只是随机挑选书籍,学生可能会感到无聊或不知所措。但如果你能精确测量出学生在阅读特定页面后大脑增长了多少呢?他们将这种增长称为“信息复杂度”。一段重复的文字(如“猫坐在猫坐在”)具有低信息复杂度,因为学生能瞬间学会并跳过;一段随机的胡言乱语也具有低信息复杂度,因为学生无法从中学习任何东西;但一个复杂的故事情节会让学生停下来思考,并缓慢理解情节,这样的页面就具有高信息复杂度。
团队创建了一个名为 EpiSelect 的工具,它扮演着一位超级聪明的图书管理员的角色。当学生(AI 模型)阅读时,EpiSelect 会观察学生的“损失值”(Loss,衡量其困惑程度的指标)下降的速度。如果学生感到困惑但正在缓慢地理解,那正是完美的平衡点!EpiSelect 会说:“嘿,让我们多读一些像这类风格的书吧!”它利用一种数学上的“缩放法则”(一种基于过去预测未来的高级方法)来预测哪些类型的书籍会在下次带来最大的大脑提升。
在测试中,他们发现了一个令人惊讶的现象。在名为“The Pile”的流行数据集上,最好的策略竟然是反复阅读最大的数据块(称为 PileCC),这击败了所有其他花哨的方法。这表明“The Pile”并不是一个好的测试环境,因为其中一种数据类型过于占据主导地位,从而破坏了实验。因此,他们转向了一个名为“Common Pile”的新数据集,该数据集由 30 种不同类型的文本均匀混合而成。在这个新测试中,EpiSelect 脱颖而出。它挑选出的数据组合让 AI 模型在 10 项棘手的任务上表现优于其他所有方法,包括目前的顶尖技术。论文指出,通过专注于创造最多“信息复杂度”的数据,模型可以学习到有助于处理未见情况的模式。
制作新食谱的“机器人厨师”(EpiGen)
现在,假设你不仅想从图书馆里挑选最好的书,还想编写出专门为教导学生而设计的全新书籍。这就是论文第二部分的内容:EpiGen。
作者构建了一个“机器人厨师”(生成模型),其职责是烹饪出新的合成文本。但厨师如何知道该做什么菜?通常,厨师可能会尝试做出味道好(低误差)或者与以往做过的食物截然不同的食物。但作者意识到,最适合学习的食物是那种具有挑战性但仍能入口的食物。
他们给了机器人厨师一个特殊的奖励机制。每当厨师烹饪出一批新文本时,他们都会将其喂给学生(学习模型)。如果学生感到有些吃力,但随后学到了新知识并提升了理解力,厨师就会获得巨大的奖励。如果文本太简单(学生已经掌握了)或者太难(学生完全无法理解),厨师则不会得到任何奖励。
通过使用一种名为 REINFORCE 的技术(类似于教练给运动员提供反馈),厨师学会了烹饪“金发姑娘原则”(Goldilocks)式的数据——不过热,也不过冷,而是恰到好处。结果令人兴奋。当他们在这种特制的合成数据上训练模型时,该模型在理解语言任务(如 GLUE 基准测试)方面的表现,优于使用原始数据进行训练的模型。更棒的是,当他们将这种新的合成数据与真实数据混合使用时,模型的表现比单独使用其中任何一种都要更好。
这对未来意味着什么
该论文并未声称解决了 AI 的所有问题。作者谨慎地指出,他们是在相对较小的模型上进行的测试,并且他们的方法依赖于对信息复杂度的“代理”(即一个优秀的猜测),而非测量完美的理论值。他们还发现,当 AI 具备一定的预存知识(如预训练模型)而非从随机权重开始时,这种方法的效果最好。
然而,其核心理念是一种视角的转变。作者认为,我们不应将数据视为一堆等待燃烧的燃料,而应将其视为一套课程体系。通过测量并最大化信息复杂度(即模型实际可以提取的结构化信息的量),我们可以构建出不仅规模庞大,而且真正具备适应能力的 AI。无论是选择现有的最佳数据,还是发明新的合成数据,目标都是一致的:为模型提供挑战,让它在思考、学习和成长的过程中,能够应对一个我们尚未想象到的世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。