Why the Third Axis Is Freedom
本文认为,生成式训练中的“第三轴”并非探索性建模(XM)本身,而是“自由度”——即行为约束的弱化——XM 通过提高匹配概率来促进这种自由度,并在泛化和分布偏移场景中,在经验上优于传统的选择方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
伟大的 AI 猜谜游戏
想象一下,你正在教一个机器人画画。在人工智能的世界里,这通常是通过一种被称为“生成式训练”的过程完成的。机器人尝试做出图像,如果它做出的图像与你展示给它的示例不同,它就会受到“惩罚”或得到一个低分。机器人想要最小化这种惩罚,因此它会学习尽可能完美地模仿示例。但问题在于:如果机器人只是学会了吐出它看到的那个最常见的答案,它可能会变得非常擅长模仿那个特定的东西,但在处理任何新颖或不同的事物时却表现得很糟糕。它会变成一个僵化的鹦鹉,而不是一个富有创造力的艺术家。
长期以来,科学家们一直在思考如何让这些模型变得更加灵活。他们发现了一个叫做“探索式建模”(Explorative Modeling)的小技巧。与其要求机器人只做一个猜测,不如要求它同时做出许多个猜测——比如十幅不同的画。然后,你只惩罚离目标最近的那一个,而忽略其他九个。这迫使机器人在脑海中保持更广泛的想法,希望其中一个能是正确的。这个想法最近被称为 AI 训练的全新“第三轴”,暗示着持有许多不同“模式”或版本答案的能力,是让 AI 变得更聪明的关键。
但持有许多想法是否等同于聪明?这篇论文提出了一个更深层的问题:魔力在于猜测的“数量”,还是在于机器人可以进行选择的“自由度”?作者认为,仅仅计算一个模型做了多少次猜测并不是故事的全貌。相反,真正的秘密是“自由”——在这里,这意味着模型在不违反规则的前提下,有多少种不同的正确方式。这就像是一个机器人被迫从十个选项中挑选,与一个被允许从浩如烟海的可能性库中进行挑选的机器人之间的区别。论文探讨了这种“自由”是否才是帮助 AI 更好学习的关键,而不仅仅是原始的猜测次数。
第三轴是自由,而不只是计数
作者迈克尔·蒂莫西·贝内特(Michael Timothy Bennett)对这种“第三轴”的 AI 训练进行了全新的审视。他认为,虽然之前关于“生成表达力”(即持有许多模式的能力)的想法很有趣,但它实际上是一个红鲱鱼(误导信息)。故事中的真正英雄是自由。
把模型的行为想象成一套游戏规则。一条“弱”规则是不怎么限制你的规则。例如,一条说“你可以穿任何颜色的衬衫”的规则是弱的,因为它允许数百万种可能性。一条说“你必须穿红衬衫”的强规则则是强的,因为它只留下了一种选择。贝内特认为,最好的 AI 模型是那些在保持正确的同时,尽可能让其规则保持“弱”的模型。这种“弱性”就是他所说的自由。它是模型仍能想象出的兼容完成项的体积。如果一个模型太僵化(太强),它在世界发生变化时可能会失败。如果它是自由的(弱),它可以适应新情况,因为它没有将自己锁定在单一狭窄的路径上。
论文挑战了这样一种观点,即“第三轴”仅仅是关于模型能产生多少输出(其“模式计数”)。贝内特证明,一个模型在理论上可以拥有大量的允许输出,但如果它只使用其中之一,它在泛化方面仍然会表现得很糟糕。相反,一个允许输出集较小的模型,如果它能均匀地分配注意力,可能会非常强大。论文从数学上证明了,自由是模型的一种功能属性(它实际做什么),而不是其形式属性(它有多少参数或层数)。你可以改变模型的大小或它看到的数据,但如果其行为的“自由度”保持不变,它的泛化能力也会保持不变。
“Best-of-K”的魔力
那么,我们如何获得这种自由呢?论文研究了一种称为**探索式建模(XM)**的方法,即模型生成 个候选对象并从中挑选出最好的一个。作者推导出了一个数学公式,精确地展示了这个过程是如何运作的。
想象你在一个黑暗的房间里寻找一把特定的钥匙。
- 如果你只看一次(),即使钥匙就在那里,你也可能错过它。
- 如果你看十次(),你找到钥匙的机会就会增加。
论文表明,这种“看十次”的过程就像是在模型的自由度上使用了一个放大镜。它并没有凭空创造新的自由;相反,它奖励那些拥有广泛“许可剖面”(permission profile)的模型。如果一个模型允许许多不同的输出(高自由度),那么“Best-of-K”过程更有可能找到一个好的匹配。如果模型是僵化的,只允许一种输出,那么看十次也没什么用,因为十个猜测很可能都是同样无聊的东西。
作者证明,随着你增加 (猜测次数),训练过程会自然而然地推动模型变得更加“弱”(更自由)。它不再试图仅仅成为某一个事物的完美复制品,而是开始学习覆盖更广泛的可能性。当目标(模型试图学习的东西)并不都相同时,这一点尤其明显。如果某些目标是罕见的,而另一些是常见的,较小的 会让模型只关注那些常见的。但随着 变得越来越大,模型会被迫也去关注那些罕见的,最终将其“许可”扩散到所有有效的选项中。
实验:将理论付诸测试
论文并不仅仅停留在数学领域;它运行了两项重大实验,以观察这在神经网络的现实世界中是否成立。
实验 1:更多的猜测是否让模型变得更自由?
研究人员使用不同的 值(从 1 到 32)训练了 AI 模型。他们通过统计模型实际被允许产生的不同有效输出的数量,来衡量训练后模型的“自由度”。
- 结果: 当他们使用较高的 时,模型变得显著更加自由。例如,在均匀分布的目标下,将 从 1 增加到 8,使“平均对数自由度”增加了约 8.3。模型不仅变得更擅长猜测,它们还扩展了它们的“许可剖面”,以包含更多有效的可能性。这证实了该训练方法成功地将“猜测”的预算转化为了功能性的自由。
实验 2:选择更“自由”的模型是否会让它表现更好?
在这里,研究人员训练了一批模型,然后必须选择一个最好的模型在新的情境下(即游戏规则发生了轻微变化)进行使用。他们比较了两种选择方式:
- 子任务验证(Child-Validation): 选择在原始训练数据(“子”任务)上表现最好的模型。
- 自由度选择(Freedom Selection): 选择具有最高“自由度”得分的模型,即使它在原始数据上不是绝对最好的。
- 结果: “自由度选择”法在 30 次实验中赢得了 29 次。因其自由度而被选出的模型在新的平衡数据上表现得更好(命中率从大约 0.317 提高到了 0.389)。这表明,通过选择自由度,你是在选择一个更具鲁棒性和适应性的模型,即使它在所训练的具体数据上看起来没那么完美。
大局观:手段与目的
论文最后对工具与目标做出了明确的区分。
- 探索(即 次猜测) 是手段。它是机制,是预算,是我们强迫模型四处观察的方式。
- 自由 是目的。它是让模型具备泛化能力的真正属性。
作者认为,“生成表达力”(即拥有许多模式是目标这一想法)只是自由的一个代理指标。它是一种统计可能性的方式,但忽略了如何使用这些可能性的细微差别。如果一个模型没有很好地利用它们,它即使拥有很高的模式计数也可能依然是僵化的。真正的泛化来自于自由——即模型保持对多种兼容未来开放的能力。
最后,论文指出,“第三轴”始终是自由。像探索式建模这样的新方法,只是我们教导模型减少约束、减少僵化、并为迎接未来可能发生的一切做好准备的一种巧妙方式。通过使用更多的猜测进行训练,我们不仅仅是在教 AI 如何更好地猜测;我们是在教它如何变得更加自由。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。