Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
本文引入了“探索式建模”(Explorative Modeling),这是一种通过对训练循环进行因子化以探索多个生成候选并从中选择最优解的新范式,从而将探索确立为提升跨领域效率与性能的可扩展第三预训练轴,并实现真正的端到端生成式建模。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人画画。在机器学习的旧时代,工程师们会构建一条流水线:一台机器负责画轮廓,另一台负责填颜色,第三台负责画眼睛。这种方法虽然可行,但既混乱又缓慢。随后,一场革命发生了(由一个名为 AlexNet 的著名模型引发),它教会了我们一种更好的方法:直接把整幅画交给机器人,让它从头到尾一次性学会所有东西。这种“端到端”(end-to-end)的方法成为了几乎所有领域——从人脸识别到语言翻译——的金标准。
但有一个顽固的问题拒绝遵循这些新规则:生成式人工智能(Generative AI),即那些创造新图像、视频或故事的技术。虽然这些模型才华横溢,但它们仍然依赖于那种老式的流水线模式。它们将创作过程分解成极小、极小的步骤。例如,为了画一只狗,它们可能会先猜出一个模糊的形状,然后进行细化,接着添加毛发,最后加上眼睛,如此反复数百次。问题在于,每当它们采取一个步骤时,都可能产生微小的误差。到第一百步结束时,这些微小的误差已经堆积起来,导致那只狗看起来可能有些奇怪或模糊。科学家们多年来一直在尝试解决这个问题,他们问道:“为什么我们不能直接训练机器人一次性画出整只狗,而不把它拆分成步骤呢?”
根据 Alexi Gladstone、Heng Ji 和 Yilun Du 的一篇新论文,答案在于“画什么”的世界是混乱的。“画一只狗”这样的请求并不只有一个正确答案;世界上有数十亿种不同的狗。如果你试图在没有策略的情况下同时教机器人画出所有这些狗,它会感到困惑,最后只画出一只模糊、平庸且看起来不像真实存在的狗。现有的模型通过将绘画分解为步骤来解决这个问题,但这打破了“端到端”的规则。这篇论文引入了一个聪明的技巧,叫做探索性建模(Explorative Modeling),它能让模型在不需要拆分步骤的情况下处理这种混乱性。
新策略:“尝试、尝试、再尝试”
作者提出了一个简单但强大的想法:不要强迫模型在第一次尝试时就猜中正确答案,而是让它尝试多次并从中挑选最好的一个。他们称之为探索性建模。
想象你在玩一个游戏,你需要猜一个 1 到 100 之间的秘密数字。
- 旧方法(标准模型): 你猜一个数字。如果你猜错了,你会得到一个提示,然后再次尝试。你会这样重复数百次,越来越接近目标。但每次你猜测时,你对提示的理解都可能产生微小的偏差,到最后,你可能会偏离目标一点点。
- 新方法(探索性建模): 你被允许同时喊出 50 个不同的数字。然后,你观察那个秘密数字并说:“好吧,在我的 50 个猜测中,数字 42 是最接近的!”你只从这个获胜者身上学习。你忽略了其他 49 个错误的猜测。
在论文的语言中,这被称为探索 K 个候选对象(K candidates)。模型生成 K 种不同的可能性(比如 50 种不同的狗),并且只在那个看起来最像真实数据的一个上进行训练。通过这样做,模型学会了致力于捕捉特定的、清晰的细节(比如某种特定的犬种),而不是将它们全部模糊地混合成一个通用的、模糊的团块。
为什么这改变了一切
论文发现,这种“多试几次,选最好的”方法在三个主要方面成为了游戏规则的改变者:
1. 它成为了规模化的新超能力
通常,为了让 AI 变得更好,你只需让大脑变得更大(更多参数)或喂给它更多数据。作者发现了一个第三种方法:你可以通过增加训练期间进行的猜测次数来让模型“更努力地尝试”。他们称之为探索(exploration)。
- 当他们在图像、视频和语言模型上进行测试时,仅仅增加探索次数就显著提升了模型的表现。
- 随着他们扩大数据和模型规模,这种技巧带来的帮助也随之增长。例如,随着数据的增加,探索带来的性能增益从 7% 一路攀升到了 36%。随着模型变大,增益从 13% 跳升到了 23%。
- 它还提高了模型的效率。他们发现,使用探索技术使计算机工作的效率(FLOPs)提升了 4.1 倍,数据的利用效率提升了 6.2 倍,模型大小的效率提升了 47%。
2. 它让模型重新回归“端到端”
因为模型是通过从自己的猜测中挑选最佳匹配来进行学习的,所以它不再需要将任务分解成微小的步骤。它可以一次性学习整个过程。
- 论文显示,通过足够的探索,模型可以在单步内生成一整幅图像或视频,就像它接受训练时那样。
- 在机器人任务(教机器人手臂移动)的测试中,这种新方法达到了现有最佳方法的性能,但使用的计算机步骤减少了 16 到 256 倍。与其用 100 步来移动机械臂,新模型仅用 1 步就完成了。
3. 它帮助模型更好地学习
作者认为,这种方法有助于模型更好地泛化,这意味着它们不仅仅是死记硬背训练数据,而是真正学习了规则。当他们在视频生成上进行测试时,具有更多探索能力的模型过拟合(死记硬背)的情况较少,并且在处理新的、未见过的数据时表现更好。看起来,拥有“挑选最佳匹配”的选项让学习过程变得更加平滑且不易产生困惑。
核心结论
这篇论文表明,十多年来,我们一直试图通过让 AI 变得更大或喂给它更多的书籍来使其变得更聪明。但这项研究表明,我们一直忽略了第三个要素:探索。通过让 AI 生成许多可能性并从中学习最好的一个,我们可以解锁更高水平的性能。
作者谨慎地指出,这是一个仍在探索中的新范式。他们发现,虽然这种方法在图像、视频和某些语言任务上表现得非常出色,但对于其他类型的模型可能还需要进一步调整。然而,结果令人振奋:他们成功让一个图像生成器在不需要任何特殊“引导”技巧的情况下,产生了近乎完美的生成结果(在 ImageNet 上达到 1.43 FID 的得分),而且是在提高训练效率的同时实现的。
简而言之,论文认为,AI 的未来可能不仅在于更大的大脑,还在于更聪明的猜测方式。通过给 AI 一个尝试多条路径并选出赢家的机会,我们终于可以教它一次性完成整幅画作,就像过去几十年深度学习领域一直在做的那样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。