On the Power of Foundation Models
本文运用范畴论证明,尽管基于提示的学习严格局限于可表示的任务,但一个具备充分能力的预训练基础模型在经过微调后,理论上能够解决其前置任务所定义范畴内的任何下游任务,并通过结构映射泛化至未见对象。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗易懂的语言和富有创意的类比,对论文《基础模型的力量》进行的解读。
核心问题:超级大脑能否无所不能?
想象你有一位学生,他读遍了宇宙中所有的书,拥有无限的学习时间,并且在练习测试中从不犯错。作者提出了一个简单的问题:如果这位学生在练习测试中表现完美,那么当你抛给他们任何新问题,他们能否自动解决?
在人工智能领域,这位“学生”就是基础模型(例如 ChatGPT 背后的模型或图像生成器)。而“练习测试”被称为前置任务(例如预测句子中的下一个词,或猜测图像是如何旋转的)。
论文指出,现有的理论(关于数据量或计算机规模)无法回答这个问题。相反,作者利用数学的一个分支——范畴论(可以将其理解为“结构的语法”)——来厘清这些模型能做什么、不能做什么。
他们发现了关于模型如何学习新事物的两条主要规则:
规则一:“提示”的局限(图书馆借书卡类比)
场景:你希望模型执行一项新任务(例如在照片中识别猫),但你不想重新训练它。你只是给它一个特定的指令或“提示”(就像一张写着“寻找猫”的图书馆借书卡)。
发现:只有当新任务已经“隐藏”在其原始训练的结构中时,模型才能解决这项新任务。
类比:想象模型是一座图书馆。
- 前置任务(训练)是图书馆整理书籍的方式。如果图书馆仅按“颜色”整理书籍,那么书籍就被分成了红色、蓝色和绿色。
- 提示微调就像是问图书管理员:“你能帮我找一本关于历史的书吗?”
- 结果:如果图书馆仅按“颜色”整理,那么即使图书管理员拥有世界上最棒的记忆力,也无法找到关于“历史”的书。因为“历史”这一分类根本不存在于图书馆的结构中。
- 论文的证明:作者证明,如果训练任务(例如猜测图像旋转)仅教会模型关于“旋转”的知识,那么模型就无法通过提示来执行复杂的任务,如“分割”(切割出)物体,因为“切割”这一概念并未构建在图书馆的结构中。
结论:如果你只教模型下棋,你就不能仅靠“提示”让它去踢足球。新任务必须能够由旧结构来表示。
规则二:“微调”的力量(万能钥匙类比)
场景:你愿意为这项新任务提供少量的新训练(微调),使用一个小数据集。
发现:这要强大得多。如果模型在初始训练期间充分学习了世界的“结构”,那么只要你提供足够的资源(数据和算力)来连接这些点,它就能学习任何新任务。
类比:想象模型是一把万能钥匙,它已被切割成适合特定建筑(前置任务)锁孔的形状。
- 微调就像是拿着那把万能钥匙,稍微锉磨一下,使其适合另一栋建筑中的新门。
- 结果:只要这把万能钥匙捕捉到了第一栋建筑锁孔的本质,你就可以重塑它来打开世界上几乎任何一扇门。
- 论文的证明:作者表明,如果模型是“理想的”(完美地学习了训练结构),它就包含了求解任何下游任务所需的所有信息。新任务的训练数据仅起到指导作用,告诉模型如何重塑这些信息。
结论:微调不受“提示可表示性”的限制。如果基础牢固,模型几乎可以被适应于任何事物。
规则三:“魔法桥梁”(翻译员类比)
场景:当我们结合不同类型的模型时会发生什么?例如,一个理解文本的模型和一个理解图像的模型(多模态学习)?
发现:论文提出了一个“泛化定理”。它指出,如果你在两个不同的世界(例如文本和图像)之间建立一座完美的桥梁(数学映射),那么一个世界的结构将在另一个世界中得以保留。
类比:想象你有一本字典,它能完美地将“文本”翻译成“图像”。
- 在文本世界中,你有一个"牛油果椅子"(形状像牛油果的椅子)的概念。这个物体在现实世界中可能并不存在,你的训练数据中也没有它的照片。
- 然而,由于文本世界具有“牛油果”和“椅子”可以组合的逻辑结构,而你的字典(模型)在将文本翻译成图像世界时完美地保留了这种结构……
- 结果:模型可以“幻觉”或生成一张完美的牛油果椅子图像,即使它从未见过这样的图像。它并没有死记硬背这张图像,而是理解了单词之间的关系,并将这种结构应用到了图像世界中。
论文的证明:这解释了为什么像 DALL-E 2 或 CLIP 这样的模型能够生成训练集中不存在的事物图像。它们不仅仅是在复制,而是在利用语言的结构逻辑来构建新图像。
论文主张总结
- 提示是有限的:你只能要求模型去做那些在其训练方式中已经“内置”的事情。如果训练没有教会它新任务的结构,简单的提示将不起作用。
- 微调是强大的:如果你愿意进行额外的少量训练,一个学习了良好结构的模型可以被适应以解决几乎任何任务。
- 结构创造新事物:通过将某个领域(如文本)的结构完美映射到另一个领域(如图像),模型可以生成以前从未存在过的东西(如牛油果椅子),因为它们遵循的是结构的逻辑规则,而不仅仅是死记硬背图片。
作者强调,他们讨论的并非特定的网络规模或数据数量,而是任务本身的逻辑结构。他们利用数学证明,训练任务的“形状”决定了模型最终能做到的事情的“形状”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。