Evaluating Federated Pre-Training: On the Reliability of Downstream Fine-Tuning and Intrinsic Evaluation
本文证明了下游微调是评估联邦预训练质量的一个不可靠指标,因为它无法保持原始模型的排名,而内在的下一标记预测则能更忠实地反映预训练性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位试图创造世界上最棒的汤的大厨。在过去,你会从全国每一家农场收集每一种食材,把它们全部倒入一个巨大的中央锅中,搅拌直到味道完美。但如果有些农民因为太害羞而不愿分享他们的秘密配方,或者政府规定他们不能把蔬菜运出自己的谷仓怎么办?你需要一种新的烹饪方式。这就是“联邦学习”(Federated Learning)发挥作用的地方。与其把食材带到锅边,不如派你的大厨去每一家农场。大厨就在当地品尝蔬菜,学习它们独特的魅力,然后只将学到的“经验”传回主厨房,而绝不触碰实际的蔬菜。这让你能够训练一个“基础模型”——一个了解很多世界的超级聪明 AI 大脑——而无需看到任何私密数据。
但棘手的部分在于:你如何知道你的大厨是否真的学到了好东西?通常,为了测试一位大厨,你会要求他做一道特定的菜,比如千层肉酱面,并观察味道如何。在 AI 的世界里,这被称为“下游微调”(downstream fine-tuning)。你拿这个聪明的大脑去教它一项特定的任务,比如回答语法问题或理解情绪。然而,这篇论文提出了一个令人困扰的问题:如果你试图判断大厨是否掌握了“烹饪基础”(预训练),那么要求他做一份千层肉酱面真的是正确的测试方法吗?也许那份千层肉酱面之所以好吃,仅仅是因为大厨擅长遵循食谱,而不是因为他理解了食材。这篇论文深入探讨了我们目前的 AI 大脑测试方式,是否真的能如实反映出它们最初的学习水平。
研究人员决定用一种名为“Transformer 模型”的特定类型 AI 大脑来进行一场“味觉测试”游戏。他们创建了一个受控的厨房,在那里训练了几个模型:一些是用传统方式(所有数据集中)训练的,另一些是使用联邦方法(数据留在本地)训练的。他们使用了一个拥有 1600 万个参数的相对较小的模型,并在特定的文本数据切片上进行训练,以确保比较的公平性。他们的目标很简单:他们想看看不同的测试方法能否根据在原始训练测试中的表现,正确地对模型进行“优胜者”到“落后者”的排名。
团队尝试了两种主要的方法来评判模型。第一种是标准方法:下游微调。这就像是带着 AI 去参加一场特定的考试(GLUE 基准测试,测试语法和情感等内容)。他们尝试了三种方式:从头开始教 AI 一切(全量微调)、仅教它最终答案而保持大脑冻结(仅头部微调),甚至给它极少的学习材料(减少数据)。第二种方法是内在评估(Intrinsic Evaluation)。这更像是要求 AI 仅仅阅读一个句子并猜测下一个词,就像它在原始训练中所做的那样。他们这样做既没有教它任何新东西(零样本/zero-shot),也没有在让它阅读考试题目进行额外练习后进行(持续预训练/continued pre-training)。
结果让传统的做法感到有些震惊。当研究人员观察“下游微调”的结果时,他们发现模型的排名完全乱套了。一个在原始训练测试中表现明显最好的模型(其测试困惑度约为 89),并不一定能在特定的考试中胜出。事实上,那些在原始学习能力上差异巨大的模型,在考试中的得分却几乎完全相同。原始学习质量与考试成绩之间的相关性很弱,有时甚至是负相关的。这就像是最好的大厨和最差的大厨都做出了还不错的千层肉酱面,因为食谱太简单了,从而掩盖了他们真正的技艺。即使他们给模型更少的学习资料来准备考试,排名也没有得到明显的改善。
然而,当他们使用内在评估——即在没有任何额外训练的情况下,仅仅要求 AI 预测考试文本中的下一个词——故事发生了变化。那些在原始训练测试中表现更好的模型,在预测新文本的下一个词时也表现得更好。这里存在着一个非常强、非常清晰的联系。论文指出,这种“零样本”方法由于更贴近 AI 最初的目标,因此是反映联邦预训练效果的一个更诚实的镜子。
作者们谨慎地指出,这是一个针对较小模型(1600 万参数)和特定数据集的模拟实验,因此我们不能断定这在现实世界中使用的万亿级参数的大型模型中也同样成立。但研究结果表明,如果我们想要知道一种新的联邦学习策略是否真的让 AI 大脑变得更聪明,我们不应该仅仅依赖于它们在经过少量额外训练后通过特定测试的表现。相反,我们应该观察它们在独立预测下一个词方面的表现,因为那个测试似乎揭示了它们基础的真相。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。