J-space Forecasts Model Collapse, but Only Anchoring the Function Prevents It
虽然在合成数据上的递归训练会导致模型崩溃,表现为 J-空间表示子空间的全局漂移,但研究发现,稳定这种几何结构是无效的,而利用少量真实序列将模型的输入-输出函数锚定在崩溃前的状态,则能成功防止几乎所有的损伤。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
被称为语言模型的人工智能系统正变得日益普遍,它们能够编写故事、回答问题并模仿人类对话。这些系统通过阅读互联网和书籍中的海量文本进行学习。然而,一个令人不安的现象出现了:如果这些模型是在它们自己编写的文本上进行训练,它们就会开始退化。这个过程被称为“模型崩溃”(model collapse),它会导致人工智能失去理解人类语言全貌的能力。模型不再产生多样化且富有细微差别的响应,而是开始自我重复,仅关注最常见的短语,并最终遗忘那些让语言变得丰富多彩的罕见且复杂的思想。这种危险是真实存在的,因为随着互联网上由人工智能生成的内容越来越多,未来的模型可能会在无意中向这些退化的输出学习,从而创造出一个智能逐渐侵蚀的反馈循环。
多年来,科学家们通过观察模型的最终输出,即观察文本质量的恶化情况,来观察这种崩溃。但独立研究员 ChaeWoo Son 的一项新研究提出了一个更深层的问题:损伤究竟是在机器内部的哪个环节发生的?损伤是发生在模型表征思想的方式上,还是发生在它决定下一步说什么的方式上?为了找出答案,研究人员使用一个小型语言模型构建了一个受控实验,并强迫它在连续几代生成的合成文本上进行学习。目标是追踪损伤发生的过程,并观察通过保护模型内部结构的特定部分是否可以阻止这种现象。
研究始于在大量人类写作素材上训练一个模型。模型准备就绪后,研究人员开始了一个循环:模型生成一百万个单词,然后根据这些新文本进行重新训练。这个过程重复了六次。正如预期的那样,模型的在真实人类文本上的表现迅速变差。仅仅经过一轮自我训练,模型预测句子中下一个单词的能力就显著下降。但在模型的输出表现出失效迹象之前,研究人员注意到机器内部发生了其他变化。通过观察模型内部存储概念理解的一个特定低维空间,研究人员看到模型表征信息的方式发生了巨大的偏移。这种内部偏移发生的速度比外界可见的性能下降速度快了十倍。
然而,这种早期预警信号并非模型崩溃所特有的。当模型在新鲜、高质量的人类文本上进行训练而非其自身输出进行训练时,那个相同的内部空间也会发生移动,只是移动幅度较小且不一致。关键区别在于变化的速率和深度。当模型从自身糟糕的数据中学习时,内部偏移巨大且具有一致性,并将模型的理解推向了一个极低的底线。而当它从优质数据中学习时,偏移则很轻微。这表明,虽然内部空间是衡量问题的敏感晴雨表,但它并不一定是遭受损伤的地方。
为了测试这一点,研究人员尝试通过锁定内部结构来阻止崩溃。他们强迫模型在学习糟糕的合成数据时,保持其内部表征与训练开始前完全一致。这在保持内部空间稳定方面效果完美,但未能挽救模型。模型仍然发生了崩溃,失去了处理真实文本的大部分能力。即使研究人员锁定了模型的整个层级而不只是那个微小的空间,保护效果也微乎其微。这是一个至关重要的发现:它证明了损伤并非发生在模型存储思想的方式上,而是发生在其他地方。
解决方案出现在研究人员改变策略,从保护内部地图转向保护行为时。研究人员不再冻结模型的内部结构,而是增加了一条规则,强制模型在对一小组真实人类句子进行预测时,必须保持与初始状态完全一致。这就像告诉一名学生:“你可以学习任何你想学的,但你必须仍然能够正确回答这些特定的问题。”当应用这条规则时,模型几乎完全被挽救了。它从糟糕的合成数据中学习,却没有失去理解真实人类文本的能力。事实上,这种方法比仅仅将真实人类句子混合到训练数据中(这是科学家尝试解决此问题的标准方法)要有效得多。行为规则阻止了几乎所有的损伤,而混合数据仅能防止大约一半的损伤。
这项研究揭示了人工智能模型的崩溃并非其内部记忆或存储概念能力的失败。相反,它是模型所见之物与它决定所言之物之间连接的失败。损伤发生在函数层面,即从输入到输出的映射过程,而不是在静态的思想表征中。通过将这一函数锚定在一个健康的参考点上,模型可以免受其自身输出腐蚀的影响。尽管这项实验是在小型模型上进行的,但其发现为保护未来更大型系统提供了一种强大且高效的方法。如果可以使用少量真实的人类示例来锚定模型的行为,那么即使互联网充斥着越来越多的机器生成内容,也有可能防止人工智能的缓慢退化。该研究提供了一条清晰的前行之路:不要仅仅试图保护模型的内部状态,要保护它在现实世界中正确行动的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。