← 最新论文
📊 statistics

Forgetting is Everywhere

本文提出了一种算法和任务无关的理论,将遗忘定义为预测分布中缺乏自洽性,并通过在多种学习设置下的全面实验证明,这一现象在深度学习中是普遍存在的,并且可以被精确地测量和分析,以提高信息留存能力。

原作者: Ben Sanati, Thomas L. Lee, Trevor McInroe, Aidan Scannell, Esmeralda S. Whitammer, David Abel, Amos Storkey

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Ben Sanati, Thomas L. Lee, Trevor McInroe, Aidan Scannell, Esmeralda S. Whitammer, David Abel, Amos Storkey

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你的大脑是一个超级聪明、不断更新的笔记本。每当你学到新知识时——比如一个新的视频游戏策略或是一个关于恐龙的新鲜事实——你就会把它记录下来。但棘手的部分在于:如果你的笔记本空间有限,写下新的一页可能会不小心涂抹或擦除旧的内容。这不仅仅是人类的问题;在计算机程序中也会发生这种情况。在人工智能的世界里,这被称为“遗忘”。这是指计算机学会一个新技巧,却突然失去了完美执行旧技巧的能力。科学家们研究这个问题已经几十年了,主要是在计算机必须学习源源不断的各种新任务的情况下,比如机器人学习走路、然后跑步、再到跳跃。但直到现在,还没有人能给出一个单一且清晰的规则来定义“遗密”究竟是什么。它仅仅是丢失了一个特定的事实吗?还是关于计算机“思维”如何变化的更深层的东西?理解这一点至关重要,因为如果我们想要构建真正智能的终身学习机器,我们需要确切知道它们是如何以及为什么会失去记忆的。

这篇题为《遗忘无处不在》的论文深入探讨了这个谜团。作者提出了一种看待遗忘的新方式,这种方式并不关心具体的任务或计算机程序的类型。他们不再仅仅检查机器人是否在玩旧游戏时表现变差,而是提出了一个更简单、更基本的问题:“计算机对未来的预测是否保持了自身的连贯性?”想象一位天气预报员预测明天会下雨。如果他们今天学到了一个新事实,他们对明天的预测只有在那个新事实确实有意义时才会改变。如果他们无缘无故地改变了预测,或者以一种与已知信息相矛盾的方式改变了预测,那就是“遗忘”的迹象。作者将遗忘定义为这种“自我不一致性”——即学习者的内部逻辑变得混乱,并开始丢弃它本该保留的信息。

论文取得了几个重大发现。首先,他们在数学上证明了一种完美的计算机学习者,即“精确贝叶斯学习者”,永远不会遗忘。它就像一个能够吸收新信息而绝不会擦除旧笔记中任何一页的学生,无论学习多少新事实。然而,论文也表明我们今天实际使用的计算机(比如驱动你最喜欢的应用程序的那些)并不是完美的。它们确实会遗忘,而且即使在学习与已知知识非常相似的事物时也会发生这种情况。作者通过实验表明,遗忘在深度学习中无处不在,从简单的数学问题到复杂的视频游戏。

有趣的是,论文发现遗忘并不总是坏事。事实上,对于我们实际构建的计算机来说,适度的遗忘是有帮助的。这就像园丁修剪灌木丛:如果你不剪掉一些旧枝条,植物就会变得过于拥挤,无法高效地长出新枝。作者发现存在一个“甜点区”(最佳平衡点),在这个区间内,计算机遗忘得恰到好处,既能快速学习新事物,又不会丢失旧技能。如果遗忘太少,它会陷入停滞;如果遗忘太多,它会变得不稳定。

论文还解释了一个奇怪的现象,即当 AI 模型在自己生成的数据(例如绘图程序尝试从自己的画作中学习)上进行训练时,性能会变差。作者简单地解释道:当模型在自己的输出上进行训练时,它本质上是在针对一个已经变得略微“被遗忘”或扭曲了的现实版本进行练习。当它试图从中学习时,它只是在不断地遗忘更多,导致质量迅速下降。

简而言之,这项研究为我们提供了一个衡量遗忘的全新通用标尺。它表明,遗忘是学习过程中的一个自然组成部分,尤其是对于我们今天构建的这些并不完美的机器而言。它不仅仅是一个需要修复的漏洞;它是一个需要被管理的特性。通过理解遗忘本质上是关于“自我不一致性”的丧失,科学家现在可以设计出更好的算法,让机器明确知道何时该保留旧记忆,何时该放下它们以腾出空间迎接新知识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →