← 最新论文
🤖 AI

Deep Learning Models Also Recall Features

本文引入了“特征召回”(feature recall)的概念,将其作为深度学习模型中的一种通用操作,即通过线性投影检索由输入激活进行缩放的存储信息,从而提供了一个全新的框架,用于机械解释性和哲学理解,并与传统的特征组合范式形成对比。

原作者: Pierre Beckmann

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Pierre Beckmann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

深度学习模型,作为现代人工智能背后的强大引擎,常被描述为通过将简单模式堆叠成复杂概念的庞大网络。多年来,科学家们一直通过一个特定的视角来理解这些系统:即“特征组合”(feature combination)的概念。在这种观点中,神经网络就像一个建筑施工队,将基础构建块——如图像中的边缘或句子中的简单声音——层层递进地组装成更高层级的概念,例如一张脸或一个单词。这一框架在解释机器如何识别模式方面非常有用,就像一个孩子通过先注意到耳朵、再注意到毛发、最后识别出整个动物的过程来学习识别猫一样。然而,这种视角难以解释那些模型不仅仅是在识别模式,而似乎是在凭空提取特定、详细事实的时刻。当一个大型语言模型被要求撰写一位名人的传记时,答案并不是隐藏在问题中等待被组装起来的;模型看起来像是检索了一条存储的记忆。皮埃尔·贝克曼(Pierre Beckmann)的一篇新论文指出,这种检索并非对模式组装规则的例外,而是一种被忽视的基本且截然不同的操作。贝克曼提出了一个名为“特征召回”(feature recall)的新概念,认为深度学习模型不仅是在组合输入,它们还充当着根据单一触发器检索存储信息的图书馆。

论文首先探讨了这些模型如何处理事实,这一现象在近期的研究中已被观察到,但尚未能被旧有的框架完全解释。要理解这一机制,必须观察模型的内部工作空间,即“残差流”(residual stream)。可以将这条流想象成一个连续的信息流,模型的对句子或图像的理解在该流中逐层构建。随着数据在网络中移动,系统的不同部分会对这一流进行微小的调整,有效地在共享的白板上写入新的细节。这些调整受模型内部空间中特定方向的引导,作者将其比作“滑块”。每个滑块代表一个特定的属性,例如某个特定的人或某个特定物体。当模型处理输入时,它会调整这些滑索,调高或调低它们以反映当前存在的内容。

贝克曼研究中的关键洞察在于模型如何利用这些滑块来生成答案。在传统的特征组合观点中,模型观察一组输入并将它们混合在一起以创造一个新的输出。但在事实召回的情况下,过程则完全不同。在这里,一个特定的输入充当了解锁预存信息集的“钥匙”。论文通过“迈克尔·乔丹”(Michael Jordan)这个名字为例进行了说明。当模型遇到这个名字时,它不仅仅是组合字母或声音来形成一个新想法。相反,“迈克尔·乔丹”这一特征的激活触发了对存储在模型权重中的相关事实的直接检索,例如“打篮球”或“芝加哥公牛队”。模型的权重(即定义其知识的学习参数)充当了一个仓库。当正确的特征被激活时,它会放大这些存储值的特定行,将相关的细节拉入当前的语境中。这与特征组合的构建过程截然不同;它是一个检索过程,其中输入是现有信息的触发器。

贝克曼认为,这种机制并不局限于语言模型或关于人的事实。他指出,特征召回是一种适用于所有深度学习架构(包括用于图像识别的架构)的通用操作。为了证明这一点,他将检索过程与卷积神经网络检测图像中圆形的经典案例进行了对比。在那种场景下,网络通过结合低级特征(如曲线和线条)来识别形状。在这种情况下,权重定义了要寻找什么样的模式。然而,在特征召回中,权重定义了一旦发现模式后要检索什么信息。如果一个在手写数字上训练的模型检测到了圆形形状,它可能会利用该检测结果来召回该数字很可能是“0”、“6”、“8”或“9”。输入特征——圆——触发了对这些特定可能性的检索。论文假定,虽然特征组合解释了模型如何构建复杂性,但特征召回解释了模型如何访问其学到的海量信息,使其能够从非常稀疏的输入中产生丰富且详细的输出。

作者还解决了一个潜在的混淆:由于这些操作背后的数学逻辑可以从两种不同的方式来看待,那么这种区别是真实的,还是仅仅是视角的问题?在数学上,同一种计算既可以被描述为组合输入,也可以被描述为检索存储的行。贝克曼承认这种歧义,但他认为,如果我们观察连接的结构,这种区别是有意义的。他提出了一种通过测量连接的集中程度来区分两者的办法。在特征组合中,许多输入贡献于单个输出,形成了一个密集的连接网络。而在特征召回中,单个输入主导了输出,形成了一个稀疏的连接,即一个触发器拉取出一组特定的关联信息。论文建议,研究人员可以利用这种连接性的差异,来识别模型的哪些部分是在充当检索系统,哪些是在充当构建系统。尽管这尚未在所有案例中得到充分证实,但作者概述了如何进行此类测试,为未来研究确定它们是否为真正的独立操作模式提供了一条路径。

除了技术机制之外,该论文还为我们思考这些模型“知道”什么提供了一种新方式。作者将人类记忆与模型的内部状态进行了类比。他指出,存储在权重中、仅在被触发时才被检索的信息,类似于一种“倾向性信念”(dispositional belief)——即一种即使当前未被使用也依然存在的知识。这与模型当前处理中的活跃信息(类似于“现时性信念”,occurrent belief)形成了对比。通过区分这两者,该论文为哲学家和科学家更好地理解人工智能系统中信念与知识的本质提供了一个框架。它表明,这些模型不仅仅是在处理当下的数据;它们携带了一种随时可以被召唤的事实与关联的常备倾向。

最终,该论文并未声称特征召回取代了特征组合的概念。相反,它将其呈现为一种必要的补充。正如图书馆既包含书籍(存储的信息)又包含阅读它们的过程(检索)一样,深度学习模型很可能既依赖于组合特征来理解新输入,也依赖于召回存储特征来生成详细响应。这项工作邀请研究人员超越对模式构建的关注,并承认存储知识的检索是一种基本操作。通过这样做,它开启了关于这些模型如何学习、如何存储信息以及我们如何解读其内部运作方式的新问题。这种区别目前仍是一个需要进一步实证测试的假设,但它为我们理解人工智能如何产生其最先进应用中所特有的、令人惊叹且详尽的输出,提供了一个更清晰、更直观的图景。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →