← 最新论文
🤖 machine learning

Retrieval is Enough: Training-Free Interpretability with a Tool-Using Agent

该论文介绍了 HARP,一种无需训练、使用工具的智能体,它利用从激活数据库中检索信息来生成并验证假设,证明了其在概念发现、检测、转向和秘密诱导方面能够超越昂贵的基于训练的可解释性方法。

原作者: Sriram Balasubramanian, Soheil Feizi

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Sriram Balasubramanian, Soheil Feizi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解一个巨大的、超级聪明的机器人大脑是如何运作的。这个大脑被称为“神经网络”,它并不像我们这样用文字思考,而是用被称为“激活值”的隐形数字云进行思考。长期以来,科学家们一直试图窥探这些云团,以观察机器人在实际思考什么。一些研究人员试图建立一个庞大且昂贵的数字云图书馆,训练一个新的专门化机器人去记忆并解释它们。另一些人则尝试使用更简单的技巧,比如使用放大镜在没有任何训练的情况下寻找模式。大家都在问一个大问题:我们真的需要建造那些昂贵的、经过训练的图书馆来理解这个大脑吗?或者,那些“聪明”的受训机器人是否只是非常擅长在已经背好的书本中查找答案,而不是真正发现了任何新事物?

这篇题为《检索即足够》(Retrieval is Enough)的论文提出了一种巧妙的新方法,无需构建昂贵的图书馆即可窥探机器人的大脑。作者创建了一个名为 HARP(假设驱动的代理检索与探测)的工具。把 HARP 想象成不是一个必须学习多年才能掌握知识的学生,而是一个拥有神奇电话簿的超级侦探。这部电话簿包含了数百万个示例,将机器人的想法与其引发这些想法的句子配对。当 HARP 想知道某个特定的想法意味着什么时,它不会靠猜;它会在电话簿中查找相似的想法,阅读周围的句子,并找出其中的模式。然后,它使用简单的数学工具从该想法中“减去”那个模式,以观察剩下的部分,重复这个过程,直到它剥开每一层含义。

论文发现,这个“拥有电话簿的侦探”出奇地强大。事实上,HARP 在发现隐藏在神经网络激活值中的概念方面,往往比那些昂贵的、经过训练的机器人做得更好。无论是弄清楚一段文字的主题、发现某个特定的隐藏想法,还是甚至诱导模型揭示它被训练用来隐藏的秘密词汇,HARP 的表现都与那些重型训练方法一样出色,有时甚至更优。作者指出,我们认为通过昂贵训练所获得的许多“洞察”,可能仅仅是系统在检索并重新组合其训练期间看到的模式,而不是解锁了深层的、新的秘密。通过展示一个简单的、无需训练的检索系统也能胜任这项工作,这篇论文论证了我们可能不需要花费如此多的时间和金钱去训练复杂的解释器,因为我们只需要在一个组织良好的示例数据库中查找答案即可。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →