Select or Project? Evaluating Lower-dimensional Vectors for LLM Training Data Explanations
本文证明了,与使用全梯度或随机投影相比,贪婪地选择一个具有架构启发式信息的微小模型组件子集,在为大型语言模型生成基于实例的解释时,既更有效,又更具计算效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图理解为什么一个巨大的、超级聪明的机器人做出了某个特定的决定。你知道这个机器人的训练素材是一个庞大的图书库,但究竟是哪一本特定的书教会了它那个特定的事实?这就是人工智能领域中“基于实例的解释”(instance-based explanations)的世界。科学家们想要将机器人的回答追溯到影响它的那个确切的训练样本,就像侦探寻找指纹一样。为了做到这一点,他们通常会观察机器人的“梯度”(gradients)。把梯度想象成一张巨大的、多维度的地图,展示了如果机器人看到某个特定句子,它的“大脑”会发生怎样的变化。问题在于,对于现代机器人(被称为大语言模型)来说,这些地图如此巨大,以至于根本无法携带。一个标准模型的单张地图就占用超过 4 GB 的内存——比一整部电影文件还要大!因此,研究人员必须缩小这些地图,使其变得易于处理。他们一直尝试着两种主要的技巧:要么丢弃地图的大部分,只保留一些随机的碎片;要么将整个地图压缩成一个微小的、模糊的摘要。但一直没有人真正知道哪种技巧能更好地帮助侦探找到那本书。
这篇题为《选择还是投影?》(Select or Project?)的论文旨在解决这个谜团。作者卢卡斯·欣特莱特纳(Lukas Hinterleter)及其来自维也纳大学的团队建立了一个新的测试场,以观察是仔细挑选机器人大脑中一些重要的部分(选择,Selection)更好,还是通过数学手段将整个大脑压缩到一个更小的空间(投影,Projection)更好。他们使用了一个巧妙的游戏来测试:他们拿出一个句子,用另一种方式重新表述它,然后要求机器人的“梯度”在人群中找出原始句子。如果梯度是优秀的,它们应该直指原始句子。
结果令人惊讶。团队发现,“压缩”方法(随机投影,Random Projection)——即试图保留整个地图形状的方法——并不是最好的侦探。相反,一种他们称之为“贪婪选择”(Greedy Selection)的方法赢得了比赛。这种方法就像一位聪明的图书管理员,他不阅读整座图书馆,但准确地知道哪三个书架存放着最重要的线索。通过仔细挑选机器人内部结构的特定一小部分(特别是处理逻辑和单词连接的某些层),他们创建了一张微小且极其清晰的地图。在测试中,这种有针对性的选择不仅在寻找正确训练样本方面更加准确,而且计算速度更快、成本更低。
最关键的一点是:机器人大脑完整的、巨大的地图,表现实际上甚至不如这个微小的、精心挑选的子集。在一个困难的测试中,机器人需要根据重新表述的提示生成一个新故事,完整的地图仅在约 22% 的情况下答对——仅比瞎猜好一点。然而,选出的那一小组部分却在约 36% 的情况下答对了。作者认为,完整的地图实际上是“充满噪声的”,其中包含了过多的额外信息,从而淹没了真正的线索。通过选择最有信息量的部分,他们过滤掉了噪声,得到了更清晰的信号。
论文还研究了机器人大脑中哪些部分是最好的侦探。他们发现,这不在于部分的大小,而在于该部分的功能。负责机器人内部逻辑的部分(称为 MLP 层)在寻找正确训练数据方面,比负责关注特定单词的部分(如注意力机制中的“键/Key”和“值/Value”部分)要出色得多。有趣的是,位于机器人处理链最开始和最末端的部件是最有帮助的,而中间部分的部件似乎会变得混乱且不再那么有用。
最后,作者得出结论:为了解释这些巨型 AI 模型是如何工作的,我们不需要全貌。我们只需要正确的几个部分。他们的“贪婪选择”策略是一种实用且高效的方法,使这些解释成为可能,而无需运行数百小时的超级计算机。虽然他们在一个拥有约 12 亿参数的模型上进行了测试,但他们的发现表明,对于未来的 AI 透明度而言,保持挑剔和选择性比试图保留一切要好得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。