DMDIntel: Interpreting Large Language Models via Dynamic Mode Decomposition
本文介绍了 DMDIntel,一种利用动态模态分解将大语言模型(LLM)隐藏状态分解为显著模态并对输入标记进行排序的新型可解释性框架,该框架在多个数据集和模型族上展现出优于 PCA、集成梯度(integrated gradients)和 SHAP 等最先进归因方法的卓越性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看魔术师从帽子里变出一只兔子。你看到了帽子,也看到了兔子,但魔法发生在两者之间的那一瞬间,隐藏在魔术师的袖子里。长期以来,人工智能(AI)一直就是那位魔术师。我们给它一个句子,它就给我们一个答案,但没人真正知道它是如何决定那个答案的。AI 是一个“黑盒”,科学家们渴望窥视其中,看看计算机到底在意哪些词。这个领域被称为“可解释性”。要理解这篇新论文,你首先需要了解两件事:AI 如何阅读文本,以及我们通常如何尝试窥视其中。
AI 模型,特别是被称为“大语言模型”(LLMs)的模型,并不像我们那样阅读单词。相反,它们将每个单词转化为一长串数字(向量),并将其传递通过一系列层,就像一场接力赛。在每一层中,这些数字都会发生细微的变化,将当前单词的含义与之前的单词混合在一起。通过这场比赛的终点,模型会得到一组最终的数字来决定答案。通常,为了弄清楚哪些词起到了作用,科学家们会使用观察模型“静态”状态的工具——就像拍下一张接力赛的单张照片,并试图猜测谁跑得最快。但本文指出,仅仅看一张照片会错过整个故事。它认为,我们应该观看这场比赛的“电影”,观察数字是如何从一步到下一步演变的,因为 AI 思维的秘密就在于这种运动。
于是,DMDINTEL 登场了,这是由来自印度理工学院卡拉格普尔分校和曼彻斯特大学的 Amogh Joshi 及其团队引入的一种新方法。可以将 AI 的内部处理过程想象成不是静态的数字列表,而是一条流动的河流。随着 AI 阅读句子,其中的“水”(隐藏的信息)会随着每一个新词的出现而产生涟漪并改变形状。研究人员使用了一种名为**动态模态分解(Dynamic Mode Decomposition, DMD)**的数学工具——该工具最初是用于研究流体力学中水的旋涡现象——来绘制这些涟漪。
以下是他们的“河流”类比在实践中的运作方式:当 AI 阅读一个句子时,单词的隐藏状态会创造出一种复杂的、旋转的模式。DMDINTEL 将这种模式分解为几个简单的、重复的“模态”或形状,就像海洋中复杂的波浪可以被描述为几种基本波浪形状的组合一样。团队发现,通过观察这些形状在 AI 阅读句子时是如何增长、缩小或振荡的,他们可以识别出哪些词是最终决策的“驱动者”。他们将 AI 视为一个动力系统,这意味着他们观察的是一个词与下一个词之间的“变化”,而不仅仅是单词本身。
研究人员在三类不同的 AI 模型家族(Llama、Qwen 和 Mistral)以及三项不同的任务上测试了这个想法:判断评论是正面还是负面、识别假新闻以及检测仇恨言论。他们将这种“河流电影”法与传统的“静态照片”法进行了对比,这些传统方法包括集成梯度(Integrated Gradients)、SHAP 和主成分分析(PCA)。
结果表明,DMDINTEL 是一个更出色的侦探。在实验中,这种新方法比其他方法更频繁地找到了最重要的词(即“地面真值”/ ground truth)。例如,当 AI 判断一条评论是否为负面评价时,DMDINTEL 能正确地将“垃圾”(trash)和“无法”(unable)等词排在顶尖驱动词的位置,而其他方法有时会被“预定”(scheduled)或“会议”(conference)等不太重要的词所干扰。论文表明,通过观察 AI 思维的“演变”,DMDINTEL 更好地捕捉到了句子的逻辑。它表明,AI 的推理不仅仅在于那些静止不动的词;而是在于当句子被构建时,意义是如何流动和转化的。
然而,作者也谨慎地指出,这并不是解决所有 AI 问题的“万灵药”。他们的方法在 AI 仅仅是在阅读一个句子并给出简单答案(如分类任务)时效果最好。他们承认,如果 AI 开始逐字逐句地写一个长篇故事或翻译整本书,数学处理会变得非常复杂,因为 AI 会将它产生的新词重新反馈回系统中。但在解释 AI 为何将某个句子标记为“仇恨言论”或“假新闻”这一特定任务时,这种观察数字舞动的新方式提供了一个更清晰、更准确的画面。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。