Towards Explainability of SLMs by investigating Token Level Activation
本文提出了一种轻量级且与模型无关的激活流网络(AFN)框架,该框架通过分析第 8 层隐藏状态的激活强度来量化 BERT 中词元级别的的重要性,结果表明具有语义意义的词元表现出显著高于结构词元的激活幅度,从而为以注意力为中心的方法提供了一种可解释的替代方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常聪明但行踪神秘的机器人图书管理员,名叫BERT。这位管理员几乎读过所有写下的文字,能够回答问题或理解句子中的情感。但有一个陷阱:没人知道它究竟是如何思考的。它就像一个“黑箱”——你输入一个句子,就会得到一个答案,但内部的齿轮却隐藏不见。
很长一段时间里,研究人员试图通过观察这位管理员的“注意力”来窥探其内部。他们心想:“如果管理员正盯着某个词,那这个词一定很重要!”但他们发现了一个把戏:管理员常常全神贯注地盯着无聊的东西,比如逗号、句号,或者像"the"和"is"这样的词,却忽略了真正精彩的词汇,如"beautiful"(美丽)、"disaster"(灾难)或"Canada"(加拿大)。这就像看着一个安全摄像头,它只把镜头对准门把手,却忽略了正穿过门的人。
新想法:测量“能量”而非“目光”
这篇论文的作者决定尝试一种不同的方法。他们不再问“管理员在看哪里?”,而是问“管理员思考每个词时消耗了多少能量?”
他们聚焦于管理员大脑中的一个特定区域,称为第 8 层。不妨将管理员的大脑想象成一栋 12 层的建筑:
- 1–5 层:底层。在这里,管理员只注意基本事物,比如大写字母,或者一个词是名词还是动词。
- 10–12 层:顶层公寓。这里是最终答案被决定的地方。
- 第 8 层(甜蜜点):这是“整合区”。在这里,管理员停止关注语法,开始真正理解故事的含义。
研究人员开发了一种名为激活流网络(AFN)的工具。他们不再观察管理员的眼睛,而是测量每个词在通过第 8 层时流动的“电量”(数学上称为L2 范数)。
他们的发现:“高电压”词汇
当他们测量这种能量时,发现了一个清晰的模式:
- “高电压”词汇:像"prime"(总理)、"minister"(部长)、"Canada"(加拿大)、"beautiful"(美丽)或"enjoying"(享受)这样内容丰富的词汇,像明亮的霓虹灯一样亮起。它们拥有最高的能量。
- “低电压”词汇:像"the"、"of"这样的结构词,或像"?"这样的标点符号,则显得暗淡。它们存在,但并未承载意义的主要重量。
类比:想象一支搬家团队正在打包房屋。“高电压”词汇是沉重的沙发和钢琴——移动它们需要最大的力气。“低电压”词汇是空箱子或胶带;它们对工作是必要的,但既不占太多空间,也不消耗太多能量。研究人员发现,第 8 层正是进行重体力劳动的地方。
“涟漪效应”实验
为了证明这一点,研究人员玩了一场“找不同”的游戏。他们向管理员提供了两个非常相似的句子:
- "Enjoying a beautiful day at the park!"(在公园享受美好的一天!)
- "Enjoying a beautiful walk at the beach!"(在海滩享受美好的散步!)
他们观察当把"day"换成"walk"、把"park"换成"beach"时,“能量”是如何变化的。
- 显而易见:发生变化的词("day"和"park")的能量出现了巨大跃升。
- 令人惊讶:即使那些没有变化的词(如"beautiful"或"at"),也出现了显著的能量偏移!
类比:这就像往池塘里扔一块石头。当你改变一个词(石头)时,涟漪(能量偏移)会扩散开来,改变周围的水域,甚至包括那些没有直接被击中的部分。这表明第 8 层是深度互联的;改变故事的一部分,会迫使整个句子重新思考其含义。
“桶”测试
最后,他们尝试用一个简单的规则将“重要”词汇与“背景”词汇区分开来。他们画了一条线(阈值),将所有高能量的词放入高桶,其余的放入低桶。
他们发现:
- 高桶里只有大约 25% 的词汇(那些重要的词)。
- 但是,这少数词汇却承担了**76%**的总意义变化。
类比:这就像一场音乐会,25% 的乐手(独奏者)演奏着大家记住的旋律,而另外 75% 的乐手则在演奏背景节奏。如果你让独奏者静音,歌曲就失去了灵魂。如果你让背景乐手静音,你仍然能听到歌曲,尽管感觉有点空洞。
主要启示
这篇论文不仅仅是在说"BERT 很聪明”。它为我们提供了一种新的方式来观察它如何思考。通过测量过程中间(第 8 层)词汇的“能量”,他们将“黑箱”变成了“玻璃箱”。
他们表明,BERT 并非仅仅盯着标点符号;它实际上将精神能量集中在承载真实意义的词汇上。这帮助我们理解,当模型处理一个句子时,它正在对“内容”词汇进行大量的重体力劳动以理解世界,而“结构”词汇只是负责将框架固定在一起。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。