← 最新论文
🤖 machine learning

Uncertainty-Aware Token Importance Estimation in Spiking Transformers

本文提出 Uncert,一种无需训练的框架,它通过基于多个脉冲步中狄利克雷分布的类别证据所推导出的时间不确定性模式来估计令牌重要性,从而提升脉冲 Transformer 中的令牌剪枝效率。

原作者: Wenxuan Liu, Zecheng Hao, Tong Bu, Yuran Wang, Zhaofei Yu

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenxuan Liu, Zecheng Hao, Tong Bu, Yuran Wang, Zhaofei Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试拼凑一幅拼图,但你并非一次性审视整幅画面,而是凝视几秒钟,然后移开视线,接着再重新看回去。每一次注视,你的大脑都会收集更多关于这幅画面是什么的线索。

这就是脉冲 Transformer(一种受人类大脑启发的人工智能)的工作原理。它们并非在瞬间处理整张图像,而是在一系列微小的时间步长中“脉冲”或“发放”,逐步建立起对场景的清晰理解。

然而,这里存在一个问题:就像你可能在等待有趣部分出现时,盯着拼图中空白的一面墙壁一样,人工智能在试图识别“有趣”部分(例如一只猫)时,会浪费大量能量去处理图像中“无聊”的部分(例如一片纯蓝的天空)。

问题:噪声过多,焦点不足

当前的方法试图通过观察信号在单一时刻的“响度”或“亮度”来判断图像的哪些部分重要。这就像试图仅凭听一秒钟的声音来评判一首歌曲。如果某个音符很响,它们就认为它很重要;如果它很轻,它们就忽略它。

但在脉冲 Transformer 中,图像某部分的“重要性”不仅仅取决于它此刻有多“响”,还取决于人工智能的置信度如何随时间变化。

解决方案:Uncert(“置信度追踪器”)

这篇论文的作者,来自北京大学的刘汶轩及其团队,创造了一种名为Uncert的新工具。可以将 Uncert 想象为一个置信度追踪器,它随时间观察人工智能的“大脑”。

Uncert 不再问:“这个信号此刻有多响?”,而是问:“随着时间推移,人工智能对图像的这部分有多困惑?”

以下是他们使用简单类比进行的拆解:

  1. “困惑”的 Token 才是重要的那个:
    想象你身处一个拥挤的房间。

    • Token A(背景): 你看到一面普通的墙。你的大脑立刻知道:“那是一面墙。”你的置信度很高,不确定性很低。它从未改变。
    • Token B(猫): 你看到一个模糊的形状。起初,你以为是猫。接着你以为是狗。然后你又意识到那还是猫。你的大脑在波动,收集证据,你的“不确定性”忽高忽低。
    • 洞察: 论文认为,Token B(那个波动的)实际上更重要。 它包含了人工智能解决拼图所需的复杂信息。Token A(静态的墙)只是冗余的噪声。
  2. “不确定性分数”:
    Uncert 根据以下两点为图像的每一个微小部分(称为"Token")计算一个分数:

    • 平均困惑度: 人工智能平均对该部分有多不确定?
    • 过山车效应: 人工智能的置信度上下波动了多少?

    如果一个 Token 具有较高的平均困惑度,或者其置信度变化像过山车一样剧烈,Uncert 就会给它一个高重要性分数。如果一个 Token 无聊且一致(像那面墙),它得到的分数就很低。

  3. “剪枝”(削减冗余):
    一旦 Uncert 对所有 Token 进行了评分,人工智能就可以进入“效率模式”。它保留高分 Token(那些令人困惑、有趣的部分),并丢弃低分 Token(那些无聊、冗余的部分)。

    论文将这一过程称为Token 剪枝。这就像厨师品尝汤后,决定倒掉那些不增加任何风味的清水,只留下浓郁、美味的汤汁。

他们的发现

研究人员在两类数据上测试了这种方法:

  • 静态图像: 普通照片(如 CIFAR-10)。
  • 神经形态数据: 事件相机,仅记录变化(例如,仅在物体移动时才拍摄照片的相机)。

结果:

  • 无需额外训练: Uncert 是“即插即用”的。你无需重新教导人工智能如何学习;只需在它决定保留什么时,添加这条新规则即可。
  • 更高的效率: 通过剔除那些“无聊”的 Token,人工智能消耗更少的能量,运行速度更快。
  • 更高的准确率: 令人惊讶的是,通过去除噪声,人工智能有时在识别事物方面表现得更好,因为它不再被无关的背景细节分散注意力。
  • 剪枝与合并的对比: 他们尝试了两种减少 Token 的方法:
    • 剪枝: 扔掉那些无聊的 Token。(效果极佳!)
    • 合并: 将无聊的 Token 与有趣的 Token 合并。(效果不如前者;与其尝试混合噪声,不如直接删除噪声。)

核心结论

这篇论文表明,在类脑计算机中,不确定性是一个信号,而非缺陷。 那些让人工智能犹豫不决、置信度波动的图像部分,实际上是最有价值的部分。通过追踪这些“时间不确定性模式”,我们可以构建出更快、更便宜、更智能的人工智能,而无需从头重新训练它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →