← 最新论文
💻 computer science

Concepts in Motion: Temporal Concept Bottleneck Model for Interpretable Video Classification

本文介绍了 MoTIF,这是一个基于 Transformer 的框架,它通过利用类条件视觉语言模型自动发现时间概念,并借助每概念自注意力机制对其动态模式进行建模,从而增强可解释视频分类,进而弥合可解释模型与黑盒视频基线之间的性能差距。

原作者: Patrick Knab, Sascha Marton, Philipp J. Schubert, Drago Guggiana, Christian Bartelt

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Patrick Knab, Sascha Marton, Philipp J. Schubert, Drago Guggiana, Christian Bartelt

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教计算机识别视频中正在发生的事情,比如有人正在拉弓射箭。大多数现代人工智能模型就像超级聪明却沉默的魔术师。它们能给出正确答案(它们会说“是的,那是射箭!”),但如果你问它们为什么,它们只会用黑箱盯着你。你无法看到它们的思考过程。

本文介绍了一个名为MoTIF(可移动时间可解释框架)的新系统。不要把 MoTIF 想象成魔术师,而要把它想象成一位井井有条的侦探,它通过逐一核对特定线索清单来破案,同时记录每条线索出现的时间日记。

以下是其工作原理的分解说明:

1. “线索清单”(概念)

MoTIF 不是将视频视为模糊的像素堆,而是将其分解为人类可理解的“概念”清单。

  • 旧方法: 标准人工智能一次性观看整个视频并进行猜测。
  • MoTIF 方法: 它会问:“我是否看到了?我是否看到了?我是否看到有人正在骑上马?我是否看到他们正在射击?”
  • 魔术技巧: 本文使用一种特殊的“智能助手”(视觉 - 语言模型)从训练视频中自动生成这份线索清单。它不需要人类来编写清单;人工智能会自行判断“弓”和“射击”是需要寻找的重要词汇。

2. “日记”(时间至关重要)

这是最重要的一部分。在照片中,弓就只是弓。在视频中,时间就是一切

  • 如果你先看到弓,然后看到人,接着看到射击动作,那就是射箭。
  • 如果你先看到射击动作,然后看到弓,接着看到人,那就很奇怪,可能根本不是射箭。

大多数人工智能模型会将所有这些线索混合在一起,变成一大杯“冰沙”,从而丢失了顺序。MoTIF 则不同。它为每条线索保留一本独立的日记

  • 它有一本“弓日记”,追踪弓出现的时间。
  • 它有一本“射击日记”,追踪射击发生的时间。
  • 它有一本“上马日记”,用于记录马匹。

它使用一种特殊的“注意力”机制(将其想象为聚光灯),只查看弓日记来决定弓何时重要,查看射击日记来决定射击何时重要。它从不混淆这些日记。这确保了如果人工智能说“弓”,你就确切知道它在视频的哪个时刻看到了弓。

3. “判决”(预测)

一旦日记填写完毕,MoTIF 就会汇总这些笔记。

  • 它查看“弓”条目:“出现在第 2 秒。”
  • 它查看“射击”条目:“出现在第 5 秒。”
  • 它通过数学公式(Log-Sum-Exp 池化)将这些信息结合起来,做出最终决定:“射箭”。

因为它将日记分开保存,所以它能确切告诉你为什么做出该选择。它可以说:“我选择‘射箭’是因为我在第 2 秒看到了弓,在第 5 秒看到了射击动作。”

4. “如果”测试(干预)

本文表明,由于该系统如此透明,你实际上可以编辑它的思维来修正错误。

  • 场景: 人工智能看到一个人坐在理发椅上的视频,错误地认为这是“刮胡子”。
  • 修正: 研究人员可以手动关闭系统中的“理发椅”线索。
  • 结果: 人工智能立即改变主意,说:“哦,等等,没有椅子的话,这实际上是‘涂口红’!”
    这证明该系统不仅仅是在猜测;它实际上依赖于你可以看见和触碰的具体线索。

为什么这很重要?

作者在多个视频数据集(如人们做早餐任务、体育运动和随机动作)上测试了 MoTIF。

  • 准确性: 它的表现几乎与那些无人能懂的“黑箱”模型一样好。
  • 可解释性: 与黑箱不同,MoTIF 可以向您展示它何时看到弓、马或箭的地图。
  • 权衡: 本文承认,严格分开日记(以便您可以信任线索)有时会使人工智能的准确性略低于允许混合线索的情况。然而,他们发现这种“混合”会使人工智能更难理解,因此他们选择保持日记分开,以优先考虑可信度。

总结

MoTIF 就像一位视频侦探,它通过按特定顺序(时间)核对线索(概念)清单来破案。它不仅仅是猜测;它记录了它确切看到弓、箭和马的时间,让人类可以站在它身后,确切了解它是如何得出结论的。它弥合了“聪明但神秘”的人工智能与“聪明且可解释”的人工智能之间的鸿沟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →