← 最新论文
💻 computer science

Manta: Enhancing Mamba for Few-Shot Action Recognition of Long Sub-Sequence

本文提出了名为 Manta 的框架,通过引入嵌套式 Mamba 结构以增强局部特征建模与隐式时间对齐,并结合混合对比学习范式来缓解长视频子序列中的类内方差累积问题,从而在多个基准数据集上实现了小样本动作识别的新的最先进性能。

原作者: Wenbo Huang, Jinghui Zhang, Guang Li, Lei Zhang, Shuoyuan Wang, Fang Dong, Jiahui Jin, Takahiro Ogawa, Miki Haseyama

发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenbo Huang, Jinghui Zhang, Guang Li, Lei Zhang, Shuoyuan Wang, Fang Dong, Jiahui Jin, Takahiro Ogawa, Miki Haseyama

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 Manta(中文可译为“曼塔”)的新人工智能模型。它的主要任务是**“少样本动作识别”**,简单来说,就是让 AI 在只看过很少几个视频样本的情况下,就能认出视频里的人在做什么动作。

为了让你更容易理解,我们可以把这篇论文的核心思想想象成**“教一个刚入职的侦探如何快速破案”**。

1. 背景:侦探面临的两个难题

现在的 AI 侦探(以前的模型)在识别长视频动作时,主要面临两个大麻烦:

  • 难题一:只见森林,不见树木(全局 vs 局部)

    • 比喻:想象你要识别“跳水”这个动作。视频很长,大部分时间运动员都在走路、热身、甚至发呆。只有中间那一两秒是真正的“跳水”和“入水”。
    • 旧模型的问题:以前的 AI 像是一个只看“大画面”的侦探。它把整个视频当成一个整体来看,结果被那些无关紧要的“走路”画面干扰了,忽略了最关键的“入水”瞬间。
    • 长视频的副作用:视频越长,这种“无关画面”就越多,AI 越容易晕头转向。
  • 难题二:同一个人,不同的样子(类内方差积累)

    • 比喻:同样是“跳水”,有人从左边跳,有人从右边跳;有人光线好,有人光线暗;有人穿红衣服,有人穿蓝衣服。
    • 旧模型的问题:以前的 AI 觉得这些画面差异太大了,根本认不出它们其实是同一个动作。视频越长,这些差异(比如光线变化、角度变化)就积累得越多,AI 就越容易把“跳水”误判成“游泳”或“跑步”。

2. Manta 的解决方案:两个超级法宝

Manta 模型通过两个创新设计来解决上述问题,我们可以把它们想象成侦探的**“放大镜”“心理战术”**。

法宝一:套娃式 Mamba(Matryoshka Mamba)—— 像俄罗斯套娃一样看视频

以前的 AI 像是一个只会看全景图的广角镜头。Manta 换了一种思路,它像俄罗斯套娃一样,分层次地观察视频:

  • 内层模块(Inner Modules)—— 拿着放大镜找细节
    • 做法:它不直接看整个长视频,而是把视频切成很多小片段。
    • 作用:就像侦探拿着放大镜,专门盯着那些关键的“小片段”(比如“入水”的那一瞬间)。不管这个关键动作在视频的开头、中间还是结尾,它都能精准捕捉到。
  • 外层模块(Outer Module)—— 把碎片拼成时间线
    • 做法:在找完细节后,它再把这些碎片按照时间顺序重新拼起来。
    • 作用:这就像侦探把线索串起来,不仅知道“发生了什么”,还知道“什么时候发生的”。它自动对齐了时间线,解决了“动作发生时间不一致”的问题。
  • 为什么叫“套娃”?
    • 因为它用了多尺度(Multi-scale)设计。就像套娃有大有小,Manta 会同时用“大框”看整体趋势,用“小框”看细节,最后把不同尺度的观察结果融合在一起,既全面又精准。

法宝二:混合对比学习(Hybrid Contrastive Learning)—— 让相似者更近,相异者更远

为了解决“同一个人长得不一样”的问题,Manta 引入了对比学习,这就像是在训练侦探的“直觉”:

  • 有监督学习(给标签):告诉 AI,“这两个视频虽然光线不同,但都是‘跳水’,把它们归为一类”。
  • 无监督学习(没标签):即使没有标签,AI 也要自己发现,“这两个视频虽然看起来有点乱,但核心动作很像,应该也是一类”。
  • 混合威力:通过这种“双管齐下”的训练,AI 学会了忽略那些无关紧要的干扰(比如光线、背景、衣服颜色),只抓住动作的核心本质。这样,无论视频多长、干扰多大,它都能把属于同一类的动作紧紧聚在一起,把不同的动作分开。

3. 为什么 Mamba 比 Transformer 好?

以前的 AI 模型(基于 Transformer)在处理长视频时,就像是在读一本几千页的书,每读一页都要回头翻一遍前面的内容,计算量巨大,速度很慢,甚至电脑会卡死(显存溢出)。

Manta 使用的 Mamba 架构,则像是一个高效的速记员。它不需要回头反复翻书,而是顺着读下去,同时智能地记住重点、遗忘废话。这使得 Manta 不仅能处理超长视频(以前只能处理很短的片段),而且速度更快、更省电

4. 总结:Manta 的成就

简单来说,Manta 就是一个**“既眼尖(能抓细节),又心细(能对齐时间),还记性好(能抗干扰)”**的超级侦探。

  • 它做到了什么? 在多个国际权威的动作识别比赛(如 SSv2, Kinetics 等)中,它都拿到了第一名(SOTA,State-of-the-Art)
  • 它的优势? 即使视频很长、样本很少、画面很乱,它也能准确识别出动作是什么。
  • 实际意义? 这意味着未来的智能监控、医疗康复分析、体育训练辅助等应用,可以更高效、更准确地理解人类的长视频动作,而不再需要海量的标注数据。

一句话总结: Manta 就像给 AI 装上了一套“俄罗斯套娃”式的观察镜和一套“去伪存真”的过滤网,让它能在又长又乱的视频里,一眼看穿动作的本质。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →