← 最新论文
💻 computer science

Knowledge is Power: Advancing Few-shot Action Recognition with Multimodal Semantics from MLLMs

本文提出了 FSAR-LLaVA,这是首个利用多模态大语言模型(MLLMs)作为多模态知识库,通过特征增强、提示工程构建复合任务原型以及训练-free 的多模态原型匹配度量,以端到端方式显著提升少样本动作识别性能的方法。

原作者: Jiazheng Xing, Chao Xu, Hangjie Yuan, Mengmeng Wang, Jun Dan, Hangwei Qian, Yong Liu

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiazheng Xing, Chao Xu, Hangjie Yuan, Mengmeng Wang, Jun Dan, Hangwei Qian, Yong Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 FSAR-LLaVA 的新方法,旨在解决计算机视觉中一个非常棘手的问题:“少样本动作识别”(Few-shot Action Recognition)

为了让你轻松理解,我们可以把这个问题想象成:教一个刚入职的实习生(AI 模型)如何识别各种奇怪的动作,但老板只给了它极少的参考视频(比如每个动作只看 1 到 5 遍)。

传统的做法往往效果不佳,而这篇论文提出了一套“借脑”策略,让 AI 直接利用多模态大语言模型(MLLM) 的“世界知识”来完成任务。

以下是用通俗语言和比喻对论文核心内容的解读:

1. 核心痛点:以前的方法太“笨”了

  • 传统做法(单模态): 就像让实习生只看视频,不看文字说明。如果视频很短、动作很模糊,实习生很容易把“打篮球”和“打排球”搞混。
  • 之前的“聪明”做法(CapFSAR): 让 AI 先看视频,然后写一段文字描述(比如“一个人在投篮”),再把这段文字翻译回给 AI 看,让它根据文字去找答案。
    • 比喻: 这就像你让一个人看一张画,他先把它描述成一句话,然后你再把这句话读给他听,让他根据这句话去猜画的内容。
    • 问题: 这个过程(视频→文字→视频)就像传话游戏,信息在中间环节丢失了很多,而且文字描述可能并不精准,导致最后猜错了。

2. 我们的新方案:FSAR-LLaVA(直接“借脑”)

这篇论文提出,既然现在的多模态大模型(如 Video-LLaVA) 已经像是一个博学的百科全书,既看得懂视频,又懂人类语言,我们为什么还要绕弯路呢?

FSAR-LLaVA 的核心思想是:直接利用大模型“大脑”里现成的知识,而不是让它先写文章再读文章。

关键步骤比喻:

第一步:直接提取“脑电波”(多模态特征解耦)

  • 做法: 我们不让大模型输出文字,而是直接读取它处理视频时中间层的“思维状态”(隐藏层特征)。
  • 比喻: 以前是问大模型“这是什么动作?”,它回答“是打篮球”。现在我们直接看它思考时的脑电波
  • 创新: 这些“脑电波”里混合了画面信息和语言信息。我们的方法像是一个精密的分拣机,把混合在一起的“画面信号”和“语言信号”分开,分别强化。
    • 画面信号负责看动作细节(手怎么动)。
    • 语言信号负责理解语义(这是在“打”还是“扔”)。
    • 两者互相配合,就像左脑和右脑协同工作,比单靠一边更聪明。

第二步:聪明的“原型构建”(混合任务导向原型)

  • 问题: 训练时学的动作(比如“跑步”)和测试时遇到的动作(比如“慢跑”)可能长得不一样,直接对比容易出错。
  • 做法: 我们设计了一个**“双管齐下”的参考系**。
    • 局部参考(Local): 盯着具体的每一个词或每一个画面片段,看细节是否匹配。这对文字描述特别有效(因为文字通常很规范)。
    • 全局参考(Global): 看整个视频的大致氛围和整体流程。这对视频画面特别有效(因为视频里动作千变万化,很难逐帧对齐)。
  • 比喻: 就像找朋友。有时候你靠细节(他戴了个红帽子)能认出他;有时候靠整体感觉(他走路的姿势)能认出他。我们的方法能根据情况,灵活决定是看细节还是看整体,从而缩小“训练”和“考试”之间的差距。

第三步:智能的“打分机制”(多模态原型匹配)

  • 做法: 在判断“这是不是我们要找的动作”时,我们不是把所有信息都加起来算平均分,而是只挑最重要的线索
  • 比喻: 就像在嘈杂的房间里听人说话。如果背景很吵(视频里有无关的物体),我们不会去听那些噪音,而是自动过滤掉那些不相关的词或画面,只聚焦在最关键的几个词(比如“踢”、“球”)上。
  • 效果: 这种方法叫“自适应选择”,它能自动忽略干扰项,让判断更精准。

3. 为什么这个方法很厉害?(实验结果)

  • 少即是多(参数极少): 传统的 AI 模型需要从头训练,像是一个要背完整个字典才能考试的学生。而我们的方法,大模型是现成的(冻结的),我们只需要微调一点点参数(就像只给实习生发了一张“作弊小抄”),就能达到顶尖水平。
  • 全能选手: 无论是在简单的动作识别(如“跑步”),还是复杂的动作识别(如“把东西从 A 移到 B"),它都表现优异。
  • 无需人工标注: 以前需要人工给视频打标签(告诉 AI 这是什么动作),现在我们可以直接问大模型“视频里在干什么?”,它利用自己的知识库就能理解,省去了大量人工成本。

4. 总结:一句话概括

这篇论文就像给 AI 装上了一个**“超级外脑”。它不再让 AI 笨拙地“看图说话再看图”,而是直接借用大语言模型已经学会的世界常识和视觉理解能力**,通过巧妙的“分脑”和“筛选”机制,让 AI 在只看过几次视频的情况下,就能像专家一样精准地识别出各种动作。

简单说:以前是“死记硬背”,现在是“融会贯通”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →