← 最新论文
💻 computer science

Revisiting Weakly-Supervised Video Scene Graph Generation via Pair Affinity Learning

该论文提出了一种通过成对亲和力学习(PALS)和关系感知匹配(RAM)机制,有效抑制弱监督视频场景图生成中非交互对象噪声并提升推理性能的新方法,在 Action Genome 数据集上实现了最先进的效果。

原作者: Minseok Kang, Minhyeok Lee, Minjung Kim, Jungho Lee, Donghyeong Kim, Sungmin Woo, Inseok Jeon, Sangyoun Lee

发布于 2026-03-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Minseok Kang, Minhyeok Lee, Minjung Kim, Jungho Lee, Donghyeong Kim, Sungmin Woo, Inseok Jeon, Sangyoun Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲的是如何让电脑更聪明地看懂视频里的“人物关系”,而且不需要人类花大量时间去画框标注。

我们可以把这项技术想象成教一个刚入职的“视频观察员”如何写一份精准的“人物关系报告”

1. 核心难题:观察员被“路人甲”淹没了

想象一下,你派一个观察员去拍一段视频,让他记录谁和谁在互动(比如“人拿着杯子”)。

  • 传统做法(全监督):你给观察员一张完美的地图,上面标好了每个人、每个杯子在哪里。观察员只需要照着地图写报告,非常准确。但这太贵了,因为你要给视频里的每一帧都画框,工作量巨大。
  • 弱监督做法(本文背景):为了省钱,你只告诉观察员:“这段视频里,有个人拿着杯子”,但你没告诉他具体是哪个杯子,也没告诉他人在哪。
  • 问题所在:观察员只能靠自己的眼睛(现成的物体检测器)去视频里找。结果他找了一堆东西:人、杯子、桌子、椅子、远处的电视、墙上的画……
    • 在视频里,“拿着杯子”的人可能只占所有“人”和“杯子”组合的很小一部分。
    • 剩下的绝大多数组合(比如“人”和“远处的杯子”、“人”和“电视”)其实没有任何互动
    • 以前的弱监督方法,就像让观察员把找到的所有“人 + 物体”组合都当成“正在互动”来学习。结果,观察员被海量的“假互动”(噪音)淹没了,学歪了,最后写出的报告全是错的。

2. 本文的解决方案:给观察员装上“三件法宝”

作者提出了一个名为 PALS 的框架,给观察员配备了三个新技能,让他能过滤掉噪音,抓住重点。

法宝一:关系感知匹配 (RAM) —— “用语言去指路”

  • 问题:视频里有三个杯子,观察员不知道哪个是“人手里拿着”的那个。以前的方法会盲目地把三个杯子都当成目标,导致标签贴错。
  • 比喻:这就像你给观察员一张模糊的寻人启事,上面写着“找那个手里拿着杯子的杯子”。
  • 做法:作者利用了一个强大的“图文理解模型”(像是一个懂语言又懂图的超级助手)。当看到“人拿着杯子”这个描述时,这个助手会去视频里仔细分辨,只把那个真正被拿着的杯子标记为“真目标”,而忽略旁边没被拿的杯子。
  • 效果:给观察员提供的训练数据(标签)更干净、更准确了,就像把“寻人启事”从模糊变成了高清。

法宝二:成对亲和力学习 (PALS) —— “给每对组合打分”

  • 问题:即使有了干净的标签,观察员在考试(推理)时,面对成千上万个“人 + 物体”的组合,还是分不清哪些是“真互动”,哪些是“瞎凑对”。
  • 比喻:以前观察员只给“拿着杯子”这个动作打分。现在,我们教观察员给每一对人 + 物体的组合打一个“亲密分”(Affinity Score)。
    • 如果一个人和一个杯子离得很近,且动作协调,亲密分就高(比如 0.9)。
    • 如果一个人站在远处看着一个杯子,或者杯子在另一个房间,亲密分就低(比如 0.1)。
  • 做法:模型专门学习判断“这两个东西是不是在互动”,而不是只学习“这是什么动作”。
  • 效果:在生成最终报告时,观察员会优先把“亲密分”高的组合排到前面,自动把那些“虽然都在画面里但没关系”的组合(噪音)踢出去。

法宝三:成对亲和力调制 (PAM) —— “给大脑装个过滤器”

  • 问题:即使最后排除了噪音,观察员在思考过程中(也就是模型内部分析时),还是会受到那些“假互动”的干扰。比如,他在分析“人拿着杯子”时,脑子里还在想“人看着电视”这个无关信息,导致思路混乱。
  • 比喻:这就像在一个嘈杂的房间里开会。以前,每个人(每个物体组合)都在大声说话,干扰了真正在讨论“拿着杯子”的人。
  • 做法:PAM 就像一个智能静音按钮。它根据刚才学到的“亲密分”,自动把那些“不亲密”的组合的声音关小,让“亲密”的组合之间能更专注地交流信息。
  • 效果:观察员在思考时,能更专注于真正相关的线索,排除干扰,推理更准确。

3. 总结与成果

简单来说
以前的弱监督方法像是在嘈杂的菜市场里教人认亲戚,人太多太乱,根本学不会。
这篇论文的方法是:

  1. 先清理现场(RAM):用语言描述把真正相关的亲戚找出来,把路人甲请出去。
  2. 教人打分(PALS):教观察员给每对亲戚的“亲密度”打分,只关注亲密度高的。
  3. 开会静音(PAM):在思考时,自动屏蔽掉那些不相关的噪音,让重点更突出。

结果
在著名的 Action Genome 数据集上,这个方法让弱监督(只给少量文字描述,不画框)的效果突飞猛进,甚至达到了全监督(画了所有框)效果的 88%~94%。这意味着我们以后可以用极低的成本,让 AI 看懂视频里复杂的人物关系,而且非常精准。

一句话总结
这就好比给 AI 装上了一副“降噪耳机”和“聚光灯”,让它能在混乱的视频世界里,一眼看穿谁和谁才是真正在“谈恋爱”(互动),而不是在“擦肩而过”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →