← 最新论文
💻 computer science

HOI-aware Adaptive Network for Weakly-supervised Action Segmentation

本文提出了 AdaAct,这是一种弱监督动作分割网络,它通过超网络利用视频级人机交互先验知识来动态调整其时间编码器的参数,从而有效解决相似动作之间的歧义。

原作者: Runzhong Zhang, Suchen Wang, Yueqi Duan, Yansong Tang, Yue Zhang, Yap-Peng Tan

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Runzhong Zhang, Suchen Wang, Yueqi Duan, Yansong Tang, Yue Zhang, Yap-Peng Tan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人观看烹饪节目,并逐秒记录厨师正在执行的具体步骤。机器人知道食材和步骤的列表(例如“倒果汁”、“切橙子”、“挤压”),但它不知道每个步骤何时开始或结束。这就是弱监督动作分割所面临的挑战。

问题在于,许多烹饪步骤看起来几乎完全相同。倒咖啡和倒橙汁看起来非常相似。如果机器人只观察它正前方短短几秒的画面,它可能会感到困惑,并在厨师实际上正在制作果汁时说道:“哦,那是咖啡!”

这篇论文介绍了一个名为AdaAct的新系统来解决这种混淆。以下是其工作原理,使用了简单的类比:

1. “上下文线索”侦探

大多数旧方法就像一位只盯着眼前犯罪现场的侦探。他们看到一只手拿着杯子倒液体。如果没有更多信息,他们只能猜测。

AdaAct则像一位在做出猜测前会审视整个视频的侦探。它会问:“视频中有哪些物体?”

  • 如果视频中包含一把、一个橙子和一个榨汁器,机器人就会知道:“啊,这绝对是果汁!”
  • 如果视频中包含一个咖啡壶咖啡豆,它就知道:“这是咖啡!”

论文将这些物体及其交互称为HOI(人机交互)。该系统不仅仅是观察动作,而是扫描整个视频以寻找这些“线索”(如橙子或咖啡壶),并利用它们来指导其理解。

2. “变形”大脑

这里是巧妙之处。通常,计算机程序拥有一个“固定大脑”。一旦训练完成,其设置就不会改变。这就像一位无论食材如何都总是以同一种方式烹饪的厨师。

AdaAct拥有一个变形大脑(技术上称为“自适应网络”)。

  • 这就像一位聪明的厨师,会根据厨房里的食材改变烹饪风格。
  • 当系统看到“橙子”线索时,它会立即调整内部设置,成为识别“制作果汁”的专家。
  • 当它看到“咖啡壶”线索时,它会立即切换设置,成为“制作咖啡”的专家。

它通过利用一份特殊的“操作手册”(即超网络)来实现这一点,该手册会根据它在视频中找到的线索,实时重写机器人自身的规则。

3. 它是如何学习的(两步过程)

该系统通过两种方式学习,就像学生为考试复习一样:

  1. 通用知识(与 HOI 无关): 它学习适用于所有烹饪视频的通用规则(例如,“烹饪视频通常包含大量切菜动作”)。
  2. 特定线索(与 HOI 相关): 它观察当前正在观看的特定视频,以寻找独特的线索(例如,“这个特定视频里有一个榨汁器”)。

它将这两类知识混合在一起,以做出最终决定。

结果

研究人员在两个流行的烹饪视频数据集上测试了该系统:Breakfast(制作早餐)和50Salads(制作沙拉)。

  • 解决的问题: 该系统在区分相似动作(如倒咖啡与倒果汁)方面变得更为出色。
  • 结果: 它在该特定类型的任务中取得了有记录以来的最佳成绩。它不仅仅是猜测;而是利用视频中的“线索”来确切知道正在发生什么。

简而言之: AdaAct 是一个视频观察者,它不仅仅观察动作;它还会观察正在使用的工具来判断动作是什么,并且会根据它看到的工具调整自己的大脑设置。这防止了它在两个动作看起来相同时感到困惑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →