← 最新论文
💻 computer science

OnPoint: Offline-to-Online Multi-Level Distillation for Point-Supervised Online Temporal Action Localization

本文介绍了 OnPoint,一种离线到在线的多级蒸馏框架,该框架通过将知识从点监督的离线教师模型迁移到在线学生模型,实现了鲁棒的点监督在线时序动作定位(POTAL),从而在仅使用单点时序标注的情况下,在流式视频场景中实现了高性能。

原作者: Sakib Reza, Gauri Jagatap, Mohsen Moghaddam, Octavia Camps, Andrea Fanelli

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Sakib Reza, Gauri Jagatap, Mohsen Moghaddam, Octavia Camps, Andrea Fanelli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人识别视频中一个人是在“玩杂耍”还是在“做饭”。

旧方法(问题所在):
通常,要教机器人识别这些,你必须事先坐下来看完整段视频。你需要为每一个杂耍动作画出一个包含“确切开始”和“确切结束”的框。这就像是在给机器人看电影之前,先给了它一份完整的剧本。

  • 代价: 为成千上万个视频做这种标注需要耗费大量时间。而且,在现实世界中(比如直播体育赛事或监控摄像头),视频是流式传输的。机器人无法预知未来;它必须在动作发生的那一刻做出决策,而不能知道后面会发生什么。

新思路(“点”方案):
这篇论文的作者提出了一个更聪明的方案:OnPoint。他们说,与其画出完整的起止框,不如直接说:“只要在动作发生的那一刻,在屏幕上点一个点即可。”

  • 类比: 想象你在教一个学生识别一首歌。你不需要写下歌曲从哪一秒开始、在哪一秒结束,你只需要在副歌响起时敲一下桌子。这一下“敲击”(或“点”)就是老师所需要的关于“正在发生什么”的所有信息。

挑战:
如果你只给机器人一个“点”,并要求它进行实时工作(不看未来),它会感到困惑。它不知道这个动作会持续多久,也不知道何时停止。这就像是仅凭听到一个音符就试图猜出整首歌的长度,而此时音乐仍在播放。

解决方案:“教师-学生”系统
为了解决这个问题,OnPoint 使用了一个巧妙的 离线到在线蒸馏(Offline-to-Online Distillation) 框架。你可以把它想象成一位主厨(老师)正在训练一位副厨(学生)。

  1. 主厨(离线老师): 这个模型可以一次性看到整个视频。它拥有回看过去和向前展望的特权。尽管它只接收到人类给出的单个“点”标签,但因为它能看到整部电影,所以它可以推断出动作的确切开始和结束。它创造了一份“完美食谱”(称为伪标签/Pseudo Label)供学生遵循。
  2. 副厨(在线学生): 这是实际进行实时工作的模型。它只能看到随着流式传输而逐帧出现的视频。它无法预见未来。

他们如何互相教学(三步教学法):
主厨不仅仅是把最终答案交给副厨,它还会教给副厨三项特定的技能,以弥补无法预见未来的缺陷:

  • 技能 1:“地图”(伪分割蒸馏/Pseudo-Segment Distillation): 主厨在视频上画出完整的起止线,并说:“嘿,看,动作是从这里到那里的。”学生通过学习模仿这些边界,即使它现在还看不到全貌。
  • 技能 2:“高亮器”(类别激活蒸馏/Class-Activation Distillation): 主厨会高亮显示每一帧,并说:“这一帧肯定是在做饭,”或者“这一帧肯定是在背景中。”学生通过学习关注这些特定的时刻,从而更好地在动作发生时识别该动作。
  • 技能 3:“水晶球”(预期蒸馏/Anticipatory Distillation): 这是神奇的招数。主厨会观察视频接下来的几秒钟,并告诉学生:“嘿,准备好!在接下来的几帧内,一个烹饪动作即将开始。”这有助于学生在没有看到未来边界的情况下,去预测未来的边界。

额外的安全网:
为了确保如果主厨犯错时学生不会感到困惑,系统增加了两个安全功能:

  • “锚点”检查: 学生也会被提醒关注原始的单个“点”标签(点标签),以保持其在现实中的准确性。
  • “聚焦”过滤器: 系统教会学生忽略无聊的部分(比如静止的厨房台面),并仅将注意力集中在动作可能发生的区域。

结果:
作者在五个不同的视频数据集(如体育剪辑和厨房视频)上测试了该系统。他们发现,他们的“学生”模型虽然仅接受“点”标签训练,但在有“主厨”指导下,在实时识别动作方面表现得极其出色。它比以往尝试在没有这种师生架构下实现同样目标的模型要好得多,并且其表现几乎接近那些拥有查看完整视频和完整起止标签特权的模型的水平。

简而言之:
OnPoint 是一个系统,它让机器人能够通过仅凭每个动作的一个“点击”,就能在实时视频流中识别动作,其背后依靠的是一位全知全能、提供引导的超级聪明的老师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →