← 最新论文
💻 computer science

Online Episodic Memory Visual Query Localization with Egocentric Streaming Object Memory

本文介绍了 ESOM,这是一个用于第一视角视频流中在线情景记忆检索的新型框架,该框架通过使用紧凑的记忆体对帧进行单次处理以定位物体,在展示出优于现有在线方法的性能的同时,也强调了改进物体发现与追踪以进一步提升准确性的紧迫性。

原作者: Zaira Manigrasso, Matteo Dunnhofer, Antonino Furnari, Moritz Nottebaum, Antonio Finocchiaro, Davide Marana, Rosario Forte, Giovanni Maria Farinella, Christian Micheloni

发布于 2026-06-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Zaira Manigrasso, Matteo Dunnhofer, Antonino Furnari, Moritz Nottebaum, Antonio Finocchiaro, Davide Marana, Rosario Forte, Giovanni Maria Farinella, Christian Micheloni

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你戴着一个摄像头,它记录了你从醒来到入睡的一整天。现在,想象你忘记把钥匙放在哪儿了,或者你不记得有没有锁车库门。你问摄像头:“显示我最后一次拿钥匙是什么时候。”

这就是这篇论文要解决的问题。但有一个难点:现实世界的摄像头无法存储所有内容。

问题:“离线”与“在线”的抉择

旧方法(离线):
把旧方法想象成一个直到一天结束才去破案的侦探。他们拥有保存了全天视频文件的巨大硬盘。当你问“我的钥匙在哪儿?”时,他们会回放整部电影,一帧一帧地搜索钥匙。

  • 问题所在: 这需要存储数以 TB 计的数据(就像一个电影图书馆),并且搜索起来非常耗时。对于像眼镜或手表这样的小型可穿戴设备来说,不可能携带那么多内存或拥有那么大的电池功率。

新方法(在线):
作者提出了一个名为 OVQ2D(在线视觉查询 2D)的新游戏。

  • 类比: 想象你正在一个繁忙的城市中行走。你无法在脑海中携带整座城市的地图。相反,你有一个智能笔记本。当你行走时,你只记录下此时此刻看到的重要的东西(比如“我看到了一辆红色的巴士”、“我看到了一家咖啡店”)。你会丢弃其余的场景。
  • 挑战: 稍后,当有人问“那辆红色的巴士在哪里?”时,你必须在笔记本中找到它。但难点在于:你在看到那辆红色巴士之前,并不知道会被问到这个问题。你必须在当下做出决定:“这个巴士是否重要到值得我记下来?”而你并不知道未来会发生什么。

解决方案:ESOM(智能笔记本)

论文介绍了一个名为 ESOM(自我中心流式物体记忆)的系统。把 ESOM 想象成一个三人团队,他们协同工作来保持那个智能笔记本井然有序:

  1. 观察者(物体发现):
    这个人实时扫描每一帧视频。他们会大喊:“嘿,我看到一只狗!我看到一辆车!我看到一个三明治!”他们就像是一个发现新事物的保安。
  2. 追踪者(物体追踪):
    一旦观察者找到了某个物体,追踪者就会接管。他们会跟随那个特定物体移动。“好的,那只狗正在向左走,现在它躲到了树后,现在它消失了。”他们会保持该物体的 ID 卡处于激活状态,这样你就不会丢失对它的追踪。
  3. 管理员(物体记忆):
    这个人决定哪些内容真正被写进笔记本。他们不会记录视频中的每一个像素(那样太沉重了)。相反,他们会写下一条精简的笔记:“下午 2:00,一只狗位于这个位置。这是它的一张小照片。” 然后他们会丢弃其余的视频。

当你提问时它是如何工作的

当你稍后问“那只狗在哪里?”时,系统并不会去看原始视频(因为视频已经没了)。相反,它会翻阅它的智能笔记本

  • 它将你的问题(“显示那只狗”)与笔记本中的照片进行对比。
  • 它会找到最佳匹配项。
  • 它会向你展示笔记序列:“这是 2:00 的狗,这是 2:01 的,这是 2:02 的。”
  • 结果: 你能瞬间得到答案,且消耗极少的内存和电量。

结果:好消息与坏消息

研究人员在大型真实生活视频数据集(Ego4D)上对该系统进行了测试。

  • 好消息: ESOM 比其他“在线”方法表现得更好。它很快(在几秒钟内就能找到答案,而不是几分钟),并且使用的内存极少(1.7 GB 而不是 12 GB)。它证明了你确实可以在不存储整个视频的情况下实现这一点。
  • 坏消息: 这仍然非常困难。该系统的成功率仅为 4% 左右。
    • 为什么? 因为“观察者”和“追踪者”目前还不完美。在现实生活中,物体移动很快,会被其他人遮挡,或者看起来很模糊。如果观察者错过了那只狗,或者追踪者丢失了它,管理员就没有东西可以记录,答案也就丢失了。
    • “魔法”测试: 研究人员运行了一个模拟实验,假设观察者和追踪者是完美的(就像拥有一个超人类助手一样)。在这种情况下,成功率跃升至 82%。这证明了这个想法本身是完美的;我们只需要更好的观察者和追踪者工具。

总结

这篇论文介绍了一种让可穿戴摄像头像人类记忆一样工作的新方法:观察、只记住重要的部分,并忘掉其余的部分。 他们构建了一个名为 ESOM 的系统来实现这一高效过程,证明了在不保存全天视频的情况下回答“X 在哪里?”是可行的。然而,该系统目前仍受限于计算机在混乱的现实世界视频中识别和追踪物体的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →