← 最新论文
💻 computer science

See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval

该论文提出了 SMORE,这是一个用于视频时刻检索(Video Moment Retrieval)的内存高效型框架,它利用查询引导的标题、重要性调制以及自适应帧压缩,在克服密集帧处理内存限制的同时,在多个基准测试上实现了最先进的性能。

原作者: Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim

发布于 2026-01-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一部 2 小时的电影,但你只有一个小笔记本来记录电影中发生的事情。你需要根据描述找到特定的场景,比如:“小狗追红球的那一刻。”

问题所在:
目前的 AI 系统通常尝试用两种方式来解决这个问题,但这两种方式都有缺陷:

  1. “稀疏快照”法(The "Sparse Snapshot" approach): 它们每隔几秒钟对电影进行随机抓拍。如果小狗在两次快照之间跑过屏幕,AI 就会完全错过它。这就像通过只看第 1 页、第 50 页和第 100 页来试图读完一本书。
  2. “全量描述”法(The "Full Description" approach): 它们试图为电影中的每一秒钟都写下详细的总结。这确实捕捉到了所有内容,但会迅速填满你的笔记本(内存),导致计算机在完成之前就崩溃了。

解决方案:SMORE (See MORE, store less / 看得更多,存得更少)
作者提出了一个名为 SMORE 的新框架。把它想象成一个超级聪明的、具备高内存效率的助手,它甚至在开始阅读剧本之前,就已经知道你在寻找什么了。

SMORE 是如何工作的,它使用了三个简单的技巧:

1. “定制荧光笔”(查询引导的描述)(The "Customized Highlighter")

与其写下像“一只狗正在走动”这样通用的笔记,SMORE 会先倾听你的具体问题。

  • 旧方法: AI 写道:“一只狗正在走动。”(过于笼统,可能无法帮你找到特定的场景)。
  • SMORE 方法: 如果你问:“在哪里能看到小狗追球?”,AI 会观察视频并写道:“一只小狗正在追球。”
  • 类比: 想象一位图书管理员,他不是仅仅根据书的颜色来编目,而是先阅读你的需求(“我需要一本关于太空的书”),然后他在相关的书上写下一条特殊的注释说:“这本是关于太空的!”这确保了笔记与你寻找的内容完全匹配。

2. “音量旋钮”(查询感知的权重)(The "Volume Knob")

并非所有的笔记都同样重要。有些场景只是背景噪音;而有些则是重头戏。

  • 工作原理: SMORE 给它写的每一条笔记都配了一个“音量旋钮”。如果一条笔记完美契合你的搜索,它就会调高音量(高重要性)。如果一条笔记是关于无关内容的(比如当你询问小狗时,背景里有一只猫在睡觉),它就会调低音量。
  • 类比: 这就像一位 DJ 在混音播放列表。当你想听的那首歌出来时,DJ 会把音量调大。当你不感兴趣的歌曲播放时,他会逐渐减弱声音,以免分散你的注意力。这有助于 AI 只关注视频中“响亮”(重要)的部分。

3. “智能压缩器”(结构化视觉压缩)(The "Smart Compressor")

视频通常包含许多看起来几乎相同的帧(例如,汽车在直路上行驶 10 秒钟)。存储每一帧是非常浪费空间的。

  • 工作原理: SMORE 会观察连续的帧。如果两帧几乎相同,它不会直接丢弃其中一帧(因为这会丢失信息),而是通过数学手段将它们“挤压”在一起,变成一个紧凑的摘要,同时保留最重要的细节。
  • 类比: 想象你有一叠 100 张落日照片,太阳几乎没有移动。与其保留全部 100 张照片,不如取其中最好的 5 张,并将它们融合为一张高质量的“超级照片”,在不需要 100 个独立文件的同时,捕捉到整个运动过程。

结果

该论文在三个主要的视频数据库(QVHighlights, Charades-STA, 和 ActivityNet-Captions)上测试了这个系统。

  • 性能: SMORE 在寻找正确视频时刻方面的表现击败了目前的顶尖模型(如 Chrono 和 LLaVA-MR)。
  • 效率: 它在实现更好效果的同时,使用了更少的内存。虽然其他顶级模型需要一个庞大且昂贵的计算芯片(80GB 显存)才能运行,但 SMORE 可以在更小、更常见的芯片(48GB 显存)上实现更好的结果。

简而言之:
SMORE 就像一名侦探,他们不仅仅是盲目地阅读整个案卷。相反,他们会根据你提供的特定线索进行阅读,高亮显示相关页面,调低噪音,并总结掉那些无聊的部分,以便更快地破解谜团。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →