✨ 要点🔬 技术摘要
想象一下,你正在观看一段 10 分钟的狗狗在公园玩耍的视频。一个试图理解这段视频的标准 AI 模型,就像一位非常勤奋但疲惫不堪的学生,他试图阅读脚本中的每一个字 ,甚至包括狗狗只是静坐不动或镜头扫过空荡草地的部分。这位学生阅读每一个字,记录每一个字的笔记,然后尝试总结故事。这样做虽然准确,但耗时极长,且消耗巨大的脑力(计算能力)。
这篇论文介绍了一种名为LookWhen 的新方法。可以将 LookWhen 想象为一位聪明的编辑,他确切地知道何时 该关注、何处 该查看以及什么 该记录下来,从而无需阅读每一个字就能理解整个故事。
以下是其工作原理,分为三个简单的部分:
1. “快速一瞥”编辑(选择器)
首先,LookWhen 拥有一位“浅层”编辑。这位编辑速度快,且没有巨大的记忆容量。他们获取的是视频的微小、模糊且缩小后的版本。
他们做什么 :他们快速扫描整个视频,并根据每个小片段(称为“令牌”)的独特性 为其打分。
类比 :想象你在观察一群人。大多数人穿着相同的蓝色衬衫(冗余)。但有一个人戴着鲜艳的红色帽子并在玩杂耍。“快速一瞥”编辑会忽略那片蓝色的衬衫海洋,只指向那个戴红帽子的人。
目标 :找到真正讲述故事的“独特”时刻,而不是那些无聊、重复的部分。
2. “深度思考者”(提取器)
接下来,LookWhen 拥有一位“深层”专家。这位专家非常聪明且拥有巨大的记忆容量,但他们懒得做不必要的工作。
他们做什么 :他们只查看“快速一瞥”编辑所指出的特定片段(前 K 个独特的令牌)。
类比 :这位专家只研究戴红帽子的人以及周围寥寥几人。他们忽略了人群中的其他人。尽管他们没有观察每一个人,但由于专注于最重要的细节,他们仍然能准确告诉你视频中发生了什么。
3. 向两位老师学习
系统如何学会如此聪明?在练习阶段,它利用两个不同的“老师”(预训练的 AI 模型)进行训练:
视频老师 :教导系统如何将整个视频理解为一个故事。
图像老师 :教导系统如何识别变化。由于视频只是一系列图像的集合,这位老师帮助系统学习从一帧到下一帧什么 发生了变化。
“Top1-距离”技巧 :为了教导“快速一瞥”编辑识别什么是独特的,系统使用了一个巧妙的数学技巧。它会问:“这段视频片段与其他所有片段相距多远?”如果一段视频片段与其邻居看起来非常不同(例如在草地上奔跑的狼),它就会获得高分。如果它看起来与旁边的草地一模一样,它就会获得低分。这有助于系统忽略无聊、重复的部分。
为什么这很重要?
论文声称,LookWhen 比当前的顶级模型更快、能耗更低,同时不会牺牲准确性。
结果 :在六个不同视频数据集(如识别人物跳水、烹饪或做手势)的测试中,LookWhen 的速度通常比领先的模型 InternVideo2 快 6.7 倍 ,同时保持了相同的准确性。
权衡 :这就像在 10 分钟内获得一本高质量的书的摘要,而不是花 10 个小时读完整本书。
论文未 声称的内容
作者谨慎地表示,这是一种通用的视频识别工具。他们并未声称其目前可用于医疗诊断、自动驾驶汽车或安全监控。他们还承认,他们当前的版本在标准尺寸的视频上表现最佳,并且未来需要寻找更好的“老师”来处理更长或更复杂的视频。
简而言之 :LookWhen 是一种视频 AI,它学会了忽略无聊的内容。它能快速识别独特且重要的时刻,并忽略其余部分,从而使其能够比以往的方法更快、更廉价地理解视频。
技术摘要:LookWhen——通过学习何时、何地以及计算什么来实现快速视频识别
1. 问题陈述
Transformer 已成为视频识别的主导架构,它将视频分割为数千个令牌(tokens)。然而,其计算成本随令牌数量呈超线性增长,为处理长视频造成了显著瓶颈。虽然视频包含大量冗余(某些令牌是冗余的,另一些则可从周围环境推断),但标准 Transformer 无论是否有必要,都会处理所有令牌。现有的自适应计算方法通常在中间层合并令牌,或依赖可能包含伪影或不相关噪声的注意力图,未能充分利用稀疏性,同时要么牺牲了准确性,要么因存在对 GPU 不友好的操作而产生了高昂的运行时开销。
核心挑战在于将视频识别分解为三个独立的学习任务:
何时(When): 确定需要处理的时序时刻。
何地(Where): 识别需要处理的空间位置。
什么(What): 定义需要提取的表示。
这需要快速分离出负责输出表示的输入令牌(以提升效率),同时仅使用稀疏的令牌子集来准确近似稠密视频表示。
2. 方法论:LookWhen 框架
LookWhen 引入了一个专为视频设计的选择器 - 提取器(selector–extractor)框架 ,在之前基于图像的工作(LookWhere)基础上,通过关键的架构和预训练适应进行了扩展。
2.1 架构
该模型由两个不同的组件组成:
浅层选择器(Shallow Selector): 接收降采样视频 (在时间、高度和宽度上均被缩减)。它处理完整输入以对所有时空令牌进行评分,但由于其深度较浅(3 层 Transformer)且输入分辨率降低,计算成本低廉。它输出一个选择器图(selector map)以识别信息量最大的令牌。
深层提取器(Deep Extractor): 仅接收来自全分辨率视频的前 K 个选中令牌 (以及视频和帧令牌)。它是一个深度大、表达力强的模型(ViT-B 大小),仅利用这些稀疏输入来近似全视频表示。
2.2 预训练策略
一项关键创新是为选择和提取定义了有效的监督目标,解决了视频领域缺乏合适“教师”的问题。
A. 选择目标:学习“何时”和“何地”
注意力的问题: 来自视频教师(如 InternVideo2)的标准注意力图通常包含伪影或噪声,使其成为糟糕的选择目标。
解决方案(Top1-Distance): 选择器不是被训练去预测注意力,而是被训练去预测令牌的独特性 。
使用具有空间定位特征的图像教师(DINOv3)来计算所有图块的特征。
一种“Top1-Distance"算法计算每个图块与其在特征空间中最近邻之间的余弦相似度。
与其最近邻距离最大 的令牌(即最独特/最孤立的)排名最高。
选择器学习预测这种独特性得分,从而有效地选择冗余度最低的令牌。
B. 提取目标:学习“什么”
双教师蒸馏: 提取器被训练以近似来自两个冻结教师的表示:
视频教师(InternVideo2): 提供代表全局上下文的全局视频令牌。
图像教师(DINOv3): 提供帧级和图块级特征。
时间归一化: 为了教导提取器视频内部变化 的内容(这对细粒度任务至关重要),DINOv3 的逐帧类别令牌在拼接前会进行时间归一化(零均值,单位方差)。这创建了一个强调时序动态而非静态内容的目标。
损失函数: 模型最小化组合损失:
L m a p L_{map} L ma p :预测的选择器图与目标选择器图之间的二元交叉熵。
L v i d e o L_{video} L v i d eo :提取器的视频令牌与教师的视频令牌之间的均方误差(MSE)。
L f r a m e L_{frame} L f r am e 和 L p a t c h L_{patch} L p a t c h :帧和图块令牌的 MSE 损失,其中 DINOv3 特征在时空上进行了归一化。
2.3 推理
在推理和微调期间,教师被丢弃。系统高效运行:浅层选择器对降采样视频进行评分以挑选前 K 个令牌,深层提取器仅处理这些选中的令牌以生成下游任务的特征。
3. 主要贡献
框架向视频的扩展: 作者通过将架构(浅层选择器、深层提取器)和预训练目标进行调整以适应时空冗余,将选择器 - 提取器范式扩展到了视频领域。
新颖的选择机制: 他们引入了Top1-Distance ,一种基于特征空间独特性而非注意力图来训练选择器的方法。这避免了对无伪影注意力的需求,并有效地识别冗余令牌。
双教师提取: 他们提出了一种预训练策略,同时使用视频教师(用于全局上下文)和具有时间归一化特征的图像教师(用于学习时序变化),使提取器能够学习通用的细粒度表示。
无需硬件约束的效率: 与可能受限于 Flash Attention 兼容性或高峰值内存的令牌合并方法不同,LookWhen 使用标准的深度学习操作,使其在实践中非常高效。
4. 实验结果
作者在六个数据集上评估了 LookWhen:Kinetics-400 (K400)、Something-Something-v2 (SSv2)、Epic-Kitchens-100 (EK100)、Diving48、Jester 和 Charades。
准确率与 FLOPs 的权衡: 与高效基线(如 VideoMAE、VideoMamba)以及同规模升级版本相比,LookWhen 实现了更优越的准确率 - 计算权衡。
在 K400 上,LookWhen(70% 稀疏)实现了 84.6% 的准确率,比 UMT-B800e 减少了 40% 的 FLOPs,比 VideoMambaPro 减少了 78% 的 FLOPs,同时保持了相当或更好的准确率。
在 SSv2 上,它在 108 GFLOPs 下实现了 72.0% 的准确率,优于 VideoMAEv2(180 GFLOPs 下为 71.2%)。
帕累托优势: 在 12 个评估案例中的 9 个 (6 个任务 × 2 种设置:线性探测和微调)中,LookWhen 实现了帕累托优势(更高的准确率和更低的成本)。
实际吞吐量: 在 NVIDIA L40S GPU 上测量,LookWhen 在同等准确率下比稠密的 InternVideo2-B (IV2) 快 6.7 倍 。这一差距比理论 FLOP 节省所暗示的更大,因为 IV2+ 合并基线受限于 Flash Attention 的不兼容性,且需要批量大小为 1 或进行掩码处理。
消融研究:
选择: 在"top1-dist"(独特性)上训练的表现显著优于在注意力图(IV2 或 DINOv3)上训练或随机选择。
提取: 同时使用视频和图像教师,并对 DINOv3 特征进行时间归一化,能产生最佳性能,特别是在 Diving48 和 Jester 等细粒度任务上。
5. 意义与主张
论文声称,LookWhen 通过仅学习计算必要的何时、何地和什么,成功解决了视频 Transformer 的计算低效问题。
效率: 它证明了可以在没有令牌合并运行时惩罚的情况下实现稀疏性,为更快的视频识别提供了一条实用路径。
泛化能力: 该框架学习到的通用表示对线性探测(特征提取)和微调均有效,在特定场景下甚至超越了其自身的稠密教师(InternVideo2)。
可扩展性: 通过将令牌选择与深层特征提取解耦,该方法允许激进的稀疏性(高达 95%),同时保持高准确率。
作者指出了局限性,例如由于计算限制目前仅限于 ViT-Base 模型,以及依赖于具有位置定位表示的教师。然而,他们提出,随着基础模型进化以提供更好的位置定位输出,LookWhen 框架将变得更加有效。未来的工作建议涉及长视频、多视图处理和高光谱数据。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。