TraVEL: Trajectory-Guided Video Embedding Learning for Driving-Video Retrieval
TRAVEL 是一种运动感知微调框架,它通过在群体相对策略优化(Group Relative Policy Optimization)中利用自我轨迹相似性作为奖励,增强了驾驶视频检索能力,使通用多模态模型能够在不依赖辅助感知数据或专家规则的情况下,有效地识别以运动为中心的事件。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
伟大的视频搜寻行动
想象你是一名正在破解谜题的侦探,但你的犯罪现场不是单一的,而是一个包含数百万小时视频资料的图书馆。这正是构建自动驾驶汽车的公司每天面临的现实。他们不仅在驾驶,还在记录一切。但是,要从海量数据中找到汽车差点撞到行人的那个特定瞬间,或者驾驶员做出一个复杂转向的精确秒数,就像是在一个由其他针组成的草堆里寻找一根针一样困难。
为了解决这个问题,科学家们使用了被称为“多模态嵌入”(multimodal embedding)的技术。可以将它想象成一个神奇的翻译器,能将一段视频片段和一句文本同时转化为一种单一的、秘密的代码(向量)。如果一段“红车左转”的视频代码与文本“红车左转”的代码非常相似,计算机就知道它们匹配。这就像是给每段视频一个独特的指纹,并为每次搜索查询配上一把匹配的钥匙。其目标是让计算机变得足够擅长匹配这些钥匙,从而无需人工观看,就能从数百万个选项中瞬间调取正确的视频。
然而,这里有一个陷阱。目前的“神奇翻译器”非常擅长识别静态物体,如树木、建筑或天空的颜色。但它们经常会被“运动”所迷惑。对于标准的 AI 来说,一辆左转的汽车看起来可能和一辆右转的汽车完全一样,只要背景场景相同。它们过于依赖“在哪里”,而忽略了“如何做”。这篇论文提出了一个问题:我们能否教会这些 AI 模型去更加关注运动本身,从而让它们能够分辨出一辆车是在加速还是在减速,即使场景看起来完全一致?
解决方案:教 AI 感受道路
这项研究背后的研究人员与 Uber AV Labs 和普渡大学合作,推出了一种名为 TraVEL(轨迹引导的视频嵌入学习,Trajectory-Guided Video Embedding Learning)的新方法。他们的主要发现是,通过使用汽车实际行驶的物理路径(即“自身轨迹”,ego-trajectory)作为一种特殊的训练工具,可以使 AI 对驾驶行为的理解能力大幅提升。
以下是他们实现这一目标的原理,使用了简单的类比:
问题所在:“语境”陷阱
想象有两个学生正在参加一场关于驾驶的测试。
- 学生 A(旧的 AI)看到一张晴天左转的汽车图片和一张晴天右转的汽车图片。因为天空和树木看起来一样,学生 A 认为:“这些基本上是同一张图片!”他们因为过度关注背景而感到困惑。
- 学生 B(新的 AI)被教导要忽略背景,转而关注汽车的车轮和转向。
研究人员发现,标准的 AI 模型表现得就像学生 A。它们可以区分“白天片段”和“夜晚片段”,但在场景相似时,却很难区分“加速”和“减速”。
解决方法:“特权”教练
为了解决这个问题,团队采用了两步走的训练过程。
- 第一步:阅读手册。 首先,他们利用配有文本描述(标题)的视频来教导 AI。这帮助 AI 学习了驾驶语言,但这还不够。AI 仍然没有深刻地“感受”到运动。
- 第二步:轨迹奖励。 这正是 TraVEL 脱颖而出的地方。他们引入了一位“特权”教练。在训练期间,AI 被展示视频以及汽车行驶的精确 GPS 路径。教练会说:“如果文本说是‘左转’,而视频显示的路径是‘右转’,你会得到低分。如果路径与文本相符,你会得到高分。”
至关重要的是,这个“教练”(GPS 路径)仅在训练期间使用。一旦 AI 完成学习,它就不再需要 GPS 路径了。它只需要视频和文本查询。AI 已经内化了对运动的感觉,以至于它只需通过一个单一的搜索代码,就能找到正确的视频,而无需在搜索时刻使用额外的传感器或复杂的规则。
他们的发现
研究结果非常令人振奋。当他们在名为 nuReasoning 的驾驶片段数据集上测试新方法时:
- 更擅长运动: AI 在根据运动寻找视频方面有了显著进步。例如,在搜索“加速”或“左转”时,准确率大幅提升。
- 数据表现: 在 20 亿参数规模的模型下,新方法在寻找“纵向”(前后)运动方面的能力比之前的最优方法提高了 9.8 个点,在“横向”(左右)运动方面提高了 4.7 个点。即使在更大的 80 亿参数规模下,它们也分别实现了 7.2 和 1.5 个点的增益。
- 视觉证明: 在一次测试中,旧 AI 试图寻找一辆车为行人减速的视频,却误选了一段汽车在夜间加速的视频。而新的 TraVEL 模型正确选择了那段汽车减速的视频,同时匹配了动作和语境。
他们排除了什么
论文明确反对“仅仅通过增大 AI 模型规模(增加更多参数)就能解决问题”的观点。他们测试了从小型到巨型的各种模型,结果显示,如果没有这种新的训练方法,即便模型更大,在处理运动问题时依然和小型模型一样困惑。他们还排除了使用复杂的多步系统(即每次搜索都需要额外的传感器或人工定义的规则)的必要性。TraVEL 保持了简洁:一个视频,一个代码,一次搜索。
他们有多确定?
作者认为,这种方法对于“以运动为中心”的检索是一个强有力的改进,但也谨慎地指出,它并非适用于所有驾驶场景的完美方案。他们发现,虽然 AI 在处理转向和停止等大幅度动作方面表现得更好,但在处理微妙的车道变换(如“在车道内轻微向左移动”)时仍然感到有些棘手。他们得出结论,虽然物理运动信号是一个强大的工具,但仍有提升空间,例如通过教 AI 去注意到其他车辆的运动,而不只是自己乘坐的那辆车。
简而言之,TraVEL 教会了自动驾驶汽车的计算机去关注车辆的“舞姿”,而不仅仅是它所处的“舞台”,这使得寻找那些对安全和学习至关重要的瞬间变得更加容易。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。