Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI
本综述批判性地回顾了视觉语言模型在第一视角视频理解中的应用,追溯了其从传统识别向具身智能的演进过程,同时强调了当前在建模长期交互方面的局限性,并概述了未来可部署系统的关键优先级。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下通过他人的眼睛观察世界。你看到他们的手伸向一个杯子,感受到头部转动时的模糊感,并注意到一个小物体是如何在移动过程中消失在较大的物体背后的。这就是第一视角视频(egocentric video)的世界——一种由佩戴在身上的摄像头捕捉到的视角,它如实记录了一个人所经历的生活。与从远处观察人类的传统监控摄像头不同,这些可穿戴设备从内部向外观察世界,高度聚焦于佩戴者正在做什么以及正在触摸什么。这种视角对于构建能够协助我们日常生活的机器至关重要,例如能提醒危险的智能眼镜,或者通过观察我们工作的过程来学习新技能的机器人。然而,教计算机理解这种混乱的第一视角视图是非常困难的。摄像机会随着每一步走动而晃动,物体经常从视野中消失,而最重要的动作往往发生在手触碰物品的那一瞬间。
德黑兰大学研究人员的一项新调查深入探讨了人工智能如何试图掌握这种独特的视角。作者们审视了一个快速发展的领域,即教计算机不仅要“看见”图像,还要通过语言来“理解”图像。这些被称为视觉-语言模型(vision-language models)的系统,旨在将摄像头看到的画面与我们能说出的词汇联系起来。研究人员追溯了这些模型的历史,从最初仅能识别静态物体的早期系统,到现代尝试理解复杂动作与交互的尝试。他们发现,尽管这些先进的模型在命名视频中的物体方面取得了进步,但在理解实际发生的“故事”方面仍然很吃力。模型经常会将“一个人拿着刀”误认为“一个人正在用刀切割”,或者无法识别一段长活动中的步骤序列。这项调查显示,最大的障碍不仅在于观察场景,还在于理解手、物体以及随时间展开的关系。
研究人员围绕着“手-物交互”(hand-object interaction)这一核心挑战组织了他们的综述。在第一视角视频中,手是主角。它们是移动、触摸并改变世界状态的主体。该综述解释道,要让计算机真正理解第一视角视频,必须弄清楚究竟是哪只手在触摸哪个物体,以及这种接触如何随时间变化。这听起来比实际操作要难得多,因为手经常会遮挡住它们所持物体的视线,且摄像头的移动非常不稳定。作者指出,目前的人工智能系统过于依赖于仅仅识别出存在哪些物体。它们可以告诉你那里有一个杯子和一只手,但往往无法理解连接它们的特定动作,例如倾倒或搅拌。当这些模型在长视频上进行测试时,这种局限性变得显而易见:它们往往会迷失在细节中,从而忽略了活动的整体轮廓。
为了解决这些失败案例,论文强调了一种向结构化推理转变的趋势,即专门将视频视为一种关系网络,而非仅仅是一系列图像的序列。研究人员认为,帮助计算机理解这些视频的最佳方法是教它们建立一个场景的“心理地图”,将手与其触摸的物体连接起来,并追踪这些连接如何随时间演变。这种使用基于图论推理(graph-based reasoning)的方法,将视频视为一系列关联事件,而非一堆帧的堆砌。综述表明,当模型被设计为专注于这些特定的关系时,它们在理解复杂任务方面的表现会更好。然而,作者指出,这项技术仍处于早期阶段。大多数用于构建这些关系图的成功方法最初是为第三视角视频开发的,在那种视角下,摄像机是稳定的,视野也是清晰的。将这些方法适配到佩戴式摄像头那种晃动且存在遮挡的视角中,仍然是一个尚未解决的重要问题。
该调查还考察了用于训练这些系统的数据。研究人员发现,现有的视频数据集往往规模有限,过度集中在厨房活动或特定的文化背景中。这产生了一种偏差,使得人工智能只能学习到人类行为中极窄的一片切面。此外,用于描述这些视频的语言往往不一致,导致模型难以学习不同动作的精确含义。作者强调,仅仅增加数据量或扩大模型规模并不是解决方案。相反,该领域需要更好的方法来教模型关注正确的时刻,并理解事件的先后顺序。他们建议,未来的进展将取决于将视觉数据与其他信号(如佩戴者头部的运动或声音)相结合,以创造出一个更完整的场景图景。
最终,论文得出结论,要实现真正能够协助我们日常生活的智能机器,道路依然漫长。虽然我们在教计算机“看”和“说”方面取得了巨大进步,但理解第一视角下人类生活那种流动且具有交互性的本质仍然是一个难题。研究人员确定了未来工作的几个关键领域,包括改进模型随时间进行推理的能力、开发更好地处理佩戴式摄像头持续运动的方法,以及创建能够泛化到新环境和新文化的系统。他们憧憬着这样一个未来:这些模型能够无缝衔接人类演示与机器人行动之间的鸿沟,让机器只需通过观察我们就能学习复杂的技能。但在那个未来到来之前,该领域必须解决一个根本性的问题:教计算机不仅要看到世界上的物体,还要看到将它们在时间中紧密联系在一起的关系。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。