EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input
EgoGazeLite 是一种轻量级的、基于设备端的双过程注视点预测器,它通过根据预测的注视点精确裁剪视频,为多模态大语言模型实现高效能的自我中心视频理解,从而在无需专用眼动追踪硬件的情况下,保持描述质量并能在消费级硬件上实时运行。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你戴着一副智能眼镜,它能通过你的眼睛观察世界,并描述你正在做的事情。这项技术有望帮助外科医生回忆复杂的术式,引导机械师进行维修,或通过叙述周围环境来协助视障人士。为了实现这一目标,眼镜必须将视频流发送给一个能够理解图像和语言的强大人工智能系统。然而,这里存在一个显著的瓶颈:传输高清视频需要海量的数据,远超小型可穿戴设备能够轻松传输或处理的范围。理解这些视频的计算机系统在面对过多的视觉信息时也会感到吃力,往往会被庞大的像素量所淹没。
研究人员发现了一种通过专注于人实际注视区域来解决这一数据问题的聪明方法。系统不再发送整个宽阔的视野,而是可以裁剪视频,仅显示佩戴者目光聚焦的小区域。这使计算机需要处理的数据量减少了约百分之九十,使任务变得更快且更便宜。直到现在,这种方法仍需要集成在眼镜中用于精确追踪眼球运动的特殊且昂贵的硬件。如果没有这种专用硬件,系统就无法知道该看向哪里,从而使得智能眼镜的潜力无法在日常消费者中得到实现。
一组研究人员现在已经证明,专门的眼动追踪传感器实际上并非必要。他们开发了一款轻量级的软件程序,仅通过分析视频流本身就能预测一个人的注视位置。这个名为 EgoGazeLite 的程序可以直接在标准的智能手机上运行,并且其准确度足以取代昂贵的硬件传感器。研究人员通过将视频片段输入人工智能系统,并根据真实的眼动追踪数据或软件的预测进行裁剪,随后要求人工智能描述视频中的动作。结果显示,基于预测注视点生成的描述与基于真实眼动追踪数据生成的描述几乎完全一致。在每一个测试案例中,该软件的预测表现都与硬件测量结果一样出色,证明了该系统可以在没有专门传感器的情况下正常工作。
该软件本身非常高效。它的体积足够小,可以在消费级硬件(如现代智能手机中的处理器)上实时运行,在不到二十二毫秒内即可完成每一帧视频的预测与裁剪。这种速度至关重要,因为这意味着系统可以跟上实时视频流而不会产生延迟。研究人员利用数千小时的人类执行各种任务(从烹饪、修理自行车到踢足球和进行心肺复苏)的视频对该软件进行了训练。当他们在新的、未见过的视频上测试该系统时,它成功地高精度识别了人的注视位置。该软件通过学习两种不同的注意力机制进行工作:一种是基于场景中视觉明亮或移动的部分,另一种是基于人前一时刻的注视位置。它结合这两个线索来猜测下一个焦点。
为了确保研究结果的稳健性,研究人员并没有依赖单一的评估方法。他们使用了两个不同的语言大模型来生成视频描述,并让自动化评分系统和其他先进的人工智能模型对这些描述进行评判。他们将预测注视点产生的描述与来自硬件传感器的真实数据(ground truth)以及仅裁剪屏幕中心的简单基准进行了对比。结果非常明确:预测注视点产生的描述明显优于中心裁剪法,并且在统计学上与基于硬件的注视点描述无法区分。事实上,软件预测与真实的眼动追踪数据如此接近,以至于在他们进行的十个不同测试场景中,其差异小到无法被测量为显著差异。
这项工作消除了实现注视感知型人工智能的一个主要障碍。通过证明软件模型可以取代硬件传感器,研究人员表明,未来的智能眼镜不需要再承担昂贵且耗电的眼动追踪组件。该系统现在可以部署在任何带有摄像头和标准处理器的设备上,为广泛的日常活动开启了负担得起的实时辅助之门。尽管该研究是在特定的数据集和模型上进行的,但结果表明了构建此类系统的一种根本性转变:即从依赖专门硬件转向利用智能、轻量化的软件,仅通过观察我们所见,即可理解人类的注意力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。