← 最新论文
💻 computer science

Automated Detection of Mutual Gaze and Joint Attention in Dual-Camera Settings via Dual-Stream Transformers

本文提出了一种高效的双流 Transformer 架构,能够自动检测双摄像头照护者 - 婴儿录像中的相互注视与共同注意,其性能显著优于现有基线模型,并为发展心理学研究提供了一种可扩展的开源工具。

原作者: Jakub Kosmydel, Paweł Gajewski, Arkadiusz Białek

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Jakub Kosmydel, Paweł Gajewski, Arkadiusz Białek

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图理解婴儿与其父母之间的对话。在发展心理学领域,有两个关键时刻至关重要:相互凝视(Mutual Gaze,即双方直视彼此眼睛的时刻)和共同注意(Joint Attention,即双方共同注视同一玩具或物体的时刻)。

几十年来,研究这些时刻就像是用放大镜数沙粒。研究人员不得不坐在视频录像前,以慢动作观看,并在婴儿与父母相互注视或注视同一物体时手动点击按钮。这种方法既缓慢又疲惫,且容易出错。

本文介绍了一种新的“数字助手”,能够自动完成这项工作,且表现远优于以往的任何尝试。以下是其工作原理的简明解释:

问题:“双摄像头”谜题

研究人员在一个房间内布置了两台摄像头:一台对准婴儿,另一台对准父母。要判断他们是否在共享注意力,计算机需要同时理解两件事:

  1. 婴儿在看什么?
  2. 父母在看什么?
  3. 这两者是否有关联?

以往的计算机程序就像试图通过一次只看一个数字来解数学题的学生。它们难以将两个不同摄像头视角之间的线索联系起来。

解决方案:“双流”大脑

作者构建了一种名为双流 Transformer(Dual-Stream Transformer)的新人工智能系统。可以将该系统想象成一位拥有两双眼睛和一颗超级大脑的资深侦探。

  1. 两双眼睛(骨干网络):该系统拥有两双“眼睛”(神经网络)来观察视频流。一只“眼睛”观察婴儿,另一只观察父母。
    • 秘密武器:这两双“眼睛”并非从零开始。它们使用的是“冻结”的预训练大脑(称为GazeLLE),这些大脑已经学会了如何识别人眼注视的位置。这就像给侦探配备了一副高科技眼镜,能够完美地追踪视线。
  2. 超级大脑(Transformer):当两双“眼睛”收集到信息后,会将信息传递给中央“大脑”(Transformer)。这颗大脑并非单独观察婴儿或父母,而是将两者结合起来观察。它会问:“好吧,婴儿在看红色积木,父母也在看红色积木。这是共同注意吗?或者婴儿在看父母,而父母在看婴儿。这是相互凝视吗?”
  3. 令牌融合:系统使用一种特殊的“胶水”(称为令牌融合机制)将两个摄像头视角粘合在一起,以便大脑能够理解它们之间的关系。

训练:向现实生活学习

团队并未仅使用伪造视频。他们在实验室中录制了真实的婴儿与父母玩耍的画面。

  • 数据:他们拥有 13 对不同的亲子组合,每对进行了约七次游戏会话。
  • 人工介入:在人工智能能够学习之前,人类专家必须观看视频并精确标记特殊时刻发生的时机。为了简化这一过程,团队构建了一个定制的视频工具,使他们能够快速标注事件。
  • 结果:人工智能通过观察数千个这些已标注的时刻,学会了识别这些模式。

对决:表现如何?

研究人员将他们的新型“双流侦探”与另外两种方法进行了测试:

  1. 老派方法(卷积网络):这就像一台标准相机,能够寻找模式,但无法真正“理解”两个人之间的关系。它惨败,表现仅略好于随机猜测。
  2. 大型语言模型(LLM):这是一种庞大、通用的 AI(类似于一个非常聪明的、具备视觉能力的聊天机器人)。虽然它很聪明,但速度太慢,且经常猜错,因为它并未针对这一特定任务进行专门优化。

获胜者:新的双流 Transformer 以绝对优势获胜。

  • 它的准确率更高(相互凝视的识别率约为 82%,共同注意的识别率约为 77%)。
  • 它的速度快得多。当大型语言模型处理几秒钟的视频需要很长时间时,新系统几乎可以瞬间完成处理。

为何这很重要

作者不仅构建了一个模型,更构建了一个供科学家使用的工具

  • 开源:他们免费发布了代码和“大脑”权重。这意味着其他实验室可以获取该工具,根据自己实验室的情况稍作调整,即可开始分析数据,而无需从头构建系统。
  • 可扩展性:由于其速度快且准确,心理学家现在可以在几分钟内分析数小时的视频,而无需花费数天时间。

局限(注意事项)

该论文诚实地说明了该系统目前尚无法做到的事情:

  • 需要面部:系统依赖一个独立的工具来首先定位面部。如果摄像头看不到面部(例如婴儿躲了起来),系统就无法推测视线方向。
  • 时间分辨率稍慢:它每秒检查一次视频。它可能会错过那些快于这一频率的、转瞬即逝的瞥视。
  • 特定性:它是基于 13 个特定家庭进行训练的。虽然表现良好,但如果用于完全不同的房间、不同的光照条件或不同的摄像头角度,可能需要进行少许“微调”。

简而言之:这篇论文为行为科学家提供了一款强大、快速且免费的“自动化助手”,它能够观看亲子视频并即时捕捉那些充满魔力的连接时刻,从而将他们从数小时枯燥的手工劳动中解放出来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →