← 最新论文
🤖 AI

Hybrid Attention Estimation Pipeline for Adaptive HRI Using an Expressive Robotic Head

本文提出了一种用于具有表现力的 InMoov 机器人头的混合注意力估计流水线,该流水线将高频几何感知与语义视觉-语言建模相结合,以驱动自适应的人机交互行为,并通过实验验证了其可靠的交互管理能力和非冗余的信号处理性能。

原作者: Pablo Moraes, Monica Rodriguez, Christopher Peters, Hiago Sodre, Tobias Doernbach, Bruna Guterres, Ricardo Grando

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Pablo Moraes, Monica Rodriguez, Christopher Peters, Hiago Sodre, Tobias Doernbach, Bruna Guterres, Ricardo Grando

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人不再是仅仅遵循僵化脚本的笨拙机器,而是能够真正“察言观色”的社交伙伴的世界。这就是人机交互(HRI)的核心——这一科学领域致力于教会机器如何像礼貌、专注的朋友一样行事。对于一个机器人要成为优秀的对话者,它需要理解视觉注意力的概念:知道你是在看着它,还是在被手机分心,或者是在看向别处。把它想象成一场舞蹈;如果其中一个舞伴停止注视对方,舞蹈就会变得尴尬。如果机器人能分辨出你是忽略了它,还是仅仅在瞥一眼短信,它就能决定是暂停对话、耐心等待,还是继续说下去。本文探讨了如何构建一个不仅能看到你的脸,还能理解你为什么看向别处的机器人,通过结合快速数学和智能 AI,让交互过程自然流畅。


懂得你何时走神(以及何时只是在看手机)的机器人

见见“InMoov”头部。这是一个 3D 打印的、具有表现力的机器人脸部,它可以移动眉毛、眼睑和下颚来展示情感,就像一个高科技的木偶。但如果机器人内部不知道周围发生了什么,那么一张漂亮的脸蛋也是徒劳的。这项研究背后的研究人员想要解决一个棘手的问题:如何让机器人在你看向别处时立即做出反应,同时又不会在你是看手机还是看天空时感到困惑?

为了实现这一点,他们为机器人构建了一个“混合型”大脑,这个大脑运作起来就像一个职责分工明确的双人团队。

快跑者与智者
想象一下,机器人有两个大脑在同时工作。

  1. 快跑者(几何层): 这个部分速度极快。它使用简单的数学来追踪你的头部角度。如果你的头正对着机器人,快跑者会大喊:“我们获得了注意力!”如果你转过头,它会喊:“注意力丢失!”这就像裁判在球员踏出界外的一瞬间吹响哨声。它在计时方面既快速又可靠,但它并不知道你在看什么,只知道你的头指向哪里。
  2. 智者(语义层): 这个部分速度较慢,但更聪明。它使用一种名为视觉语言模型(VLM)的强大 AI。它不仅仅是测量角度,还会观察整个画面并说:“哦,这个人正在看手机,”或者“他们在看树上的一只鸟。”它就像一个注意到你在发信息并理解上下文的朋友。

神奇之处在于这两个部分是如何进行交流的。“快跑者”控制机器人的即时动作(比如暂停讲故事),而“智者”则在一旁观察,以确保机器人没有犯错。

实验:10 人,40 场对话
团队使用 10 名志愿者测试了这个系统。每个人都要面对机器人进行四种不同的场景测试。在某些测试中,机器人只是正常聊天;在另一些测试中,机器人是“自适应”的,这意味着它应该注意到人是否分心,并在其看向机器人之前暂停对话。

结果非常顺畅。在所有 40 场试验中,机器人都成功识别了人,意识到他们在关注,并开始了对话。它用了大约 1.73 秒来发现人,并用了 4.74 秒来确认对方正在注视机器人后才开始说话。

当机器人在“自适应模式”下且人假装分心(例如看手机)时,机器人的反应非常完美。在有预设分心的测试中,机器人在 10 次中的 10 次里成功暂停了对话,并在 10 次中的 9 次里成功恢复了对话。机器人并没有死板地停滞,它耐心地等待,并在人重新看向它的一瞬间立刻跳回对话中。

为什么两个大脑比一个更好
这是最有趣的部分:“快跑者”和“智者”并不总是达成一致。在大约一半的检查时刻,它们对正在发生的情况给出了不同的描述。例如,“快跑者”可能会说:“头转开了,无注意力!”而“智者”可能会说:“他们在看手机。”

研究人员发现,这两个层级提供了非冗余的信息。这意味着“智者”不仅仅是在重复“快跑者”所说的话,它还在添加数学本身无法看到的、新的、有用的细节。这证明了你不能仅仅依靠一种类型的传感器来理解人类的注意力。你需要几何学的速度来把握时机,也需要 AI 的智慧来理解语境。

机器人没做到的事情
需要注意的是,这项研究并未证明它解决了完美的理解人类的问题。研究人员承认,他们并没有拥有“地面真值”(即一份由人类标注的、精确记录了人在每一秒想法的完美记录)来进行对比检查。因此,虽然机器人看起来表现良好,但他们无法确定每一次暂停是否都完美契合了人类分心的精确瞬间。他们也没有测试机器人的行为如何让人们产生“感觉”——是觉得它古怪诡异还是很有魅力。那是下一轮实验的工作。

总结
这项研究表明,构建社交机器人的最佳方式不是在快速数学和智能 AI 之间做选择,而是两者兼顾。通过让快速系统处理时机,让智能系统处理语境,机器人可以表现得更像一个自然的对话伙伴——一个知道何时停顿、何时等待以及何时继续讲述故事的伙伴。这是迈向那些不仅能“看见”我们,而且能真正“理解”我们的机器人的小小一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →