The World According to a Social Robot -- Augmenting Human-Robot Dialogue With Vision Language Models
本文表明,将视觉语言模型与 Pepper 机器人相结合,通过提供视觉上下文,在仅略微增加响应时间的情况下增强了社交得体的交互对话,同时利用在欧洲托管的大语言模型确保了符合数据保护法规,从而满足实际部署的需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人不再仅仅是遵循严格指令的笨重机器,而是能够真正“看见”你所见之物的对话伙伴的世界。这是人机交互(HRI)的前沿领域,该领域正试图弥合冰冷代码与温暖社交连接之间的鸿沟。如果一个机器人要成为真正的朋友或助手,它不能仅仅听你的话;它需要理解你周围的语境。可以这样想:如果你说,“这里好热啊”,一个没有眼睛的机器人可能只会点头。但一个长了眼睛的机器人可以看到阳光洒进窗户,或者看到有人在扇风,从而理解“热”意味着“打开窗户”,而不是“调高暖气”。为了赋予机器人这种超能力,科学家们正在将两种类型的人工智能结合起来:大型语言模型(LLMs),它们像是理解语言的超级聪明的大脑;以及视觉语言模型(VLMs),它们像是被赋予了一双眼睛来观察世界的大脑。大问题在于:我们能否给机器人装上这些眼睛,而不至于让它变得反应迟钝和笨拙,以至于对话无法进行下去?
这篇论文通过测试一个名为 Pepper 的社交机器人,对这个问题进行了初步探索。可以将 Pepper 想象成一个身高 120 厘米、设计用于通过手势和触摸屏与人聊天的友好类人机器人。研究人员 Thomas Sievers 希望看看将 Pepper 连接到一种特定类型的 AI 大脑(Mistral AI 模型)并为其配备一个摄像头,是否会让它的对话变得更加自然。实验设置很简单:Pepper 每四秒拍摄一张场景照片——就像从它自己的视角对世界进行一次快速快照——并将这张图像连同人类最新的句子一起发送给 AI。随后,AI 会查看照片,阅读句子,并决定下一步说什么。
结果表明,赋予机器人眼睛对于提升对话质量具有变革性的意义,尽管这也会带来一点点速度上的阻碍。当机器人能够看见时,它不再发表笼统的评论,而是开始注意到具体的细节。在一个坐在客厅的场景中,机器人不仅是在聊天气;它看到了一个书架和人手中的一个杯子,于是问道:“你喜欢阅读吗?你是在喝茶还是咖啡?”在另一个露台场景中,它注意到了郁郁葱葱的绿色花园,并提到了背景中的一张长凳。它甚至发现了一个人 T 恤上的英国电视节目标志,并询问了相关话题。机器人能够将这些视觉线索编织进对话中,使互动感觉不再像是与机器交谈,而更像是与一位专注且充满好奇心的朋友交谈。
然而,这种额外的感知力是有代价的。论文测量了机器人做出回复所需的时间。当机器人使用标准的纯文本大脑时,它的反应非常迅速。但当研究人员加入了摄像头和图像处理大脑(VLM)后,机器人思考的时间变长了。对于 Mistral AI 模型,这种延迟约为 400 毫秒(不到半秒)。对于来自 OpenAI 的另一种模型,延迟则更为显著,约为 1.5 秒。虽然机器人在技术层面上变慢了,但作者认为这种短暂的等待是值得的,因为它让机器人能够理解情境中“未言明”的部分。
这项研究还强调了对欧洲人的实际益处。通过使用托管在欧洲服务器上的 Mistral AI 模型,该设置符合严格的欧洲数据保护规则,这是在学校或护理机构等公共场所使用其他流行 AI 模型时面临的一大障碍。研究人员指出,虽然机器人总体上很成功,但并非完美无缺。有时它会过多地谈论整个场景,而实际上只需要关注一个小细节;偶尔它也会因为过于专注地盯着正在交谈的人看,而忽略了房间里的其他部分。但总的来说,论文表明,为机器人的对话增加视觉功能使互动更加丰富且更具人性化,证明了能够看见的机器人才能实现真正的连接。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。