Investigating Multimodal Informativity under Different Partner Visibility Conditions in Video-Mediated Dialogue
本文研究了在不同可见度条件下,手势与言语如何共同在视频媒介对话中传递指称信息,证明了手势本身具有预测性,多模态融合在言语模糊时最为受益,且伴侣的可见度会影响手势生成与互动协调。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图猜出朋友心中想的一个秘密物体,但你只能听到他们的声音。有时他们会说:“就是那个带尖尖的部分的。”这其实非常模糊。但如果同时也能“看到”他们,他们可能会指着空气,或者摆动手指来展示形状。这就是人类交流的魔力:我们不仅使用语言,还动用全身来填补信息间的空白。研究计算机如何理解语言的科学家们(这个领域被称为自然语言处理)一直擅长阅读人们说话的转录文本,但他们往往难以理解对话中那些杂乱、未言明的部分,比如手势。一个核心问题是:计算机能否学会“读懂”这些手部动作,从而在仅靠言语无法清晰表达时,弄清楚对方在谈论什么?而且,计算机是能“看到”做出手势的人,还是仅仅能听到声音,这是否重要?
这篇论文通过设置一个数字游戏,深入探讨了这一谜团。研究人员创建了一个场景,要求两个人去识别 1 种由 16 种奇怪的、外星般的形状(被称为“Fribbles”)组成的物体,这些形状没有真实名称。他们必须进行描述并在一排物体中选出正确的那一个。团队在三种不同的“可见度”设置下进行了测试:伙伴之间只能听到彼此,或者只能从一侧看到彼此,或者可以完全看到彼此。他们构建了计算机模型充当“猜谜者”,向模型输入仅有的说话内容、仅有的手部骨架式运动,或是两者的结合。
以下是他们的发现:仅凭手势本身,在猜测正确物体方面其实表现得惊人地好。计算机模型仅通过观察手部动作,就能在约 20% 的情况下选出正确的 Fribble,这比随机猜测(随机猜测的成功率仅为 5.9%)要好得多。然而,语言仍然是主角,其成功率约为 46.5%。真正的魔力发生在计算机将两者结合的时候。手势不仅仅是提供了一点点帮助;它们更像是一个“安全网”。当计算机被言语搞糊涂、不知道该猜什么时,手部动作提供了解决谜题所需的额外线索。
研究人员还发现,“可见度”改变了人类的行为方式。当伙伴们可以互相看见时,他们会使用更多的手势,且这些手势包含了更多有用的信息。但当他们看不见彼此时,手势变得更像是自我安抚的动作,对于计算机猜测物体的帮助也变小了。有趣的是,随着伙伴们一遍又一遍地玩这个游戏,他们用语言描述物体的能力变得越来越强,但他们的手势并没有随着时间的推移变得更好或更具体。
最后,团队尝试了一种高级技巧来帮助计算机更好地理解手势。他们教导模型在心理上将“手部动作的形状”与它正在描述的“物体的图片”进行“匹配”。这并没有让手势本身变得更好,但它让语言与手势的结合变得更加精准,将成功率又提升了几个百分点。简而言之,这篇论文表明,虽然计算机在“听”方面做得很好,但它们仍需要学习如何通过观察我们的动作来真正理解我们的意图,尤其是在我们的言语变得有些模糊的时候。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。