← 最新论文
💻 computer science

Can People Distinguish Human and AI Agency in Humanoid Teleoperation? A Preliminary Study of Agency Perception

这项初步研究引入了“人机环路中之幽灵”(Ghost-in-the-Loop)框架,旨在证明参与者在类人机器人远程操作中往往难以区分人类与人工智能的代理性,其判断主要受感知的自然度和多模态一致性驱动,而非实际的控制源。

原作者: Xiang Li, Koya Dendo, Keigo Minamida, Yuto Nakamura, Per Ola Kristensson, Jun Rekimoto

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiang Li, Koya Dendo, Keigo Minamida, Yuto Nakamura, Per Ola Kristensson, Jun Rekimoto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个未来:一个站在你客厅里的机器人不再仅仅是一个遵循脚本的机器,而是一个能够进行对话、能够微笑、做手势,并能以人类般的流畅度做出反应的伙伴。这一愿景依赖于远程操作(teleoperation),这是一种由人在远端坐着并实时控制机器人的动作和声音,实际上将机器作为其远程躯体的方法。多年来,这需要人类操作员始终在场,限制了一个人能帮助的人数或对话持续的时间。然而,人工智能的快速崛起引入了一种新的可能性:能够自主生成语音、面部表情和手势的系统,它们对人类行为的模仿如此之像,以至于其中的差异变得难以察觉。这为与这些机器互动的人创造了一个迷人且略带不安的问题:如果一个机器人在表演,你能分辨出背后是一个真实的人在操纵,还是一个算法在运作吗?

索尼计算机科学实验室(Sony Computer Science Laboratories)与东京大学的研究人员致力于回答这个问题,他们构建了一个名为“幽灵环绕”(Ghost-in-the-Loop)的系统。该框架允许人形机器人能够在受人类操作员控制与完全由人工智能驱动之间进行无缝切换,同时看起来和听起来完全一致。机器人作为舞台,是一个配备了显示屏作为脸部以及摄像头以观察周围环境的 Unitree G1 型号。当人类控制时,他们佩戴耳机以观察机器人所见,并使用运动传感器来引导机器人的手部和面部动作。当系统切换到 AI 模式时,机器人会倾听对话,并利用生成式模型创造自己的声音、面部动作和手势,使其与人类控制版本在视觉和听觉风格上保持一致。其目标不是看哪种方式更好,而是看人类观察者是否能分辨出其中的区别。

为了测试这一点,团队制作了一系列展示机器人交谈的短视频剪辑。他们记录了八种不同的互动场景,涵盖了从闲聊到任务导向型讨论的内容,每个片段时长在五到四十秒之间。在这些剪辑中,有一半是由人类远程操作员控制机器人的;而在另一半中,则是 AI 系统生成行为。至关重要的是,机器人的声音、面部和身体在所有剪辑中都保持一致,因此唯一的变量是控制源。研究人员邀请了五十人在线观看这些视频。在每个片段结束后,参与者被要求判断机器人是由人类运行还是由计算机运行,并按从负十(确定为 AI)到正十(确定为人类)的量表对自己的确定程度进行评分。他们还被要求解释为什么会有这样的感觉。

结果表明,在这些短暂的时刻,人类与机器之间的界限变得异常模糊。参与者很难区分这两类控制源。平均而言,他们在人类控制的剪辑与 AI 控制的剪辑之间的评分几乎没有变化,这种差异微小到在统计学上与随机猜测无异。研究表明,对于短时间的互动,人们根本无法可靠地辨别机器人是被人驾驶还是由算法驱动。当研究人员观察参与者的实际想法时,发现了一个清晰的模式。那些觉得可以做出判断的人,很大程度上取决于机器人行为的整体自然度。他们密切关注对话的时机、动作的节奏,以及声音、面部表情和手势是否能够和谐地协同工作。

当机器人的动作显得僵硬、时机不对,或者身体各部分与声音不同步时,参与者更有可能猜测它是 AI。相反,当机器人动作具有连贯的流动感,即手势和表情与言语完美匹配时,人们就更有可能相信背后有人类在控制。这并不意味着 AI 是完美的,而是说 AI 表现中的缺陷足够细微,以至于在快速扫视中会被忽略。研究表明,我们检测代理能力(agency)的能力并不取决于所使用的具体技术,而更多取决于表现的一致性。如果机器人作为一个统一的整体行动,大脑就会接受它为一个单一的代理,无论这个代理是血肉之躯还是代码。

这项初步工作为我们未来如何设计机器人开启了新的篇章。它意味着在短期内,我们可能不需要担心用户在简短交流中不断质疑机器人是真实的还是虚假的。相反,重点可以转向这些系统如何融合人类与人工智能——例如,在对话变得复杂时让真人接管,而由 AI 处理常规部分。研究人员指出,他们的发现仅针对这些短小、结构化的剪辑,而更长、更复杂的互动可能会揭示不同的模式。目前,这项研究证实,当一个机器人说话、微笑并以足够的连贯性移动时,人类的心智乐于接受它作为一个伙伴,从而让其真实的代理本质成为一个静默的谜团。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →