← 最新论文
💻 computer science

Mind the Context: Continual Learning of Socially Appropriate Robot Actions via Environmental-Social Disentanglement

本文介绍了显式解耦双支路(EDD)框架,该框架通过显式分离环境线索与社交线索以减轻灾难性遗忘,使社交机器人能够在多种多样环境中持续学习符合上下文语境的行为。

原作者: Rafal Robert Karpinski, Fethiye Irmak Dogan, Nikhil Churamani, Yiming Luo, Maartje M. A. de Graaf, Davide Dell'Anna, Hatice Gunes

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Rafal Robert Karpinski, Fethiye Irmak Dogan, Nikhil Churamani, Yiming Luo, Maartje M. A. de Graaf, Davide Dell'Anna, Hatice Gunes

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人走进了一个房间。对于人类来说,这个房间讲述着一个故事:这是一个正在举行派对、充满混乱气息的客厅,还是一个正在进行严肃会议、安静的办公室?同样的动作,比如开始大声交谈或吸尘,在第一种房间里可能非常得体,但在第二种房间里却可能是一场灾难。这就是社交机器人(social robotics)的世界,机器试图学习人类行为中那些不成文的规则。但棘手之处在于:机器人无法针对它们可能访问的每一个可能的房间都编写所有的规则。相反,它们需要持续学习(Continual Learning)。把这想象成一个不断转学的新生:他们需要学习新学校食堂或体育馆的新规则,同时又不能忘记旧学校学到的规则。如果他们忘记了,那就是所谓的“灾难性遗忘(catastrophic forgetting)”,而机器人也会因此变得困惑且无礼。

研究人员提出的核心问题是:我们如何教机器人理解“身处何处”(环境)以及“那里有谁”(社交人群)是如何共同决定行为是否得体的?通常,机器人只是观察整个房间的全景并尝试猜测规则。但本文指出,这就像是戴着一副模糊的眼镜在解谜。作者提出了一种更聪明的方法:教机器人将“背景”(家具、墙壁)与“人”(人群、他们的位置)分离开来,并分别学习它们,然后再将这些碎片重新组合在一起。


“关注语境”实验

在这项研究中,研究人员构建了一个名为 EDD(显式解耦双分支,Explicit Disentanglement Dual-Branch)的新型学习系统。想象一个拥有两副不同眼镜的机器人。其中一副是“环境透镜”,它会模糊掉所有人,让机器人能够纯粹地专注于房间的布局——比如观察是否有桌子可以摆放食物,或者地面是否脏乱需要清理。另一副是“社交透镜”,它会模糊掉家具和墙壁,只留下人的轮廓,从而让机器人看到谁站在哪里以及他们彼此之间的距离有多近。

机器人利用这两个独立的视角进行学习。它有两个“大脑”(或称分支),分别独立处理这些视图,然后结合它们的想法来做出决定:“在这里开始交谈是否合适?”或者“我现在应该吸尘吗?”为了确保机器人在从客厅移动到办公室时不会忘记在客厅学到的东西,团队使用了一个“回放缓冲区(replay buffer)”。这就像是一个数字剪贴簿,机器人会在学习新房间的同时,保留一些旧房间的快照进行练习,从而防止产生困惑。

研究发现

团队在六种不同的室内场景中测试了这个系统,范围从温馨的家到各种办公空间(如会议室、走廊和大开间办公室)。他们将这个拥有“双透镜”的机器人与其他方法进行了对比,包括那些试图一次性观察全景的机器人,甚至是某些无需任何训练就能猜测社交规则的高级 AI 模型(称为“零样本/zero-shot”模型)。

结果非常明确。拥有分离透镜和剪贴簿的 EDD 机器人在预测人类认为是否得体方面表现最佳。它的错误率更低(错误率为 0.783,而其他方法则超过 1.2 或 2.0),且其判断与人类观点吻合得更加紧密。

研究人员还测试了拆分“人”与“房间”的不同方式。他们发现,使用边界框(bounding boxes)(即在人周围画一个框并隐藏框外的所有内容)的效果略好于仅使用轮廓(silhouettes)或仅仅是放大机器人自身。这表明,通过清晰地从“环境”视图中隐藏掉人,能更好地帮助机器人理解房间的规则。

有趣的是,机器人访问这些房间的顺序并没有产生太大影响。无论是先从简单的走廊进入复杂的客厅,还是反过来,机器人的学习效果都很出色。这表明该系统具有很强的鲁棒性,不会轻易被新的经验序列所迷惑。

总结

本文指出,为了让机器人在不断变化的世界中真正做到礼貌,它们需要停止将场景视为一个巨大的、混乱的整体。相反,它们需要主动将“在哪里”与“是谁”分离开来。通过显式地教机器人将环境和社交人群作为两个不同的事物来理解,并将这些知识结合起来,机器人可以学得更快,也忘得更少。虽然这项测试是在合成图像(计算机生成的场景)而非真实世界的视频上进行的,但结果表明,这种“解耦(disentanglement)”策略是构建能够适应新社交情境且不失礼貌的机器人的一个极具前景的方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →