← 最新论文
🤖 AI

Hierarchical Policies from Verbal and Egocentric Human Signals for Natural Human-Robot Interaction

本文介绍了 EDITH,这是一个层级化机器人框架,它利用来自智能眼镜的实时第一视角、注视和语音数据来解读人类的言语与非言语信号,通过减轻用户的沟通负担,实现更自然、更高效的人机交互。

原作者: Dongjun Lee, Juheon Choi, Dong Kyu Shin, Sinjae Kang, Kimin Lee

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Dongjun Lee, Juheon Choi, Dong Kyu Shin, Sinjae Kang, Kimin Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正试图让一个机器人来帮你整理一个凌乱的工作室。

旧方式:一位“严厉的图书管理员”
目前,大多数机器人的行为就像一位非常严厉、只能理解书面文本的图书管理员。如果你想要一把特定的螺丝刀,你不能直接指着它说:“拿那个。”你必须写下一段详细的句子:“请拿起位于桌子左侧、红色工具箱旁边的银色十字螺丝刀,并把它递给我。”

如果你漏掉了一个细节,或者描述得稍有偏差,机器人就会感到困惑,或者抓错工具。对人类来说,做到如此精确是非常累人的,而且感觉很不自然。

新方式:EDITH(一位“读心术搭档”)
这篇论文介绍了一个名为 EDITH 的新系统。把 EDITH 想象成一个戴着一副特殊智能眼镜(类似于 Project Aria)的机器人,这副眼镜让它能看到你所看到的景象,以及你视线停留的位置。

EDITH 不仅仅是听你的话,它还会实时观察你的眼睛和双手。如果你瞥了一眼某个特定的玛芬蛋糕并说,“给我这个,”EDITH 会立即理解。它不需要一段长长的描述;它只需要你的注视和简短的一个词。

EDITH 是如何工作的:“经理与工人”
EDITH 使用了一个由两部分组成的团队来完成任务,类似于一个建筑工地:

  1. 经理(高层策略): 这是观察你的“大脑”。它看到你在看某个物体,并听到你说“递给我那个”。它会理解你的意图,并将大的请求分解成小的、清晰的步骤。至关重要的一点是,它会对你指向或注视物体的确切时刻进行“快照”(关键帧)。这就像经理在对工人说:“去拿起这张照片中人类正在看的那个东西。”
  2. 工人(底层策略): 这是实际移动机器人手臂的“肌肉”。它不需要猜测你的意思。它只需查看经理提供的快照,并遵循指令去抓取那个特定的物品。

为什么这很重要
研究人员在三种场景下测试了 EDITH:

  • 分发玛芬蛋糕: 从拥挤的托盘中索要特定的玛芬蛋糕。
  • 分类杯子: 将特定的杯子放入特定的篮子中。
  • 传递工具: 在组装东西时递交工具。

结果:

  • 成功率: 当机器人尝试仅使用语言来完成这些任务时,它们几乎每次都会失败(成功率低于 7%)。而 EDITH 的成功率达到了约 60%
  • 精力消耗: 在一项用户研究中,人们反映使用 EDITH 感觉心理负担要小得多。他们不必费力寻找完美的措辞;他们只需指一下并说“这个”。

不足之处(局限性)
论文指出有两个主要局限性:

  1. 反应时间: 因为“经理”需要处理几秒钟的视频来确定你的需求,所以存在轻微的延迟。它不像反射动作那样瞬间完成。
  2. 身高差异: 该系统是基于特定身高的人群进行训练的。如果一个更高或更矮的人使用它,他们的“指向”从摄像头的视角来看会发生变化,机器人可能会产生困惑。这就像如果系统学习的是从儿童高度识别握手,但随后一个成年人尝试握手;角度就不同了。

总结
EDITH 是一个机器人框架,它不再要求人类像机器人一样说话。相反,它让人们能够以自然的方式进行交流:将寥寥数语与眼神或指向相结合。它利用一个“经理”来解读你的注视,以及一个“工人”来执行任务,使人机协作更像是与人类伙伴合作,而不是在为机器编程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →