← 最新论文
💻 computer science

Teaching is a Process: The TOSS Framework for Modeling Human Teaching Decisions in Human-Interactive Robot Learning

本文介绍了 TOSS 框架,这是一个源自人类教学行为探索性研究的理论模型,它将人机教学概念化为一个由触发、信号、目标和策略组成的程序化循环,旨在更好地使机器人学习与人类意图保持一致,并促进更有效的以人为中心的教学系统的设计。

原作者: Bernhard Hilpert, Kim Baraka, Joost Broekens

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Bernhard Hilpert, Kim Baraka, Joost Broekens

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人正在尝试学习一项新技能,比如打扫房间或移动箱子,而一名人类在旁观察并试图提供帮助。在机器人领域,这种交互被称为人机交互式学习(human-interactive learning)。其目标是让机器人通过倾听人类的反馈来变得更加出色。然而,一个持久存在的问题是,人类与机器人通常使用不同的语言。当人类看到机器人犯错时,他们可能想要解释为什么它是错的,或者建议一种更好的思考任务的方式。但机器人的计算机大脑通常被设计为只能理解简单的奖励或惩罚,比如一个上升或下降的分数。这种不匹配意味着,当人类试图教学时,他们往往被迫将自己自然的教学风格强行塞进一个并不契合的僵化框架中,从而导致混乱和糟糕的结果。研究人员长期以来一直怀疑,要解决这个问题,我们需要理解人类在教学时究竟是如何思考的,而不是仅仅猜测应该发送什么样的信号。

一个研究团队致力于揭示这一隐藏的逻辑,他们并没有采用通常那种迫使人类对机器人的错误做出即时反应的高压实验,而是创建了一项冷静的观察性研究,以观察如果人们只是单纯地观看机器人学习而不必承担即时修复它的压力时,会自然地做出什么反应。他们招募了34名成年人,并向他们展示了两个不同机器人学习任务的视频。其中一个机器人是一个在网格中导航以清理虚拟污垢的数字代理,而另一个则是尝试将一盒药物推向目标的机械臂。参与者在三个不同的阶段观察这些机器人:学习过程的早期、中期和接近尾声阶段。在每个阶段,研究人员提出了一个简单的开放式问题:“如果你可以的话,你会如何帮助视频中的机器人更好地学习这项任务?”参与者可以以任何方式自由回答,对于能提供什么样的帮助没有任何限制。

研究人员分析了数百个此类响应,并发现人类的教学并非单一、简单的动作。相反,它是一个复杂的、多层级的过程,研究团队将其命名为TOSS框架,代表着触发(Triggers)、目标(Objectives)、信号(Signals)和策略(Strategies)。第一层,触发(Triggers),揭示了人类并不仅仅是在等待机器人失败。他们不断地根据三种标准来评估机器人的行为。他们观察一个错误是一个持续性的模式还是仅仅是一个一次性的故障;他们判断机器人是相对于其自身的过往表现,还是相对于任务的绝对规则。最后,他们决定该行为是符合目标还是违反了目标。这意味着人类教师一直在运行一个复杂的内部清单,不仅是在判断机器人是否错了,还在判断它是如何错的以及为什么错。

一旦人类决定机器人需要帮助,他们心中就会有一个特定的目标,研究人员称之为目标(Objectives)。这些目标分为三个截然不同的类别。有时,教师想要修正机器人的即时动作,例如使其运动更平滑或更精确。另一些时候,目标是确保机器人完成任务的特定部分,比如在移动物体之前先正确地拿起它。令人惊讶的是,研究发现人类还有第三种目标:他们希望教会机器人关于世界本身的知识。参与者经常表达出希望给机器人一张地图、解释物体所在的位置,或澄清任务的目的。这表明人类直觉地认为机器人拥有一个可以理解事实和概念的内在思维,而不仅仅是仅仅对奖励做出反应。

为了传达这些目标,人类自然地从多种信号(Signals)中进行选择。他们可能扮演评判者,给予赞扬或批评;他们可能扮演导师,提供具体的纠正,如“慢一点”或“转向另一边”;他们可能扮演演示者,展示具体该怎么做;他们可能扮演信息源,仅仅告诉机器人关于环境的事实;或者,他们可能会选择保持沉默,这是一种被称为“保留”(Withholding)的信号,即一种为了测试机器人的学习能力而让机器人自行摸索的刻意决定。研究表明,这些信号并非随机产生的;它们是精心挑选的工具,用以弥合机器人正在做的事情与人类想要它实现的目标之间的差距。

或许最具有启发性的发现是策略(Strategies)的角色,它代表了人类教师所采取的整体角色。研究人员发现,人们会自发地在三种主要身份之间切换。有时他们扮演教练(Coach),提供实时的反馈和引导;有时他们扮演工程师(Engineer),认为机器人的硬件或软件存在根本性缺陷,并建议使用新的传感器或更好的算法;在其他情况下,他们扮演设计师(Designer),改变环境本身来使任务变得更容易,例如移除障碍物或重新布置房间。这一发现挑战了目前构建机器人的方式。大多数系统都假设人类永远只会扮演教练的角色,仅提供简单的反馈。但这项研究表明,当人们可以自由思考时,他们往往想要重新设计机器人或任务本身。

研究人员得出结论,为了让机器人有效地学习,交互方式需要发生改变。目前的系统将人类限制在一个狭窄的角色中,忽略了他们作为工程师或设计师进行设计的自然倾向。通过理解TOSS框架,未来的机器人可以被设计成能够识别人类何时从教练转变为工程师。这将使机器人能够相应地调整其学习过程,例如接受一张新地图或一个改变后的环境,而不是仅仅等待一个简单的指令。这项研究并不声称已经解决了机器人学习的问题,但它提供了一张关于人类在教学时究竟如何思考的清晰且详细的地图。它表明,实现更好的人机协作的关键在于建立能够尊重人类直觉之完整复杂性的系统,允许人们以其自然的、多层次的方式进行教学。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →