Risk-Aware Preference Learning for Stochastic Outcomes
本文表明,在随机机器人导航的偏好学习中,引入累积前景理论来建模人类风险敏感性,与传统的期望效用假设相比,能显著改善奖励函数的恢复并减少遗憾。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何像礼貌的人类一样行事。你不能只写下一长串规则,比如“不要打人”或“走路快点”,因为生活是混乱且充满意外的。相反,科学家们发现了一个聪明的技巧:向机器人展示两种不同的移动方式,然后问人类:“哪一种看起来更好?”通过这样重复成千上万次,机器人可以学习到一个隐藏的“计分卡”,即人类真正看重的东西。这被称为基于偏好的奖励学习(preference-based reward learning)。
然而,大多数这类研究的背后隐藏着一个棘手的假设。它假设人类就像完美的计算器,能够简单地将情况中的好与坏部分相加,并根据它们发生的可能性进行加权。这被称为期望效用(Expected Utility)。但现实中的人类并不是计算器;我们是有情感的。我们会过度担心罕见的灾难(比如车祸),并且比起获得,我们更讨厌失去。这篇论文提出了一个简单的问题:如果我们使用一个假设人类是完美计算器的模型来教机器人,而人类实际上是规避风险、充满情感的决策者,会发生什么?
科罗拉多大学博尔德分校的研究人员决定在模拟世界中测试这个想法,在这个世界里,机器人必须穿过一群行人。在这个世界中,机器人的每一次移动都不是一条单一、确定的路径。相反,它就像掷骰子:机器人可能会平滑地滑行,也可能会撞到某人,或者被卡住。结果是一个可能性的云团,而不是一条直线。
团队设置了一个数字实验,其中包含两种类型的“老师”(即机器人试图学习其偏好的人类)。一位老师是“完美的计算器”,他只关心平均结果(期望效用)。另一位老师是“对风险敏感”的人类,他们使用一种复杂的心理学模型,称为累积前景理论(Cumulative Prospect Theory, CPT)。这个模型解释了现实中的人是如何高估罕见、可怕事件的概率,以及如何比感受平滑路径带来的快乐更强烈地感受到碰撞带来的痛苦。
研究人员随后训练了两类“学生”(即学习算法)。一个学生假设老师是完美的计算器(EU学习者),而另一个学生假设老师是风险敏感的人类(CPT学习者)。他们向这两类学生喂入了由老师生成的数千个“哪条路径更好?”的问题,并观察它们学习真实计分卡的效果如何。
以下是他们在模拟实验中的发现。当老师是完美的计算器时,计算器学生学习得非常完美,而风险敏感型学生则会被额外的复杂性搞得有些困惑。但是,当老师是风险敏感的人类时,计算器学生表现得明显较差。它试图通过扭曲恢复出的计分卡来解释人类对罕见碰撞的恐惧,导致机器人认为碰撞只是“有点糟糕”而不是“灾难性的”,从而产生了一个有偏差的奖励。机器人学到了一个不准确的教训。
相比之下,风险敏感型学生(CPT学习者)的表现要好得多。它意识到人类不仅仅是在以不同的方式看待结果,而是在以不同的方式衡量不确定性。通过将结果的“价值”与对风险的“恐惧”区分开来,CPT学习者恢复出的计分卡误差显著降低。
该论文指出,如果我们希望机器人在现实世界中(即罕见事故令人恐惧且人们天生会对风险感到焦虑的世界)是安全且符合人类价值观的,我们就不能仅仅假设人类是逻辑严密的数学机器。我们需要构建能够理解人类恐惧和风险敏感性的机器人,否则它们可能会因为认为我们并不介意风险而学习采取危险的捷径。虽然这一结果来自计算机模拟而非真人测试真实的机器人,但证据指向了一个明确的需求:如果我们想教会机器人如何保持安全,我们必须首先教会它们人类对未知的感觉。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。