Offline Policy Evaluation for Manipulation Policies via Discounted Liveness Formulation
本文提出了一种用于机器人操作的新型离线策略评估框架,该框架利用基于折扣存活性的贝尔曼算子,有效应对稀疏奖励、非单调任务进展以及有限视界截断偏差,从而在准确反映任务进展方面优于经典方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看一个机器人学习如何折叠毛巾或拿起碗。有时,机器人成功了。有时,它打翻了碗、滑倒,或在完成前耗尽了时间。
在机器人领域,我们需要一种方法来评估这些尝试。我们想知道:“这个机器人的策略有多好?”问题在于,机器人只在尝试结束时才得到评分:通过(任务完成)或失败(时间耗尽)。它不会在沿途的每一步都获得分数。
本文介绍了一种新的、更聪明的方法来评估这些机器人,特别是当它们被允许在犯错后继续尝试时。
问题:“超时”陷阱
想象一个学生正在参加考试。如果他们时间耗尽,老师会将整份试卷标记为“未完成”。但如果该学生实际上正走在正确的轨道上,只是需要再多两分钟呢?或者,如果他们被一道难题卡住,稍作停顿,解决了一道较简单的问题,然后又回来解决那道难题呢?
在机器人领域,这被称为截断偏差。因为机器人的“考试”(即一个回合)有严格的时间限制,标准的评估方法假设:如果机器人因时间耗尽而停止,那就是彻底失败。它们没有意识到机器人可能几乎成功了,或者正处于恢复过程中。这使得机器人看起来比实际情况更差。
解决方案:“存活”评分
作者提出了一种新的评分思路。他们不再问:“你获得了多少奖励?”,而是问:“你距离‘存活’(成功)还有多远?”
他们将任务视为一场“热或冷”的游戏:
- 目标状态(成功): 机器人是“热”的。分数非常低(例如 -1)。
- 失败/超时: 机器人是“冷”的。分数很高(例如 1)。
- 中间状态: 分数告诉你还需要多少步才能到达目标。
巧妙之处在于他们如何处理“冷”的时刻。
“自举”技巧:从“差点成功”中学习
这里的魔法成分是:自举(Bootstrapping)。
想象你正在观看一个机器人尝试拿起碗。
- 尝试 1: 机器人拿起碗,打翻了它,再次拿起,然后成功了。
- 尝试 2: 机器人拿起碗,打翻了它,然后计时器归零。
标准评估者会说尝试 2 是彻底失败。但我们的新方法审视尝试 2 并说:“等一下!机器人在尝试 2 中打翻了碗,就像在尝试 1 中一样。但在尝试 1 中,机器人从完全相同的打翻中恢复并完成了任务。”
因此,该方法表示:“尽管尝试 2 耗尽了时间,但机器人处于一个它知道如何恢复的状态。让我们给它更高的分数。”
这就是自举机制。它在“失败”的尝试中寻找与“成功”尝试中完全相同的时刻。如果找到匹配项,它就会提升失败尝试的分数,意识到机器人并非注定失败,只是时间不够了。
他们的发现
作者在三种不同的场景中测试了这种方法:
- 拿起碗(模拟): 机器人打翻了碗,恢复后完成了任务。新方法正确地认可了机器人的恢复能力,而旧方法则认为这是失败。
- 将方形 peg 放入孔中(模拟): 这更难,因为机器人没有“恢复”策略。如果它掉落了 peg,它就真的卡住了。新方法仍然擅长识别进展,但它无法神奇地解决机器人无法从糟糕的掉落中恢复这一事实。
- 折叠毛巾(真实机器人): 由人类控制机器人。人类经常挣扎、掉落布料,然后重试。新方法非常出色地认识到,即使人类在挣扎,他们仍在向目标取得进展,而旧方法仅仅将“挣扎”视为“失败”。
权衡
论文承认了一个小缺点。由于该方法非常擅长为“差点成功”的时刻给予认可,它有时会变得过于乐观。它可能会认为一次失败的尝试实际上是成功的,因为它看起来与真正的成功相似。然而,作者认为这是一个公平的权衡:对机器人恢复能力稍显乐观,总比因时间耗尽而不公正地惩罚它要好。
一句话总结
这篇论文为机器人的评分系统提供了“第二次机会”。新方法不再仅仅因为时钟耗尽就判定机器人失败,而是审视机器人的历史。如果机器人曾证明自己能从特定错误中恢复,该方法就会认可它走在正确的轨道上,即使当前的尝试未能在时限内完成。它将简单的“通过/失败”评分转化为一张细致的地图,展示机器人距离成功究竟有多近。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。