Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning
本文提出了一种新颖的强化学习框架,通过将目标函数重新表述为将奖励不确定性视为奖励函数的分布,从而自然地诱导出多样化且可控的智能体行为,进而消除了传统熵正则化或启发式方法中固有的性能与多样性之间的权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人写故事、解数学题或发现新药。在旧的方法中(称为“强化学习”),你会给机器人一个单一且严格的规则手册:“完全按照能获得最高分的方式去做。”
问题在于?机器人很快就会学会变成一个无趣的、只会一招鲜的“单调型选手”。它会找到那一个完美的答案,然后每次都重复做同样的事,从而忽略了所有其他同样优秀的可能。如果你的规则手册有一点点错误(这在人类评价机器人时经常发生),机器人可能会过度学习这个微小的错误,并开始做出糟糕的行为。
这篇论文提出了一种更聪明的方法来教机器人。你不是给它一本规则手册,而是给它一盒许多本略有不同的规则手册。你告诉机器人:“我不百分之百确定哪一本才是‘真实’的,所以请学习如何精通所有这些手册。”
以下是这篇论文提出的新方法——ROSA(随机目标,集合动作)是如何运作的,我们使用一些日常类比:
1. “规则手册盒”(奖励不确定性)
在现实世界中,我们往往并不确切知道自己想要什么。
- 旧的方法: 你告诉一位厨师,“做一份完美的牛排。”厨师做出一份特定的牛排,然后永远只供应这一种。如果你其实想要的是三分熟的牛排,但你说的是“完美”,那么这位厨师就卡住了。
- 新方法 (ROSA): 你告诉这位厨师,“这里有10位不同的评委。评委 A 喜欢三分熟,评委 B 喜欢五分熟,评委 C 喜欢全熟。我不知道今天哪位评委才是正确的。请学习如何做出一份能让其中任何一位评委都满意的牛排。”
机器人学到了,因为它不知道“真实的”规则是什么,所以最聪明的做法是保持选择的多样性,并随时准备在不同的风格之间切换。这自然地创造了多样性,而不仅仅是为了随机而随机。
2. “多选其一”的技巧(集合动作)
机器人如何学习处理这个规则手册盒呢?
- 旧的方法: 机器人尝试一个动作,得到一个分数,然后进行更新。如果分数很低,它就会陷入恐慌。
- 新方法 (ROSA): 想象机器人正在参加考试。它不是回答一个问题并祈祷结果,而是同时写下五个不同的答案。
- 然后,对于盒子里的每一个可能的“规则手册”(评委),机器人都会查看它的五个答案,并选出针对该特定评委的最佳答案。
- 它根据这个“最佳选择”获得分数。
- 最后,它在所有评委之间对这些分数取平均值。
这就像是在说:“我不需要同时精通所有事情。我只需要确保,对于出现的任何一位评委,我的口袋里至少有一个能让他们惊艳的答案。”
3. 为什么这比“熵”更好
科学家们以前曾尝试通过增加一个“混乱奖励”(称为熵正则化)来强迫机器人保持多样性。
- 类比: 这就像告诉一个学生,“如果你用一种杂乱、不可预测的方式写答案,你会获得额外加分。”学生可能会为了拿加分而开始写一些胡言乱语,即使答案是错误的。
- ROSA 的优势: ROSA 并不要求混乱。它要求的是准备就绪。机器人之所以保持多样性,是因为它需要为不同的评委做好准备。它不会以牺牲高分为代价;它实际上通过这种方式变得更好,因为它能更好地应对不确定性。
4. 论文证明了什么
作者通过以下测试运行了这个想法:
- 冲突的评委: 当两个评委想要相反的东西时(例如,“让答案为偶数”对比“让答案为奇数”),旧的方法会完全失败,因为指令互相抵消了。ROSA 学会了做到两者兼顾,根据上下文在偶数和奇数答案之间切换。
- 多个正确答案: 在数学问题中,通常有很多种解题方式(简洁明快,或详尽细致)。旧的方法会选择一种风格并固守其中。ROSA 学会了生成所有不同的有效风格,为用户提供更多选择。
- 嘈杂的评委: 当评委感到困惑或犯错时(模拟现实世界的不确定性),ROSA 并不会感到困惑。它保持了健康的答案多样性,而其他方法则会陷入坏习惯。
核心结论
这篇论文认为,多样性不是一个缺陷,而是应对不确定性时变得聪明的特征。
通过将奖励视为一个可能性的分布,而不是一个单一的数字,并通过训练机器人同时观察一组潜在答案,我们得到了一个这样的系统:
- 鲁棒性: 当规则稍有偏差时,它不会崩溃。
- 多样性: 它自然地提供许多不同的优秀解决方案。
- 高效性: 它不会浪费时间去尝试随机化;它保持多样性是因为在未来充满不确定性时,这样做才是理性的做法。
简而言之:与其训练一个只知一个答案的专家型机器人,ROSA 训练的是一个能够应对一切的通才型机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。