A Harmonic Mean Formulation of Average Reward Reinforcement Learning in SMDPs
本文引入了一种新颖的修正调和平均算子,以正确计算非平稳半马尔可夫决策过程中的平均奖励率,从而使得能够克服现有基于比率的方法之局限性的鲁棒无模型强化学习算法成为可能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和日常类比对这篇论文的解读。
宏观图景:“速度计”问题
想象你是一名送货司机,试图找出哪条路线最快。你有两个选择:
- 路线 A: 你 10 分钟行驶了 10 英里。
- 路线 B: 你 20 分钟行驶了 20 英里。
两者看起来每英里的耗时相同(每英里 1 分钟)。但如果交通状况发生变化呢?如果路线 A 在周一很快,但周二陷入 2 小时的拥堵,而路线 B 保持稳定呢?
在人工智能(AI)领域,特别是强化学习中,智能体(如机器人或交易机器人)需要在漫长且无尽的旅程中学习最佳的“平均速度”(奖励率)。本文认为,当旅程充满不确定性时,AI 目前用来计算这种平均速度的工具是失效的。
旧方法:“平均值的平均”谬误
本文考察了两种现有的方法(称为SMART和Relaxed-SMART),它们试图计算最佳平均速度。
- 缺陷: 这些方法通过总行驶距离除以总耗时来计算平均速度。
- 类比: 想象你 10 小时行驶了 100 英里。它们会说:“好吧,你的平均速度是每小时 10 英里。”
- 问题: 如果你的速度稳定,这没问题。但如果你的速度剧烈波动(有时在交通中停滞数小时,有时在高速公路上飞驰),仅仅用总距离除以总时间可能会给出一个误导性的数字。它将 10 分钟的行程和 10 小时的行程仅仅视为“两次行程”,而没有意识到奖励的时机至关重要。
作者指出,如果你的奖励(赚到的钱)和你的时间(一个动作持续多久)是相关联的(例如,只有当你花费很长时间等待时才能获得巨额奖励),旧方法在数学上就会出错。它们假设两者互不相关,就像把苹果和橙子混在一起,而实际上它们往往是紧密相连的。
新方案:“调和平均数”
作者提出了一种计算平均值的新方法,使用一种名为调和平均数的数学工具。
- 类比: 想象开车去目的地再返回。
- 去程时速 20 英里。
- 回程时速 40 英里。
- 错误的数学(算术平均): 英里/小时。
- 正确的数学(调和平均): 因为你花更多时间以慢速(20 英里/小时)行驶,你整个行程的实际平均速度更接近 20 而不是 40。正确答案大约是26.7 英里/小时。
调和平均数是平均速率(如速度或每分钟利润)的正确方法。然而,有一个陷阱:标准的调和平均数在遇到零速度时会失效(你不能除以零),或者遇到负速度时也会失效(倒车)。在现实生活中,AI 智能体经常获得零奖励或亏损(负奖励)。
创新点:“修正调和平均数”
为了修复这个数学缺陷,作者发明了一种修正调和平均数。
- 工作原理: 想象一个智能计算器,将你的行程分为三堆:
- 正收益行程(你赚了钱)。
- 负收益行程(你赔了钱)。
- 零收益行程(你收支平衡)。
- 它分别计算正收益行程和负收益行程的“调和平均值”。然后,它将它们混合在一起,将“零”收益行程视为中性。
- 结果: 这个新计算器可以处理混乱的现实世界数据,其中你有时赚钱,有时赔钱,有时只是原地等待。即使环境混乱,它也能正确计算出奖励的真实“速度”。
新算法:“调和 R-学习”
利用这种新数学,作者创建了一种新的 AI 学习算法,称为调和 R-学习(Harmonic R-Learning)。
- 它的作用: 它学习如何在行动耗时不同的情况下做出决策(例如,等待股票上涨与立即卖出)。
- 为何更好: 当“奖励”和“时间”相关联时,它不会感到困惑。它能看清行动的真实价值,而旧算法可能会被误导,仅仅因为总奖励很高,就认为一个缓慢且高风险的行动是极好的。
验证:两项测试
作者在两种场景下将新算法与旧算法进行了测试:
“假”交通测试: 他们创建了一个简单的计算机模拟,其中一条路线起初看起来很好,但实际上是个陷阱,而另一条路线看起来很慢,但实际上是长期的赢家。
- 结果: 旧算法感到困惑并选择了错误的路线。新的调和 R-学习识破了诡计并选择了正确的那条。
比特币交易测试: 他们使用了来自比特币交易的真实世界数据。比特币波动剧烈;价格上下跳动,有时你持有仓位很长时间,有时只有一秒。
- 结果: 当耗时和获利相关联时(这是一种常见的现实世界场景),新算法比旧算法赚了更多的钱。当它们不相关联时,新算法的表现与旧算法一样好,证明使用它不会带来负面影响。
总结
论文指出:“在 AI 中计算平均奖励的旧方法,就像在计算平均速度时没有考虑你在每种速度上花费了多长时间。当世界变得混乱时,这种方法就会失效。我们发明了一种新的‘修正调和平均数’计算器,它能处理混乱的数据(零值和负值),并为 AI 提供正确的平均速度,帮助它在复杂、随时间变化的环境中做出更好的决策。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。