An Information-Theoretic Definition for Open-Ended Learning
本文基于“比特等效”概念引入了一种基于信息论的开放式学习定义,用以量化获取奖励所需的信息量,证明了该指标的线性增长是将开放式环境与经典多臂老虎机区分开来的特征,并提出了一种能够实现此类学习的算法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在玩一款电子游戏。在普通的游戏中,有一个最终 Boss、一个高分纪录以及一条清晰的通向胜利的路径。一旦你击败了 Boss,游戏就被“解”开了。你无法再变得更强,因为没有新的东西可以学习了。
现在,想象另一种不同的游戏。在这种游戏中,随着你玩得越多,游戏就会揭示出新的关卡、新的机制和新的挑战,这些都是你之前无法想象的。游戏永不结束,你也永远不会停止变得更聪明。这就是作者所称的开放式学习(Open-Ended Learning)。
Xu、Zhu 和 Van Roy 的这篇论文试图回答一个非常棘手的问题:我们如何知道一个 AI 真的处于一个永无止境的游戏中,还是仅仅在玩一个很长但枯燥的游戏?
以下是他们思想的拆解,使用了简单的类比。
1. 问题所在:“新颖性”并不足够
此前,人们认为如果一个环境能不断给 AI 提供新的、奇特的、有趣的任务,那么它就是“开放式”的。作者说:“别急,先别这么说。”
想象一个机器人不断生成随机且古怪的画作。这些画作都是“新”的(具有新颖性),你也可以“学习”去识别它们。但这个机器人真的在绘画水平上有所“进步”吗?并没有。它只是在制造噪音。
作者认为,真正的开放式本质不仅仅是创造新事物,而是需要不断学习新信息才能变得更好。如果你可以在不学习任何新知识的情况下获得高分,那么这个游戏就不是开放式的。
2. 新工具:“比特等效值”(Bit-Equivalent)
为了衡量这一点,作者发明了一个新概念,叫做比特等效值。
把“比特”想象成信息的货币。
- 概念: 一个奖励的“比特等效值”是指你理解这个世界以赚取该特定奖励所需的最小信息量。
- 类比: 想象你正在寻找隐藏的宝藏。
- 如果宝藏是掉在人行道上的 1 美元钞票,你只需要 0 比特 的信息就能找到它。你只需低头看一眼即可。
- 如果钻石藏在一个拥有复杂地图的大型洞穴中,你需要许多比特的信息(地图、布局、线索)才能找到它。
作者定义,只有当一个环境要求 AI 为了持续获得更高奖励而必须以稳定的线性速度收集越来越多的信息(比特)时,该环境才是开放式的。如果 AI 可以在不学习新信息的情况下持续获得奖励,那么这个环境就是“封闭式”的。
3. 测试:为什么旧游戏会失败
作者在这些“经典”AI 游戏(称为 Bandit 环境)上测试了这个定义。他们发现几乎所有的游戏都未能通过开放式测试。
- 有限游戏(有限臂 Bandit): 想象一台有 10 个摇杆的老虎机。一旦你弄清楚了哪个摇杆给的钱最多,你就会一直拉那个摇杆。于是你停止了学习。“比特等效值”停止了增长。
- 无限游戏(无限臂 Bandit): 想象一台有无限个摇杆的老虎机,但每个摇杆都是完全随机且互不相关的。你可以每次都拉一个新的摇杆并获得新的奖励,但你并没有在学习一种“模式”。你并没有建立起对机器更深层的理解。你获得的信息无法帮助你在长期内变得更好。
在这两种情况下,AI 都会撞上一堵墙:它无法在不学习更多知识的情况下变得更好,但环境又不允许这种持续的学习发生。
4. 解决方案:“贪婪/渴求型”游戏(The "Insatiable" Game)
随后,作者构建了一个新的自定义游戏,叫做贪婪线性 Bandit(Insatiable Linear Bandit)。
- 设置: 想象一排无穷无尽的电灯开关。每个开关都控制着你得分的一小部分。有些开关是坏的(会降低你的分数),而有些是好的(会提高你的分数)。
- 难点: 你不知道哪些开关是好的。你必须通过拨动它们来找出答案。
- 为什么有效: 因为这一排开关是无限的,所以总会有新的、未被探索的部分可能带来好结果。为了获得更高的分数,你必须不断拨动更多的开关,并学习哪些开关有效的模式。你永远无法“解开”这个游戏,因为游戏具有无限的深度。
5. 策略:“截断汤普森采样”(Truncated Thompson Sampling)
作者还尝试教 AI 如何玩这个新游戏。他们发现标准的 AI 策略都失败了:
- 太贪婪: 如果 AI 试图一次性学习整个无限长的序列,它会被压垮,并做出伤害得分的错误。
- 太保守: 如果 AI 只看前 10 个开关并忽略其余部分,它会在一段时间后停止进步。
获胜策略: 作者创建了一种名为**截断汤普森采样(TTS)**的方法。
- 类比: 想象你正在阅读一本宏大的、无限长的百科全书。
- 不要试图在一天之内读完整本书(你会失败)。
- 不要永远只读第一页(你学不到新东西)。
- TTS 的做法: 先读第一章。掌握它。然后,进入第二章。接着是第三章。你不断扩大你的“阅读窗口”,程度恰好能让你保持在学习曲线的前面。
通过缓慢扩大它试图学习的范围,AI 可以不断发现新的“好开关”,从而使其得分(以及它所持有的信息量)持续线性增长。
总结
该论文声称:
- 真正的开放式本质意味着一个环境,其中变得更好要求你必须以稳定的节奏不断学习新信息。
- 目前大多数 AI 游戏都不是开放式的,因为你最终会停止需要通过学习来获取奖励。
- 他们构建了一个新游戏(贪婪线性 Bandit),在这个游戏中,你必须通过不断学习来提升自己。
- 他们构建了一种新的 AI 策略(截断汤普森采样),该策略通过不断扩大其知识范围来成功游玩这款游戏,证明了在正确的条件下,开放式学习是可能的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。