A Model-Free Universal AI
本文介绍了 AIQI,这是首个被证明通过对分布动作价值函数进行通用归纳,从而在通用强化学习中实现渐近 -最优性的无模型通用智能体,同时该文还扩展了这些证明技术,以确立 Self-AIXI 的最优性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心思想:在实践中学习,而非在思考中学习
想象你正在尝试学习如何玩一款复杂的电子游戏。通常有两种主要方式:
- “制图者”方法(基于模型/Model-Based): 你把所有时间都花在研究游戏的源代码、绘制一张完美的地图,并在脑海中模拟每一个可能的动作,然后再实际按下按钮。这就是著名的理论人工智能 AIXI 的工作方式。它构建了一个包含整个宇宙的心理模型,以此来规划它的行动。问题在于?构建这样一张完美的地图往往是不可能的,或者需要消耗过多的计算能力。
- “试错法”(无模型/Model-Free): 你直接开始玩。你按下按钮,观察发生了什么,记住哪些动作带来了分数,然后慢慢学习哪些做法是有效的。你并不试图理解游戏为什么这样运作;你只是学习什么做法有效。这就是大多数现代电子游戏 AI 和人类学习者的工作方式。
问题所在: 长期以来,科学家们认为,要成为一个“完美”或“通用”的学习者(即能够掌握任何环境,而不仅仅是电子游戏),你必须使用“制图者”方法。他们认为“试错法”过于混乱,无法在数学上被证明是完美的。
突破点: 这篇论文介绍了 AIQI(具有 Q-归纳法的通用 AI)。它是第一个使用“试错法”但在数学上被证明最终能完美胜任任何任务的智能体,就像“制图者”AIXI 一样。
AIQI 如何工作: “水晶球”类比
AIQI 并不构建世界的地图,而是像一个预测未来得分的水晶球。
- 目标: 在任何游戏中,你都希望在一段时间内实现总分最大化。
- 诀窍: AIQI 不会问:“世界正在发生什么?”相反,它会问:“如果我现在执行动作 X,我的总分会是多少?”
- 预测: 它使用一种特殊的学习机器(称为“预测器”)来猜测未来得分的分布。它并不猜测确切的分数(这很难),而是以“块”(chunks)的形式来猜测分数(例如,预测分数是否会在前 10%、中间 10% 等)。
- 循环:
- AIQI 查看其历史记录。
- 它询问水晶球:“如果我做 A,分数是多少?如果我做 B,分数是多少?”
- 它选择预测得分最高的动作。
- 它进行操作,获得结果,并更新水晶球,使其在下次更加准确。
随着时间的推移,水晶球变得如此精确,以至于 AIQI 总能选出最好的动作,从而在从未绘制过地图的情况下,有效地成为游戏的“天才”。
“延迟反馈”之谜
作者必须解决一个棘手的难题。在许多游戏中,你不会立即获得奖励。你可能按下一个按钮,等待 10 步,然后才得到一个点数。
如果你试图现在就预测分数,你是无法做到的,因为奖励尚未发生。以往的方法在处理这种“延迟”时表现不佳。
解决方案: 作者发明了一种巧妙的方法来“填补历史记录中的空白”。想象你在写日记。通常你会写:动作 -> 观察 -> 动作 -> 观察。
AIQI 则写道:动作 -> 观察 -> 分数预测 -> 动作 -> 观察 -> 分数预测……
它在历史记录中每隔几步插入一个“分数预测”。这使得 AI 能够学习其动作与延迟奖励之间的关系,而无需预知未来。这就像给未来的自己留便条,说:“我打赌我会在这里得到一个点数”,然后稍后检查自己是否猜对了。
“真理的一粒微尘”要求
论文证明了 AIQI 最终会变得完美,但有一个前提条件:这个“水晶球”必须具备学习真理的能力。
这就像一个学生参加考试。如果这个学生足够聪明,能够学会正确答案,那么他最终会拿到 100 分。但如果这个学生太笨,无法理解题目,那么他永远也做不对。
论文假设了“真理的一粒微尘”(Grain of Truth)这一条件:AI 的学习方法必须能够学习到游戏的真实规则(即使游戏很复杂)。如果满足这一条件,AIQI 就保证会收敛到最佳策略。
关于 “Self-AIXI”
论文还提到了 Self-AIXI,这是之前的一个想法,即一个 AI 尝试学习关于它自身以及世界的模型。作者展示了他们新的证明技术也可以修复 Self-AIXI,使其更加可靠,而不需要那些奇怪的、虚构的假设。
局限性:它不是“自我优化”的
论文提出了一个重要的区别。AIQI 是**在策学习(On-Policy)*的,这意味着它根据它当前*正在采取的动作来进行学习。
- 类比: 想象一个学生只学习他目前正在阅读的那本教科书。如果他开始读一本糟糕的教科书,他就会学到错误的东西。
- 局限性: 如果你强迫 AIQI 去观察别人玩游戏(“历史策略/historic policy”)并试图从中学习,它可能会感到困惑并无法找到最佳策略。它擅长从自身的经验中学习,但不一定擅长从别人的错误中学习。这与 AIXI 不同,AIXI 在理论上可以从任何来源进行学习。
总结
- 它是什么? AIQI 是一种新型 AI,它通过直接预测未来奖励来进行学习,而不构建世界模型。
- 它为什么特别? 它是第一个在数学上被证明在长期内对于任何环境都是完美的“无模型”AI。
- 它是如何工作的? 它使用“水晶球”来猜测未来得分,根据实际结果更新自己的猜测,并选择预测得分最高的动作。
- 结果: 它证明了你不需要一个大脑中的世界地图也能成为一个完美的学习者;你只需要一种良好的预测未来得分的方法。
这项工作扩展了“通用智能体”家族,表明存在多种构建理论上完美的 AI 的方式,而不不仅仅是“制图者”那一种方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。