AI Learning and Conceptual Transfer in the Game of Hidden Rules
本报告详细介绍了一项关于隐藏规则游戏(GOHR)的研究,其中基于 Transformer 的 A2C 智能体通过试错反馈来推断隐藏规则,研究探讨了以特征为中心与以对象为中心的表示方式、规则难度、迁移学习以及泛化能力的影响,并同时分析了在伪机器人辅助下的人类学习模式。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能广袤的领域中,研究人员正不断尝试教机器如何像人类一样学习:通过观察模式、犯错,并弄清楚支配某种情况的隐藏逻辑。这不仅仅是关于记忆事实,而是关于在没有被告知规则的情况下,发现游戏或系统的底层规则。想象一下,你走进一个房间,里面的物体必须分类放入不同的箱子中,但没有人告诉你分类的标准。你必须通过猜测、尝试几种方法、观察哪些有效,从而慢慢推导出规则。这种推断隐藏结构的过程是我们在导航世界时(从科学推理到战略决策)的基础。为了让机器变得真正具有适应性,它们需要掌握这项同样的技能,从僵化的编程转向真正的概念理解。
来自罗格斯大学和南加州大学的一个研究小组决定利用一个被称为“隐藏规则游戏”的受控环境来探索这一挑战。在这个数字游戏中,一个人工智能代理面对着一个包含九个物体的棋盘,每个物体都有特定的形状和颜色,以及四个位于角落的桶。目标是将每个物体移动到正确的桶中,但决定哪个物体去哪里的规则是保密的。该代理只能通过试错来学习;如果它做出一次移动,游戏只会回答“是”或“否”,不会提供进一步的解释。研究人员想要观察不同类型的人工智能在多大程度上能弄清楚这些不可见的规则,它们学习的速度有多快,以及学习一个规则是否有助于它们随后学习一个新的相关规则。
为了测试这一点,团队构建了两种不同的方式让计算机“看到”游戏棋盘。第一种方法被称为“以特征为中心”(feature-centric),它将棋盘视为一个灯光网格。它将棋盘作为一个整体来看待,记录形状和颜色出现在特定位置的情况,就像相机拍摄场景的照片一样。第二种方法被称为“以物体为中心”(object-centric),它将每个部件视为一个独立的个体。它关注每个物体的特定属性——它的颜色、形状以及精确的位置,将它们分开处理,而不是将它们融合为一个单一的图像。研究人员使用一种学习算法训练了这两类代理,该算法奖励正确的移动并惩罚错误,使它们能够通过数千次尝试不断改进。
结果显示,这两种方法在处理学习时存在明显的差异。以物体为中心的代理(即视世界为各种独立项集合的代理)在理解游戏的深层逻辑方面表现得更为出色。它们学习规则的速度更快,并且能更好地将所学知识应用于新情境。当研究人员测试它们泛化知识的能力时,以物体为中心的模型展示了卓越的技能迁移能力,尽管存在局限性。统计分析表明,相应的基于形状和基于颜色的规则表现出高度相似的性能特征,这表明模型一致地对待这些规则类型。然而,当棋盘上的物体数量超过其见过的最大值时,以物体为中心的模型确实经历了性能的明显下降,特别是在涉及复杂排序或关系推理的规则方面。相比之下,以特征为中心的代理在面对这些变化时显得很吃力。它们似乎记住了物体在棋盘上的特定位置,而不是理解物体与桶之间的抽象关系。当棋盘布局发生微小变化时,它们的表现大幅下降,这表明它们学习的是房间的地图,而非游戏的规则。
研究还探讨了不同类型的规则对于代理而言的理解难度。简单的规则,如“把所有红色的东西放入第一个桶”,被两类代理都很快掌握。然而,需要理解序列或复杂顺序的规则,例如“按照页面上出现的顺序放置部件”,则被证明要困难得多。研究人员发现,特征排序和条件属性对两种模型来说仍然是最具挑战性的任务,尽管以物体为中心的代理在这些困难任务中通常表现出比以特征为中心的代理更稳定且连贯的学习曲线。
当研究人员检查代理如何从一个规则过渡到下一个规则时,出现了一个特别引人注目的发现。当一个代理学习了一个简单规则,然后被要求学习一个结合了两个概念的复合规则时,以物体为中心的代理表现出了巨大的性能提升,但前提是先前的训练必须明确包含了目标规则的组成部分。在这些特定情况下,它们可以复用已获得的知识,有效地跳过了初始的试错阶段,收敛速度提升了近五倍。然而,以特征为中心的代理在大多数情况下几乎没有从这种先前的经验中获益。它们似乎无法识别出新规则是由它们已经掌握的部分构建而成的,仅表现出微弱的正向迁移或在特定实例中的小幅增长。这表明,以物体为中心的方法允许机器建立一种更灵活且可复用的概念理解,类似于人类意识到按一种属性进行分类的逻辑与按另一种属性进行分类的逻辑是相似的。
除了机器之外,研究人员还观察了人类如何玩这个游戏,特别是当人类接受来自计算机程序的建议辅助时。通过分析移动序列以及成功与失败的时机,他们发现可以区分出是在独自玩耍的人类还是在有人协助的人类。即使在不知道策略且看不到棋盘的情况下,胜负的模式也足以揭示辅助者的存在。这表明我们学习和纠正错误的方式留下了一种独特的签名,即使在底层策略隐藏的情况下也能被检测到。
最终,这项工作强调了教机器进行概念性思考的一个关键进步。它表明,为了让人工智能真正从经验中学习,它需要看到的不仅是一个静态图像,而是一个由具有自身属性的相互作用物体组成的集合。通过专注于单个部件及其关系,机器可以发展出对环境规则更稳健且可迁移的理解。虽然这项研究并不声称解决了人类式学习之谜,但它提供了强有力的证据:我们向机器呈现信息的方式与学习算法本身同样重要。以物体为中心的方法似乎是创造能够适应、泛化并从周围世界的隐藏结构中学习的系统的更具前景的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。