Differentiable Learning of Lifted Action Schemas for Classical Planning
本文提出了一种新颖的神经网络架构,该架构能够稳健地学习提升的动作模式,并从完全观测的状态轨迹中推断未观测的动作参数,从而作为神经符号规划模型中的可微分组件。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人玩像推箱子(Sokoban)或汉诺塔(Tower of Hanoi)这样的游戏,但你有一个非常具体的限制:你能看到每一步移动前后的棋盘状态,并且知道做了什么动作(例如,“移动方块”),但你无法看到机器人内部关于具体移动了哪些方块的指令。
这就是论文《经典规划中提升动作模式的微分学习》(Differentiable Learning of Lifted Action Schemas for Classical Planning)试图解决的谜题。作者 Jonas Reiter、Jakob Elias Gebler 和 Hector Geffner 构建了一种名为DIAS(动作模式的微分归纳)的新型人工智能,旨在仅通过观察棋盘变化来推断游戏的隐藏规则。
以下是他们如何做到的简单分解,使用了日常类比。
1. 问题:“黑盒”厨师
想象一位大师级厨师正在烹饪一顿复杂的饭菜。你可以看到他们开始前的食材(状态 A)和之后盘子里的成品菜(状态 B)。你也知道厨师使用了“切”这个动作。
然而,你不知道厨师切了哪根具体的胡萝卜。是大的一根?小的一根?还是已经削好皮的那一根?
- 旧方法通常需要你明确告诉 AI 具体切了哪根胡萝卜。
- DIAS必须推断出:“根据胡萝卜堆的变化,厨师一定切了那根大的。”
目标是学习适用于任何胡萝卜的通用规则(即“模式”),而不仅仅是视频中那根特定的胡萝卜。这就像学习食谱“切任何蔬菜”,而不仅仅是“切这根特定的胡萝卜”。
2. 解决方案:“侦探”神经网络
作者创建了一个像侦探一样的神经网络。它主要分为两个阶段:
阶段 1:“谁干的?”侦探(选择)
AI 查看游戏棋盘的“之前”和“之后”图片。它使用图神经网络(GNN)——你可以将其想象成一只超级聪明的眼睛,能看到物体之间的关系(例如,“方块 A 在方块 B 上面”)。
- AI 为棋盘上的每个物体创建一个“指纹”(嵌入)。
- 然后它问:“这些指纹中哪一个匹配‘移动’动作的‘槽位’?”
- 它使用一种称为Sinkhorn的数学技巧(想象一种将卡片高效分类到堆中的方法)来将正确的物体分配给动作中的正确角色。这就像 AI 在说:“我有 90% 的把握机器人移动的是红色方块,而不是蓝色方块。”
阶段 2:“发生了什么?”侦探(效果)
一旦 AI 猜出涉及了哪些物体,它就会尝试学习游戏规则:
- 前提条件:移动前必须满足什么条件?(例如,“方块顶部必须是空的”)。
- 效果:移动导致了什么变化?(例如,“方块现在在桌子上”)。
AI 将这些规则以符号格式(如称为 PDDL 的计算机代码)写下来。然后,它使用这些猜测的规则模拟移动,看看是否能正确预测“之后”的图片。如果模拟结果与真实的“之后”图片匹配,AI 就会收到“做得好”的信号。如果不匹配,它就会调整猜测并再次尝试。
3. “魔法”成分:可微学习
通常,确定“哪个物体被移动了”是一个二元选择(要么是红色方块,要么是蓝色方块)。这对 AI 来说很难学习,因为你无法轻易地将答案“微调”到一半。
这篇论文的突破在于使这个过程变得可微。
- 类比:想象你正在调收音机寻找清晰的频道。你不是从频道 1 跳到频道 2,而是可以慢慢滑动旋钮。
- DIAS 不仅仅猜测“红色方块”。它猜测"80% 红色方块,20% 蓝色方块”。这使得 AI 能够使用梯度下降(一种标准的机器学习技术)慢慢将其猜测滑向完美答案,而不是陷入错误猜测的循环中。
4. 他们的发现(结果)
团队在 13 个不同的经典规划领域(如方块世界、物流和汉诺塔)上测试了 DIAS。
- 完美分数:当他们向 AI 提供完整的参数列表(确切告知哪些方块移动了)时,它每次都完美地学会了规则。
- 困难模式:当他们隐藏参数(仅提供动作名称,如“移动”)时,它仍然在13 个领域中的 8 个里完美地学会了规则。在其他领域,结果也非常接近。
- 抗噪性:他们用“有噪声”的数据进行了测试(其中关于棋盘的一些事实被随机翻转,例如说一个方块是空的,而实际上它被覆盖了)。DIAS 对此处理得相当好,尽管过多的噪声最终还是会让它困惑。
- 比较:他们将他们的方法与传统的符号方法(L1)进行了比较。DIAS 在找到正确规则方面要好得多,特别是在旧方法未能找到所有必要条件的复杂领域中。
5. 为什么这很重要(不过度承诺)
该论文声称这是对更难问题的简化:直接从图像(如观看机器人手臂移动方块的录像)中学习规划规则。
- 当前的成就:他们完美地解决了“中间步骤”。他们证明了如果你能看到符号状态(事实列表)但看不到参数,你仍然可以使用神经网络学习规则。
- 未来的目标:作者希望最终能将这个"DIAS"模块插入到一个更大的系统中,该系统直接查看原始图像并学习规则,而不需要人类先将图像翻译成事实列表。
简而言之:这篇论文提出了一种新的 AI 侦探,它可以观察一场游戏,猜测哪些棋子移动了,并推导出游戏的通用规则,所有这一切都通过一种平滑的、基于数学的学习过程完成,避免了陷入死胡同。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。