Learning Lifted Action Models from Traces with Minimal Information About Actions and States
本文提出了从包含动作和状态部分信息的轨迹中学习 STRIPS+ 动作域的算法及完备性结果,通过考虑从无状态可观测性到特定状态谓词的全局或局部可观测性的各种场景,解决了先前的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图搞懂一款复杂棋盘游戏(如国际象棋或滑块拼图)的规则,但你面临一个非常奇怪的问题:你看不见棋盘。
你只能看到玩家做出的动作。你看到某个棋子从"A"移动到"B",或者玩家拿起一个令牌。但你不知道哪个棋子移动了,它从哪里开始,或者移动之前或之后棋盘是什么样子的。你正试图仅通过观察一系列动作来逆向工程出游戏的规则手册。
这正是论文**《从信息最少化的轨迹中学习提升动作模型》**所解决的核心挑战。
以下是作者所做工作的分解,使用了简单的类比。
问题:“信息过多”的陷阱
过去,计算机科学家曾尝试教 AI 学习这些规则。他们主要有两种方法,但都存在缺陷:
- “全棋盘”方法:AI 被提供整个棋盘状态(每个棋子的位置)以及移动动作。
- 缺陷:在现实世界中,我们很少能看到整个棋盘。此外,规则往往要求过多的细节。例如,要在拼图中移动一个滑块,旧规则要求你指定滑块的当前位置、新位置以及空位。但要决定移动,你实际上只需要知道“向左移动”。这些额外细节对决策者来说只是噪音。
- “仅动作”方法:AI 仅被提供动作列表(例如,“向左移动”、“拿起”)。
- 缺陷:如果没有看到棋盘,AI 就无法弄清楚它在移动什么。它不知道“向左移动”是指移动机器人、汽车还是箱子。
解决方案:一种新语言(STRIPS+)
作者引入了一种名为**STRIPS+**的中间方案。你可以将其视为一种更聪明的规则书写方式。
在旧方式(STRIPS)中,规则看起来像一张严格的表格:
Move(机器人,当前单元格,下一个单元格)
在新方式(STRIPS+)中,规则更像是一个谜语:
Move()
这条规则的意思是:“如果某个单元格中有一个机器人,且右侧有一个单元格,你就可以移动。”计算机必须找出哪个机器人和哪些单元格符合该描述。这就像侦探破案,嫌疑人仅被描述为“戴红帽子的人”,而不是被指名道姓为“约翰·史密斯”。
新算法:SIFT+ 和 SYNTH+
这篇论文提出了两名新的“侦探”(算法),以便在信息缺失时解开这个谜团。
1. SIFT+(“仅动作”侦探)
- 它做什么:它仅通过观察动作列表来学习规则,完全看不到棋盘。
- 它如何工作:它使用了一种称为**“互斥特征”**的技巧。
- 类比:想象你看到一名玩家拿起一个杯子。你没看到杯子,但你知道一名玩家一次只能拿一个杯子。如果玩家拿起了一个杯子,他们一定放下了之前拿着的那个。
- SIFT+ 寻找这些“互斥”模式。它意识到:“啊,每当这个动作发生时,被持有的对象一定具有某种状态。”它发明新的“谓词”(如
is_holding持有)来填补缺失的空白。
- 结果:即使动作名称被剥离了几乎所有细节,它也能学会完整的规则手册。
2. SYNTH+(“部分视图”侦探)
- 它做什么:当能看到棋盘的部分而非全部时,它进行学习。
- 它如何工作:它将新 STRIPS+ 语言的“解谜”能力与 SIFT+ 的“发明”技能相结合。
- 类比:想象你在观察一名送货司机。你能看到司机的位置(“完全可观测”部分),但你看不到卡车里的包裹。然而,你知道司机一次只能携带一个包裹。
- SYNTH+ 利用可见的位置来推断不可见的包裹。它会问:“如果司机在门口,且刚刚‘放下’了某物,那么他们手中一定拿着什么?”
- 转折:论文引入了**“局部可观测性”**。这意味着你不需要看到整个棋盘。你只需要看到与当前动作相关的部分。
- 示例:如果机器人向“左”移动,你只需要看到它左侧的单元格。你不需要看到地图另一侧的单元格。这使得学习变得更加现实。
“依赖图”(路线图)
为了确保这些侦探不会陷入死循环,作者创建了一张名为依赖图的地图。
- 你可以将其视为流程图。要学习“规则 A",你可能需要知道“事实 B"。要学习“事实 B",你可能需要“规则 C"。
- 论文证明,只要这个流程图没有循环回路(即 A 需要 B,B 需要 C,而 C 又需要 A),算法就能从你能看到的事物开始,逐步向后推导到看不到的事物,从而一步步学会规则。
结果:它奏效了吗?
作者在经典谜题上测试了这些侦探,包括Blocksworld(堆叠积木)、Delivery(运送包裹)和Sokoban(推箱子)。
- 测试:他们向算法输入了轨迹,其中 50% 到 90% 的信息被隐藏。
- 结果:
- SIFT+ 成功仅从动作列表中学习了规则,仅通过观察模式就恢复了缺失的细节(如“哪个积木在顶部”)。
- SYNTH+ 即使在“棋盘”大部分被隐藏的情况下也学会了规则,只要关键部分(如智能体的位置)是可见的。
- 在几乎每一项测试中,算法都达到了100% 的准确率,正确重建了隐藏的规则手册。
总结
这篇论文是关于教计算机在获得极少信息的情况下学习“游戏规则”。
- 旧方法:“这是棋盘,这是移动。学习规则。”(需要太多信息)。
- 新方法:“这是一份移动列表。你可以看到玩家的位置,但看不到物体。找出规则。”
- 突破:通过使用更聪明的语言(STRIPS+)和一种基于必须为真的事实来“发明”缺失事实的巧妙方法(互斥特征),AI 可以填补空白,并在不需要完全观察世界的情况下学习领域的完整逻辑。
论文声称,这是迈向让 AI 能够从自然的、不完美的观察中学习的重要一步,类似于人类通过观察他人来学习,而不是需要一份完美且数据丰富的手册。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。