Explainability Framework for Policy-Aware Autonomous Agents
本文提出了一种结合社会科学理论、并利用答案集编程(Answer Set Programming)与 Python 实现的框架,该框架通过利用策略违规惩罚来识别不理想的反事实事件,从而为自主智能体生成具有对比性且感知策略的解释,并其有效性通过人类参与者调查得到了验证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:你的烤面包机、你的汽车,以及你所在医院的排班系统,都由被称为“自主智能体”(autonomous agents)的微小、隐形的“大脑”在运行。这些不仅仅是遵循单一指令的简单机器人;它们是聪明的系统,能够观察混乱的数据堆,并决定下一步该做什么以实现目标。但问题在于:有时这些聪明的脑袋会做出一些在我们人类看来很奇怪、不公平或纯粹令人困惑的选择。如果一辆自动驾驶汽车突然转向,或者医院的排班系统把一名护士分配到了夜班,而她原本要求的是白班,我们想知道为什么。我们不想要一份代码清单;我们想要一个故事。这就是“可解释人工智能”(Explainable AI)的核心——这个领域正试图教会机器如何用通俗易懂的英语与我们交流,解释它们的逻辑,以便我们能够信任它们。
你即将探索的这篇论文深入研究了一种特定类型的智能体:一种严格遵守规则手册的智能体。把这些智能体想象成一个必须解决数学题,但同时也必须遵守一系列学校规则(比如“不得在走廊奔跑”或“始终举手”)的学生。如果学生违反了规则,他们会受到“惩罚”(比如留校察看)。这项研究背后的研究人员 Heather Merhout 和 Daniela Inclezan 想弄清楚如何向人类解释这个学生为什么做出了特定的选择。她们并不只是想说:“因为规则就是这么规定的。”她们想利用社会科学中的一个巧妙技巧:询问,“如果你做了相反的事,会发生什么?”通过想象一个智能体违反规则的“假设”世界,她们可以向我们展示那个世界里发生的灾难,从而证明最初的选择实际上是最好的选择。
“假设”机器的魔力
那么,这究竟是如何运作的呢?研究人员构建了一个名为“医院排班系统”的数字游乐场。在这个世界里,一个 AI 智能体扮演着繁忙护士长角色。它的任务是为护士团队分配班次,既要确保每个班次都有人值守,又要尽量尊重护士的个人意愿,比如想要周末休息或更倾向于白班。
为了让这个智能体变得聪明,研究人员使用一种称为 AOPL(授权与义务策略语言)的特殊语言赋予了它一本规则手册。这不仅仅是一份“做”与“不做”的清单;这是一个每个规则都有“价格标签”的系统。如果智能体违反了规则,它会得到一个惩罚分数。
- 大规则: 有些规则非常严格。例如,“你不能让班次处于无人值守的状态。”如果智能体尝试这样做,它会受到重罚(5 分加上每缺少一名护士的额外分数)。
- 好则好坏(Nice-to-Haves): 其他规则则较软,比如“护士 Zelda 偏好周六休息。”如果智能体忽略了这一点,它会受到较小的惩罚(3 分)。
智能体的目标是创建一个总惩罚分数最低的班表。这就像是在玩一场游戏,你的目标是尽可能少被水气球砸中。
侦探工作:对比性解释
这里正是魔力发生的地方。研究人员意识到,仅仅展示最终的班表是不够的。人类是好奇的。我们想知道:“为什么你给 Zelda 分配了这个班次,而不是那个?”
为了回答这个问题,团队构建了一个程序,它扮演着“时空旅行侦探”的角色。当人类问“为什么 Zelda 在 2 月 3 日休息?”时,程序并不仅仅是给出答案。它会创建一个反事实世界(counterfactual world)——一个答案不同的平行宇宙。
想象一下程序说:“好吧,让我们假装 Zelda 在 2 月 3 日没有休息。让我们强迫她在那天工作。”
程序随后在那个新的、虚假的世界上重新运行排班游戏。突然间,AI 撞到了墙。因为 Zelda 在那天工作,班表被打乱了。也许另一位护士 Yanni 现在不得不值一个她讨厌的班次,或者某个班次最后竟然无人值守。程序看到,在这个虚假的世界里,惩罚分数飙升了。
程序随后将这种灾难转化为人类友好的句子:
“我们让 Zelda 在 2 月 3 日休息,是因为如果我们不让她休息,我们将被迫违反关于 Yanni 偏好班次的规则,这将导致 3 分的惩罚。”
这就是对比性解释(contrastive explanation)。它并不试图列出智能体存在的每一个理由,而是专注于“发生了什么”与“如果智能体做出了不同选择,可能会发生什么”之间的差异。这就像父母解释说:“你不能晚餐吃冰淇淋,因为如果你吃了,你就不会吃蔬菜,然后你就会饿。”这种解释是通过强调替代方案带来的负面后果来起作用的。
人类测试:它有道理吗?
研究人员并不仅仅是构建了这一切然后听天由命;他们用真实的人进行了测试。他们向 12 名志愿者展示了两种不同的场景:一个是关于护士 Zelda 得到了她偏好的休息日,另一个是关于护士 Howard 没有得到他偏好的班次。
结果非常令人鼓舞。
- 理解度: 当被问及“这个解释是否有道理?”时,75% 的人在看到关于两个故事时立即回答“是”。另外 16.7% 到 25% 的人回答“是,但我需要再读一遍”。只有极少数人(8.3% 或 0%)表示完全没道理。
- 深度: 当被要求在 1 到 5 分的量表上评价其理解程度时,大多数人给出了 4 分或 5 分。这表明“假设”类故事清晰且有帮助。
- 信息过多吗? 研究人员曾担心他们是否提供了过多的信息(违反了对话中的“量”原则)。然而,大多数人觉得信息量恰到好处。唯一的瑕疵出现在第二个故事中,其中一些人希望获得更多关于为什么不选择其他选项的细节。程序添加了一个小注,写着“可能存在其他同样违反规则的班表”,但一些用户觉得这个注释让人感到困惑,而不是起到澄清作用。
总结
这篇论文并不声称已经永久解决了 AI 的谜团。相反,它为一种特定类型的问题提供了一个可靠、有效的框架:解释为什么一个遵循规则的 AI 做出了某种选择。通过使用内置于 AI 大脑中的“惩罚”系统,研究人员可以自动生成这样的故事,即:“我做 X 是因为做 Y 会导致更大的问题。”
这项研究表明,这种对比推理的方法——通过展示避免了哪些麻烦来解释选择——对人类是有效的。它将冰冷、硬性的逻辑转化为一种感觉像是对话的叙事。虽然目前的版本还有些僵化(它一次只能回答一个问题,有时会在复杂的数学计算中卡住),但它证明了我们可以构建出不仅能完成工作,还能以一种让我们更加信任它们的方式告诉我们“为什么”的智能体。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。