← 最新论文
🤖 AI

Artificial Empathy: Towards a Framework for Unsupervised Agency Detection and Policy Reconstruction

本文提出了一种框架,该框架利用在独立任务上训练的强化学习智能体作为先验,以实现仅通过环境观测对其他智能体进行无监督检测并重构其策略。

原作者: Peter Kuhn, Chris Pang, Sonakshi Chauhan

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Peter Kuhn, Chris Pang, Sonakshi Chauhan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能研究的寂静角落,一个基本问题始终存在:机器如何才能理解世界上其他事物是在带有目的性地行动?为了让计算机能与人类或其他机器协作,它必须首先能够区分出一块石头是因重力而落下,还是一个人出于意图在伸手去拿那块石头。这种被称为“代理检测”(agency detection)的能力,是社会交互的基石。如果没有这种能力,人工智能看到的仅仅是混乱的事件流,无法分辨随机噪声与目标导向型计划之间的区别。当机器必须弄清楚那个其他代理人究竟想做什么时,挑战变得更加巨大,这一任务被称为“策略重构”(policy reconstruction)。如果机器能够学会识别这些隐藏的意图并在没有被明确教授的情况下对其进行建模,那么它将朝着成为一个真正具有协作能力的伙伴迈出巨大的一步,从而能够将其自身的目标与周围生物的目标对齐。

剑桥人类归纳偏置项目(Human Inductive Bias Project)的一个研究团队通过提出一个他们称之为“人工共情”(artificial empathy)的系统,在解决这一难题方面迈出了重要一步。他们认为,与其试图从零开始构建复杂的心理理论,不如通过利用自身的内部机制作为引导来让人工智能理解他人。其核心思想是,AI本身就是一个做出决策并作用于世界的代理人,因此它已经具备了对“代理行为”是如何运作的内在理解。通过训练一个系统根据其自身学习到的行为模式来预测未来,研究人员创建了一个框架,该框架可以扫描环境、识别其他代理人,并弄清楚这些代理人试图实现什么目标,而这一切都不需要人类的标签或指令。

研究人员在一个受控的数字环境中测试了这个概念,那是一个简单的网格世界,其中的代理人通过移动来收集奖励。他们训练了一个标准的AI代理来解决特定任务,例如到达网格的左下角以获取分数。这个经过训练的代理充当了新系统需要理解的“专家”或“他人”。为了增加任务的难度和现实感,研究人员引入了一个干扰元素:第二个虚假代理,它的移动就像随风飘动的叶子一样随机。新系统的目标是忽略随机运动并正确识别出真正的代理人,然后学习模仿其特定的策略以达到目标。系统并未被告知哪一个是真实的代理人;它必须自己找出答案。

为了实现这一点,新系统通过加载另一个在完全无关任务(如收集食物)上训练过的AI的“大脑”,获得了一个领先优势。这种预加载的知识充当了一个“先验”(prior),即一套关于代理人通常如何行动以及其行为如何改变世界的预期。随后,系统观察了网格世界中的事件流。它利用自身的内部模型提出了一个简单的问题:如果我假设这里有一个代理人在行动,我能否预测接下来的情况?当系统观察随机行走者时,由于随机运动不符合任何逻辑性的目标寻求模式,其预测失败了。然而,当它观察专家代理时,其预测效果良好,因为专家的动作符合一个试图达成目标的代理人的逻辑。通过最小化预测与现实之间的误差,系统有效地过滤掉了噪声,并精准定位到了真正的代理人。

实验结果令人鼓藉。在观察环境一小段时间后,系统学会了忽略随机诱饵,并成功采纳了专家代理的策略。在一系列试验中,系统的表现迅速提升至随机猜测水平之上,最终达到了与原始专家相当的技能水平。这证明了该系统确实可以进行无监督的代理检测,即在混沌中识别出有目的的行动者并重构其策略。研究人员指出,这一成功依赖于系统使用其自身的内部动力学作为观察世界的透镜,有效地表达了:“我知道拥有目标的感受是怎样的,因此我也能识别出他人的目标。”

尽管这些发现令人鼓舞,但研究人员谨慎地将其界定为早期概念验证,而非最终解决方案。实验是在一个小型、全可见的网格世界中进行的,其中只有一个真实代理和一个虚假代理。该系统在很大程度上依赖于先验代理与目标代理在结构上的相似性,目前尚不清楚如果代理之间差异巨大,或者环境复杂且部分隐藏时,这种方法的效果如何。这项研究表明,自指先验(self-referential priors)可以支持代理检测,但它尚未声称解决了在现实世界中使人工智能与人类价值观对齐的更广泛问题。这项工作开启了一扇门,表明AI可以通过首先理解自身来学会关心他人,但通往完全协作未来的旅程依然漫长且充满未知。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →