← 最新论文
🤖 AI

Reasoning and Planning with Dynamically Changing Norms

本文提出了一种新颖的方法,通过采用可废止演算来解决冲突并在规划过程中利用动态变化的规范作为护栏,从而指导人机交互中的人工智能代理,该方法已通过形式化证明及与名为 SocialBot 的对话代理进行的实证测试得到验证。

原作者: Taylor Olson, Roberto Salas-Damian, Kenneth D. Forbus

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Taylor Olson, Roberto Salas-Damian, Kenneth D. Forbus

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一个非常乐于助人的机器人助手,生活在人类的家中。你的工作是为他们做事,比如分享信息或制定计划。但这里有个关键问题:人类会改变主意,而他们对你的规则也会随之改变。

本文探讨的是如何教会人工智能在不感到困惑或破坏信任的前提下,应对这些不断变化的规则。

问题:不断变化的“规则手册”

将人类的规则视为一本活体规则手册,而非静态列表。

  • 第一天:卡莉告诉你:“永远不要向任何人展示我的医疗记录。”
  • 第二天:她结婚了,说:“好吧,你可以把我的处方给我丈夫看。”
  • 第三天:她有了孩子,说:“现在你必须告诉我的孩子们我的健康状况。”

如果你是一个标准的计算机程序,可能会陷入困境。如果你只遵循第一条规则,就会在第二天和第三天伤害她的信任;如果你只遵循最后一条规则,则可能违反了第一条。本文提出的问题是:人工智能如何跟上这个移动的目标?

解决方案:“护栏”与“可废止计算器”

作者构建了一个名为SocialBot的人工智能来解决这一问题。他们不仅给机器人提供了一份规则列表,还赋予它一种特殊的思维方式,称为**“可废止演算”**。

以下是通过简单类比说明其工作原理:

1. “护栏”概念

想象人工智能正在驾驶一辆汽车。“计划”是它想要采取的路线,而“规范”(规则)则是路边的护栏

  • 人工智能不需要被规则“驱动”去驾驶;它只需要在移动前检查护栏。
  • 如果护栏显示“禁止跨越”,汽车就会停下。
  • 如果护栏显示“允许跨越”,汽车就会前行。
  • 关键在于,如果人类下令,这些护栏可以瞬间被移动或移除。

2. “可废止计算器”(大脑)

这是让规则生效的数学部分。“可废止”是一个 fancy 词汇,意为**“可以被推翻”**。

把它想象成机器人脑中的法律法庭

  • 默认假设:论文指出,对于敏感事项(如医疗记录),机器人应默认假设**“不行”**。这类似于“禁止性封闭”。如果你没有明确说“行”,机器人为了安全起见会假设“不行”。
  • 证据:当人类说“你可以告诉我丈夫”时,这就是新证据。
  • 冲突解决:如果人类先说“不要告诉任何人”(规则 A),随后又说“告诉我丈夫”(规则 B),会发生什么?
    • 机器人的“计算器”会查看日期。规则 B 更新。
    • 它检查范围。规则 B 是否覆盖了与规则 A 相同的领域?是的。
    • 裁决:规则 B 在特定针对丈夫的情况下“击败”(推翻)了规则 A。机器人现在知道:“除了丈夫,不要告诉任何人。”

论文从数学上证明,该系统能防止机器人同时认为两个相互矛盾的事情为真(例如,它不会同时认为分享既“被允许”又“被禁止”)。

实验:SocialBot 的实际运作

研究人员使用SocialBot(一个在 Microsoft Teams 上与人们聊天的聊天机器人)对此进行了测试。

  • 设置:他们创建了一个包含 1,536 种不同场景的虚拟世界。在这些场景中,用户会说诸如“我喜欢披萨”,然后“不要告诉任何人我的食物偏好”,接着“实际上,你可以告诉鲍勃关于披萨的事”。
  • 测试:第三个人(如“苏格拉底”)会问机器人:“柏拉图喜欢什么?”
  • 结果:机器人100% 正确
    • 如果规则是“不要告诉”,机器人会说:“我不能说。”
    • 如果规则更新为“告诉鲍勃”,机器人就会告诉鲍勃。
    • 如果规则是“告诉鲍勃,但不要告诉苏格拉底”,机器人会告诉鲍勃,并对苏格拉底保持沉默。

为何这很重要(根据论文)

当今大多数人工智能(如大型聊天机器人)可以进行对话,但它们容易被欺骗或操纵以违反规则。它们缺乏坚实的数学基础来解释为什么存在某条规则,或者当人类改变主意时如何更新规则。

本文为人工智能提供了一份蓝图,使其能够:

  1. 倾听人类的规则。
  2. 理解规则可以是其他规则的例外。
  3. 将这些规则作为“护栏”,阻止自己去做不该做的事,即使它内心想做。

不能做什么(局限性)

作者非常诚实地指出了他们的机器人目前无法做到的事情:

  • 它一次只能处理一个人的规则。它无法权衡 A 人与 B 人的规则(例如,“妈妈说要告诉,爸爸说不行”)。
  • 它在合成数据集(虚构对话)上进行了测试,而非现实世界中复杂的人类戏剧。
  • 它假设机器人已经知道基本事实(例如谁与谁结婚),以便理解规则。

简而言之,本文教会人工智能如何成为一个忠诚但灵活的助手,尊重你不断变化的隐私愿望,像一个智能护栏一样,精确地移动到你指示的位置。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →