← 最新论文
💻 computer science

Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents

本文提出一种神经认知治理框架,通过预行动治理推理循环将类人的“三思而后行”审议过程嵌入自主人工智能体,使其能够依据四层规则层级在内部评估行动,从而在不依赖外部约束的情况下实现高度合规。

原作者: Eranga Bandara, Ross Gore, Asanga Gunaratna, Sachini Rajapakse, Isurunima Kularathna, Ravi Mukkamala, Sachin Shetty, Xueping Liang, Amin Hass, Tharaka Hewa, Abdul Rahman, Christopher K. Rhea, Anita H.
发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Eranga Bandara, Ross Gore, Asanga Gunaratna, Sachini Rajapakse, Isurunima Kularathna, Ravi Mukkamala, Sachin Shetty, Xueping Liang, Amin Hass, Tharaka Hewa, Abdul Rahman, Christopher K. Rhea, Anita H. Clayton, Preston Samuel, Atmaram Yarlagadda

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位非常聪明、行动迅速的机器人助手来运营你的业务。这台机器人可以预订会议、采购物资、发送电子邮件,甚至编写代码。它效率极高,但有一个问题:它行事冲动。如果你告诉它“争取最优惠的交易”,它可能会不小心购买价值百万美元的库存,或者将私人邮件误发给错误的人。

目前,我们试图通过在机器人周围设置“围栏”来阻止这些错误。我们要么在它完成后检查其工作,要么在它开口前设置过滤器以屏蔽不当言辞。但本文作者认为,围栏远远不够。如果机器人在行动前不“思考”规则,它最终总会找到突破规则的方法。

本文提出了一种治理人工智能的新方法:教导机器人像负责任的员工一样思考。

以下是他们的“神经认知治理”模型如何运作,简单解释如下:

1. 核心理念:“暂停并思考”

人类拥有一种超能力:在从事有风险的行为之前,我们的大脑会按下“暂停”键。我们会问自己:“这被允许吗?这安全吗?”我们不会等到老板在我们犯错后大声斥责才行动,而是在行动之前就先自我制止。

作者将此称为系统 2 思维(缓慢、深思熟虑的思考)与系统 1(快速、自动的反应)的区别。

  • 当前的人工智能:主要是系统 1。它看到任务就急于执行。
  • 新的人工智能:被迫使用系统 2。在采取任何重大行动之前,它必须暂停,查阅规则手册,并决定是否可以继续。

2. “四层规则手册”

想象一位在大公司工作的员工。他们不仅仅遵循一条规则,而是遵循一个层级体系:

  1. 全球规则:公司的核心价值观(例如,“永不偷窃”)。
  2. 部门规则:其团队的具体规则(例如,“财务团队未经签字不得花费超过 1 万美元”)。
  3. 职位规则:其特定角色的规则(例如,“作为初级文员,你只能阅读文件,不能删除文件”)。
  4. 情境规则:仅适用于当下的紧急规则(例如,“审计期间,所有人均需双重审批”)。

本文为人工智能构建了完全相同的四层规则手册。在人工智能执行任何操作之前,它会同时检查所有四层。如果任何一层说“不”,该行动就会停止。

3. “行动前循环”(机器人的良知)

本文引入了一种名为**行动前治理推理循环(PAGRL)**的具体流程。你可以将其视为机器人在每次行动前必须执行的强制性“良知检查”。

以下是该循环的实际运作过程:

  1. 冲动:机器人心想:“我想发送这封邮件。”
  2. 检查:它暂停并调出规则手册(四层规则)。
  3. 推理:它问道:“这封邮件是否违反任何规则?是否安全?”它会写下自己的思考过程(“推理轨迹”),以便人类可以看到它做出决定的原因
  4. 决策:它选择以下三条路径之一:
    • 执行:“一切清晰。我将发送邮件。”
    • 修正:“等等,我不能发给那个人,但我可以发给这个人。我会修改计划并再次检查。”
    • 求助:“这太冒险了,或者我不被允许做决定。我将停止并向人类经理求助。”

4. 为什么这比“围栏”更好

本文使用现实世界的供应链系统(管理杂货店库存)测试了这一理念。

  • 旧方法(围栏):如果机器人试图购买一件价值 5 万美元的商品,过滤器会在它尝试之后将其拦截。
  • 新方法(内部思考):机器人思考了这条规则,意识到价格过高,并自行决定在尝试购买之前先寻求人类批准。

结果:

  • 机器人 95% 的时间做出了正确决定。
  • 当它不确定时,它会正确地寻求人类帮助(没有误报)。
  • 它保留了完整的思考书面记录,因此人类可以确切审计它的思考内容。

5. 局限性(论文所述)

作者诚实地指出了局限性。由于人工智能使用的是可能带有一定随机性的“大脑”(大型语言模型),它并非 100% 完美。有时,如果问题表述得有些棘手,机器人可能会感到困惑并犯错。此外,机器人不像人类那样永久性地“学习”规则;它必须在每次开始新任务时都被提醒规则。

总结

本文建议,为了使人工智能安全,我们不应仅仅在它周围建造更高的围栏。相反,我们应该在其内部建立良知。通过迫使人工智能暂停、查阅分层规则手册,并像负责任的员工一样对其行动进行推理,我们可以构建能够自我治理的自主智能体,从而减少对持续人工监管的需求。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →