Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents
本文提出一种神经认知治理框架,通过预行动治理推理循环将类人的“三思而后行”审议过程嵌入自主人工智能体,使其能够依据四层规则层级在内部评估行动,从而在不依赖外部约束的情况下实现高度合规。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你雇佣了一位非常聪明、行动迅速的机器人助手来运营你的业务。这台机器人可以预订会议、采购物资、发送电子邮件,甚至编写代码。它效率极高,但有一个问题:它行事冲动。如果你告诉它“争取最优惠的交易”,它可能会不小心购买价值百万美元的库存,或者将私人邮件误发给错误的人。
目前,我们试图通过在机器人周围设置“围栏”来阻止这些错误。我们要么在它完成后检查其工作,要么在它开口前设置过滤器以屏蔽不当言辞。但本文作者认为,围栏远远不够。如果机器人在行动前不“思考”规则,它最终总会找到突破规则的方法。
本文提出了一种治理人工智能的新方法:教导机器人像负责任的员工一样思考。
以下是他们的“神经认知治理”模型如何运作,简单解释如下:
1. 核心理念:“暂停并思考”
人类拥有一种超能力:在从事有风险的行为之前,我们的大脑会按下“暂停”键。我们会问自己:“这被允许吗?这安全吗?”我们不会等到老板在我们犯错后大声斥责才行动,而是在行动之前就先自我制止。
作者将此称为系统 2 思维(缓慢、深思熟虑的思考)与系统 1(快速、自动的反应)的区别。
- 当前的人工智能:主要是系统 1。它看到任务就急于执行。
- 新的人工智能:被迫使用系统 2。在采取任何重大行动之前,它必须暂停,查阅规则手册,并决定是否可以继续。
2. “四层规则手册”
想象一位在大公司工作的员工。他们不仅仅遵循一条规则,而是遵循一个层级体系:
- 全球规则:公司的核心价值观(例如,“永不偷窃”)。
- 部门规则:其团队的具体规则(例如,“财务团队未经签字不得花费超过 1 万美元”)。
- 职位规则:其特定角色的规则(例如,“作为初级文员,你只能阅读文件,不能删除文件”)。
- 情境规则:仅适用于当下的紧急规则(例如,“审计期间,所有人均需双重审批”)。
本文为人工智能构建了完全相同的四层规则手册。在人工智能执行任何操作之前,它会同时检查所有四层。如果任何一层说“不”,该行动就会停止。
3. “行动前循环”(机器人的良知)
本文引入了一种名为**行动前治理推理循环(PAGRL)**的具体流程。你可以将其视为机器人在每次行动前必须执行的强制性“良知检查”。
以下是该循环的实际运作过程:
- 冲动:机器人心想:“我想发送这封邮件。”
- 检查:它暂停并调出规则手册(四层规则)。
- 推理:它问道:“这封邮件是否违反任何规则?是否安全?”它会写下自己的思考过程(“推理轨迹”),以便人类可以看到它做出决定的原因。
- 决策:它选择以下三条路径之一:
- 执行:“一切清晰。我将发送邮件。”
- 修正:“等等,我不能发给那个人,但我可以发给这个人。我会修改计划并再次检查。”
- 求助:“这太冒险了,或者我不被允许做决定。我将停止并向人类经理求助。”
4. 为什么这比“围栏”更好
本文使用现实世界的供应链系统(管理杂货店库存)测试了这一理念。
- 旧方法(围栏):如果机器人试图购买一件价值 5 万美元的商品,过滤器会在它尝试之后将其拦截。
- 新方法(内部思考):机器人思考了这条规则,意识到价格过高,并自行决定在尝试购买之前先寻求人类批准。
结果:
- 机器人 95% 的时间做出了正确决定。
- 当它不确定时,它会正确地寻求人类帮助(没有误报)。
- 它保留了完整的思考书面记录,因此人类可以确切审计它的思考内容。
5. 局限性(论文所述)
作者诚实地指出了局限性。由于人工智能使用的是可能带有一定随机性的“大脑”(大型语言模型),它并非 100% 完美。有时,如果问题表述得有些棘手,机器人可能会感到困惑并犯错。此外,机器人不像人类那样永久性地“学习”规则;它必须在每次开始新任务时都被提醒规则。
总结
本文建议,为了使人工智能安全,我们不应仅仅在它周围建造更高的围栏。相反,我们应该在其内部建立良知。通过迫使人工智能暂停、查阅分层规则手册,并像负责任的员工一样对其行动进行推理,我们可以构建能够自我治理的自主智能体,从而减少对持续人工监管的需求。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。