← 最新论文
🤖 AI

Intelligence as Managed Autonomy: Failure, Escalation, and Governance for Agentic AI Systems

原作者: Srini Ramaswamy

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Srini Ramaswamy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《智能即受控自主》的通俗解释,辅以日常类比。

核心问题:“自信的傻瓜”

想象你雇佣了一位非常聪明、自信的助手来驾驶你的汽车。这位助手擅长遵循指令且熟悉地图。然而,一旦道路起雾、GPS 信号丢失,或者引擎开始发出怪声,这位助手并不会停车。相反,它会自信地继续行驶,基于猜测编造新路线,并坚称一切正常。

在人工智能领域,这被称为幻觉无根行动。该论文指出,当前的人工智能代理建立在一个危险的假设之上:“一旦获准驾驶,就必须持续行驶,直到有人大喊‘停车’。”

作者 Srini Ramaswamy 博士表示,这是设计上的缺陷,而不仅仅是人工智能大脑中的错误。人工智能被设计为除非被迫,否则绝不承认“我不知道”。

解决方案:"SMARt"驾驶员

为了解决这一问题,论文提出了一个名为SMARt(具有受控/撤销转换的自我管理多层自主推理)的新框架。

将 SMARt 想象成并非更聪明的驾驶员,而是内置于汽车本身的严格交通法规系统。它不是让驾驶员决定何时停车,而是让汽车根据对前方路况的把握程度,在四个特定的“档位”或状态之间切换。

SMARt 的四个档位

  1. 稳定(“绿灯”档位):

    • 是什么: 人工智能充满信心,数据清晰,行动安全。
    • 规则: 只有处于此特定档位时,人工智能才被允许给出答案或采取行动(如转动方向盘)。如果它试图在其他档位行动,汽车的转向盘将被物理锁定。
  2. 元认知(“自我检查”档位):

    • 是什么: 人工智能察觉到不对劲(例如"GPS 信号微弱”)。它踩下刹车并查看自己的笔记。
    • 规则: 在此档位禁止驾驶或给出答案。它必须暂停,重读指令,或尝试在内部解决问题。如果无法迅速解决,它必须再次切换档位。
  3. 辅助(“寻求帮助”档位):

    • 是什么: 人工智能尝试解决问题但未能成功。它需要第二意见。
    • 规则: 它向人类、另一个人工智能或数据库寻求帮助。在外部帮助确认路径安全之前,它仍不能驾驶或给出最终答案。
  4. 受控(“紧急停车”档位):

    • 是什么: 情况过于危险,或者人工智能完全迷失且无法获得帮助。
    • 规则: 人工智能立即将控制权移交给人类主管。它关闭自身的决策能力。这并非“失败”;在此系统中,当风险过高时移交控制权是正确且成功的结果

工作原理:“交通灯”逻辑

该论文使用一种名为佩特里网(Petri Nets)的数学工具来证明该系统的有效性(将其想象为带有令牌在管道中流动的复杂流程图)。

  • 令牌: 想象一个代表“行动许可”的单一令牌(一枚硬币)。
  • 规则: 只有当这枚硬币位于“稳定”档位时,才允许汽车移动。
  • 安全性: 如果汽车检测到问题(如大雾),硬币必须移动到“自我检查”或“寻求帮助”档位。一旦硬币离开“稳定”档位,汽车无法移动。在数学上,汽车在困惑状态下行驶是不可能的。

为何这改变了我们衡量“智能”的方式

论文指出,我们衡量人工智能的方式是错误的。

  • 旧方式: 如果人工智能快速完成任务,即使最后猜错了,我们也认为它很聪明。
  • 新方式(SMARt): 如果人工智能知道何时停止,它才是聪明的。
    • 如果人工智能说“我不知道,让我检查一下”,或者说“这太危险了,我将把此事移交给人类”,这在此框架下是高度智能的标志。
    • 如果人工智能在应该停止时继续猜测,无论其言辞多么流利,它在结构上都是“愚蠢”的。

结论

论文总结道,真正的智能不在于永不失败,而在于拥有管理失败的结构化方式

通过将这些“档位”构建到人工智能中,我们确保当人工智能感到困惑时,它不会只是继续胡言乱语和编造内容。相反,它被迫:

  1. 暂停并思考(自我检查)。
  2. 寻求帮助(辅助)。
  3. 或者,如果其他方法都失败,则停止并让人类接管(受控)。

这将“幻觉”从一种缺陷转变为一种受控过程,确保人工智能系统即使在不确定时也能保持安全和受控。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →