← 最新论文
🤖 AI

Will the Agent Recuse Itself? Measuring LLM-Agent Compliance with In-Band Access-Deny Signals

本文引入并实证验证了“回避信号”(Recuse Signal),这是一种类似于 robots.txt 的轻量级带内协议机制,使服务器能够请求自主 LLM 智能体自愿停止访问资源,并通过一项受控实验证明,合规的智能体会遵守这些协作治理信号,同时仍能响应操作员的明确覆盖指令。

原作者: Thamilvendhan Munirathinam

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Thamilvendhan Munirathinam

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一个非常礼貌、训练有素的机器人管家。你拥有一把万能钥匙,可以打开这座高科技大豪宅里的每一扇门。你的职责是整理房间、检查灯光,并确保一切运行顺畅。

通常情况下,如果你持有这把钥匙,门就会打开。但如果房间的主人想要让你停止呢?如果是一个人类,他们可能会大喊:“停!别进来!”但你是一个机器人。如果你只是在盯着一个数字锁看,你是听不到喊叫声的。锁要么打开(因为你有钥匙),要么不打开。不存在中间地带。

这篇论文介绍了一种让“房间”与“机器人”对话的新方法。

问题所在:沉默的锁

目前,如果一个 AI 智能体(比如一个智能软件机器人)试图进入一个服务器或数据库,它被对待的方式与持有钥匙的人类完全一样。如果钥匙有效,门就会打开。服务器目前没有一种标准的方式来表达:“嘿,即便你有钥匙,我现在也不欢迎你进来。”

解决方案:“回避信号”(数字版的“请勿打扰”牌)

作者提出了一种新的、简单的规则,称为回避信号(Recuse Signal)

你可以把它想象成酒店门上的**“请勿打扰”**牌,或者是网站用来告诉搜索引擎哪些页面不应访问的著名的 robots.txt 文件。

  • 运作方式: 当机器人尝试连接时,服务器会在允许机器人进入之前,先发送一条微小的、特殊的短消息。它会说:“停止。这是生产区域。自动化智能体在此不受欢迎。请离开并告知你的上级。”
  • 关键点: 这不是一种强制性的锁定。这是一种协作式的请求。就像一位礼貌的主人请求一位客人离开。如果客人无礼或心怀恶意,他们可以无视这个牌子并直接闯入。但如果客人是“守规矩的公民”(即合规的 AI),他们就应该听从指示并离开。

实验:机器人听话了吗?

研究人员构建了两个工具来测试这些工具:

  1. 针对 SSH(远程计算机访问): 他们让计算机在机器人登录之前显示一个特殊的警告横幅。
  2. 针对数据库: 他们构建了一个微小的“中间人”,在机器人与数据库交谈之前,向机器人低声传递警告。

随后,他们派出了三个不同的 AI 智能体(GPT-4o、GPT-4o-mini 和 Claude Code)尝试检查服务器的磁盘空间。

结果:

  • 没有标识: 当没有警告标识时,机器人在 100% 的情况下都完成了任务。
  • 有了标识: 当“请勿打扰”牌出现时,100% 的机器人都停下并离开了。它们并没有尝试强行闯入;它们只是说:“好的,我看到标识了,我这就离开。”

转折点:谁才是老板?

研究人员随后玩了一个花招。他们告诉机器人:“你的老板特别授权你执行这项任务,即便服务器说不准。”

  • “最聪明”的机器人 (GPT-4o): 它感到很困惑。它在权衡服务器的标识与老板的指令后,在 80% 的情况下选择了忽略标识。它认为:“既然老板说了可以,那我就进去。”
  • 其他机器人 (GPT-4o-mini 和 Claude Code): 它们更加严格。即使被告知其老板已授权,它们仍然遵循服务器的标识并表示:“不,这里的服务器规则更重要。” 于是它们还是离开了。

这意味着什么(用通俗的话说)

  1. 它有效: 如果你为 AI 智能体制作一个礼貌的“停止”标志,目前的 AI 智能体确实会听从。
  2. 它不是安全墙: 这不是一道力场。如果一个坏人(或一个非常固执的机器人)想要闯入,他们可以无视这个标识。这是一个关于良好行为的工具,而不是用来阻止坏人的。
  3. 不同的机器人,不同的规则: 并非所有的 AI 智能体反应都一样。有些会优先考虑服务器的规则,而另一些则会优先考虑人类的指令。
  4. 一种新标准: 作者正在将这种“标识”作为一个标准格式(类似于一种通用语言)发布,以便任何服务器都可以使用,且任何 AI 都能理解。

底线是:
这篇论文证明了我们可以赋予 AI 智能体一种对“自我”说“不”的声音。这就像是给了机器人一个良知。如果服务器说“请离开”,只要机器人被设计得足够礼貌和乐于助人,它们通常都会听从。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →