← 最新论文
🤖 AI

SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing

本文介绍了“Safety Sentry”,这是一种轻量级的防护模型,它通过实现一种上下文感知的、针对单实例的三向路由系统(执行、询问、拒绝)来改进二元安全检查,从而在平衡安全性与用户自主权的同时,通过单一的解码阈值实现可调节的风险容忍度。

原作者: Tianyu Chen, Chujia Hu, Wenjie Wang

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianyu Chen, Chujia Hu, Wenjie Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你刚刚打造了一个超级智能的机器人助手,它几乎可以完成你要求的任何事情:写邮件、管理你的日程表,甚至整理你的数字文件。它就像一个永不眠的魔法管家。但问题在于:如果你告诉这个机器人“删除所有内容”,它可能会面不改色地执行,甚至可能抹掉你一生的心血。这就是**AI智能体(AI Agents)**的世界——这些程序不仅仅是在聊天,它们还在现实世界中真正地“做事”。科学家们现在面临的一个大问题是:我们如何既能阻止这些机器人犯下可怕的错误,又不至于把它们变成那种毫无用处、畏首畏尾、连呼吸都要请示一下的机器人?

长期以来,解决方案是一个简单的“停止标志”。一个安全卫士会观察机器人想要做的每一件事,然后说:“安全”或“不安全”。如果不安全,机器人就停止;如果安全,它就继续。但这种方法就像一个保安,无论你是只是想拿支笔,还是试图偷走大楼里的保险库,他都会把你拦下来。他们对这两类行为的处理方式是一样的:“停下,询问!”这让机器人变得既烦人又缓慢,最终人们开始忽视这个卫士,直接把他挥开,以便能高效完成工作。现在的新思路是给这个卫士一点“脑力”,让他能分辨出什么是“拿支笔”(直接去做)、什么是“偷保险库”(立即停止),以及什么是“可能是在拿笔,但我不确定你是不是真的想拿”(询问人类)。

这正是上海科技大学的研究人员在他们的新论文 SAFETY SENTRY 中所做的工作。他们意识到旧有的“安全 vs 不安全”系统太笨拙了。相反,他们教会了他们的 AI 卫士对机器人想要采取的每一个动作做出三种截然不同的选择:执行(EXECUTE)(放手去做!)、询问(ASK)(嘿,人类,你确定吗?)或者拒绝(REFUSE)(绝对不行,这很危险)。

把这想象成一个非常聪明的夜店保镖。旧式的保镖只会让你进场或把你踢出去。而新的 SAFETY SENTRY 保镖会查看你的身份证件和你的行为。如果你只是来喝一杯,他说:“请进”(执行)。如果你试图带进一个看起来很可疑的大包裹,他说:“没门,你过不去”(拒绝)。但如果你拿着一张看起来是真的、但举止有点怪异的门票,他并不会把你踢走,而是会对你说:“稍等,让我先跟经理确认一下”(询问)。通过这种方式,机器人仍然可以快速且乐于助人,但它不会意外炸掉厨房或删除你的照片。

为了教这个卫士如何做出这三种选择,研究人员并没有仅仅使用教科书;他们建立了一个完整的游乐场。他们设置了九种不同的现实世界“服务”(例如电子邮件系统、文件存储和团队聊天应用的模拟版本),并让一个 AI 机器人在此运行任务。然后,他们让 AI 卫士观察机器人的每一步行动。他们训练卫士去观察上下文:机器人是在尝试删除文件吗?它是在索要密码吗?用户是否有特定的规则,比如“删除前务必确认”或“预先批准常规编辑”?

结果非常令人印象深刻。当他们用这个新的三向卫士与其它顶尖的 AI 安全系统(包括一些昂贵的闭源系统)进行对比测试时,SAFETY SENTRY 在判断何时该放行以及何时该拦截方面表现得更好。它减少了两个方向的错误:它不会在不需要时阻止机器人(这会让机器人变慢),也不会在应该拦截时让机器人执行危险操作。

这个系统最酷的部分之一是它的灵活性。通常,如果你想让一个安全卫士变得更严格或更宽松,你需要从头开始重新训练整个系统,这需要耗费大量时间。但 SAFETY SENTRY 有一个特殊的“旋钮”(称为阈值),用户可以转动它。如果你是在运行一个失误会导致致命后果的医院系统,你可以把旋钮转到“超级谨慎”,这样卫士几乎每次都会要求人工审批。如果你是在运行一个注重速度的个人笔记应用,你可以把旋钮转到“直接去做”,这样卫士只会拦截那些真正危险的操作。最棒的是,你不需要重新训练 AI 来实现这一点,只需转动旋钮,它就能立即适应。

论文还表明,这个卫士可以通过阅读用户的特定风险偏好来理解“用户是谁”。如果你告诉卫士:“我要求对任何不可逆的文件删除进行明确确认”,那么即使机器人只是删除单个文件,它也会询问许可。如果你告诉它:“我预先批准日常笔记的常规编辑”,它就会让机器人直接编辑或删除这些文件而无需询问。这种个性化意味着机器人感觉不像是一个僵化的机器,而是一个尊重你特定操作规则的得力伙伴。

最后,SAFETY SENTRY 表明,我们不必在拥有强大的自主机器人和拥有安全的机器人之间做二选一。通过从简单的“是或否”系统转向更聪明的“是、否、或让我确认”系统,我们可以让我们的数字助手既快速又自由,同时确保它们永远不会跨越灾难的底线。这只是改变了我们要求机器人思考的方式,但它可能正是让我们释放 AI 智能体的潜力,而不至于烧掉整座房子的关键钥匙。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →