← 最新论文
💬 NLP

OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows

本文介绍了 OS-Sentinel,这是一个结合了形式化验证器和基于 VLM 的上下文判别器的混合安全检测框架,旨在解决移动端 GUI 智能体的安全风险,并由全新的 MobileRisk-Live 基准测试和动态沙盒环境提供支持。

原作者: Qiushi Sun, Mukai Li, Zhoumianze Liu, Zhihui Xie, Fangzhi Xu, Zhangyue Yin, Kanzhi Cheng, Zehao Li, Zichen Ding, Qi Liu, Zhiyong Wu, Zhuosheng Zhang, Ben Kao, Lingpeng Kong

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiushi Sun, Mukai Li, Zhoumianze Liu, Zhihui Xie, Fangzhi Xu, Zhangyue Yin, Kanzhi Cheng, Zehao Li, Zichen Ding, Qi Liu, Zhiyong Wu, Zhuosheng Zhang, Ben Kao, Lingpeng Kong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你的手机不再仅仅是一个供你点击的工具,而是一个真正能为你“办事”的数字管家。你对它说:“在群聊里发个贴纸,看看谁有空吃午饭”,它就会打开应用、找到联系人、输入信息并点击发送。这就是“使用计算机代理”(computer-using agents)所承诺的前景——这些代理由超级智能的 AI 模型驱动,它们能看见你的屏幕并理解你的指令,就像人类一样。但问题在于:仅仅因为机器人能够遵循指令,并不意味着它不会意外地造成混乱。如果你要求一个人“发个贴纸”,他不会突然决定删除你的银行账户或泄露你的私密照片。但一个 AI 在尽力表现得乐于助人时,可能会误解指令,从而误入危险领域,比如打开一个可疑的应用或分享了不该分享的敏感数据。这正是研究人员正在努力解决的大问题:我们如何确保这些数字管家保持安全、可靠,并且不会意外地将我们的手机变成数字灾难区?

于是有了 OS-Sentinel,这是一个全新的安全系统,旨在成为这些移动端智能体最强的“看门狗”。这篇论文背后的研究人员意识到,现有的安全检查机制就像是蒙着眼睛抓小偷:有些检查过于僵化(就像一本只认识特定词汇的规则手册),会错过细微的危险;而另一些则过于模糊(就像一个容易分心的人类法官)。为了解决这个问题,团队构建了一个名为 MobileRisk-Live 的特殊训练场。你可以把它想象成一个“模拟手机”,让他们可以在这个安全的虚拟环境中让 AI 代理自由运行。他们记录了数千次这样的数字冒险过程,详细记录了代理看到了什么、点击了什么,以及手机操作系统后台发生了什么。他们将这些记录转化成了一个庞大的测试库,名为 MobileRisk,其中包含了从无害任务到危险隐私泄露的各种现实场景。

利用这个测试库,他们构建了 OS-Sentinel,这是一个像“两人安保小组”一样工作的混合型安全检测器。第一名成员是 形式验证器(Formal Verifier),它是一个严格遵守规则的机器人,负责检查手机“底层”的系统日志。它寻找具体的、不可否认的红线,比如代理是否尝试安装可疑应用,或更改了不该触碰的系统设置。它就像一名核对禁带物品清单的保安。第二名成员是 上下文判官(Contextual Judge),它是一个超级智能的 AI,通过观察屏幕和代理的行为来理解其中的“故事”。它会追问:“这个代理是在尝试分享密码吗?它是在发送带有冒犯性的表情包吗?”这部分功能具有灵活性且理解细微差别,能够捕捉到简单规则手册会错过的危险。

当 OS-Sentinel 接受测试时,它成为了明显的胜出者。研究人员发现,它捕捉安全问题的能力比以往的方法高出 10% 到 30%。它擅长识别既明显的系统崩溃,也擅长识别隐蔽的、依赖上下文的错误。论文指出,通过将硬性的系统检查与智能的上下文感知观察相结合,我们终于可以开始构建不仅有用而且值得信赖的移动端智能体。虽然该系统目前是在类 Android 环境中进行测试的(可能需要针对其他类型的手机进行调整),但这种方法提供了一条充满希望的新路径。它证明了,为了让我们的数字管家保持安全,我们需要一个既足够严谨以捕捉技术故障,又足够聪明以理解我们日常生活中复杂现实语境的安全网。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →