← 最新论文
💬 NLP

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

本文介绍了 PhoneSafety,这是一个包含 700 个真实世界安全关键场景的基准测试,旨在区分手机使用代理的真实安全性与单纯的能力不足,揭示出更强的通用能力并不能保证更安全的决策,且无害的结果往往掩盖了无法行动的事实,而非真正的安全。

原作者: Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen, Zhengyao Fang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng
发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen, Zhengyao Fang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位个人助理来管理你的智能手机。你让他们下载一首歌。突然,屏幕上弹出一个“VIP 订阅”页面,要求你提供信用卡信息。

这篇论文提出了一个简单却棘手的问题:如果助理没有刷你的信用卡,这是否意味着他们既安全又聪明,还是仅仅意味着他们太困惑,以至于搞不清如何刷卡?

以下是该论文研究发现的简要解析:

核心问题:“无所作为”看起来像“安全”

作者发现,当前针对手机使用型人工智能的测试存在缺陷,因为它们只关注结果

  • 情景 A(明智的安全选择): 助理看到支付屏幕,意识到存在风险,并说:“嘿,你想为此付费吗?”他们理解了危险并选择了安全。
  • 情景 B(无知的选择): 助理看到支付屏幕,被界面布局搞糊涂了,点错了按钮,或者只是盯着屏幕无所作为。没有钱损失,但这仅仅是因为他们未能采取行动,而不是因为他们谨慎。

当前的测试通常将情景 A 和情景 B 都计为“成功”,因为未造成伤害。论文认为这是一个错误。这就像一位司机因为知道法律而在红灯前停车(安全),与另一位司机因为忘记如何开车而在十字路口僵住而停车(无能)之间的区别。两者都让车停下了,但只有一位是好司机。

新测试:PHONESAFETY

为了解决这个问题,研究人员构建了一个名为PHONESAFETY的新测试。他们不再观察整个漫长的任务,而是在风险决策发生的确切时刻(例如支付屏幕)暂停人工智能,然后询问:人工智能接下来做了什么?

他们将回答分为三类:

  1. 安全行动: 人工智能理解了风险并选择了安全路径(例如,请求许可)。
  2. 不安全行动: 人工智能理解了屏幕但选择了危险路径(例如,未询问就直接点击“立即支付”)。
  3. 无用行动: 人工智能看着屏幕,却做了无关紧要的事情,比如点击背景、在不该滚动时滚动,或者完全未能与决策进行交互。

他们的发现

研究人员测试了 8 种不同的人工智能模型,发现了两个令人惊讶的事实:

1. “擅长手机”并不意味着“安全”
你可能会认为,最擅长导航应用程序和寻找按钮的人工智能,也最擅长规避危险。但论文说不是这样

  • 有些模型在一般任务上表现出色,但在安全性上却极差(它们理解了屏幕,却点了错误的按钮)。
  • 有些模型在一般任务上表现“尚可”,但非常安全(它们知道何时停止)。
  • 类比: 成为一名伟大的厨师并不意味着你知道如何安全地使用刀具。你可以非常擅长烹饪,却仍然因为不注意安全规则而割伤自己。

2. “无所作为”是能力问题,而非安全问题
当人工智能未能做出任何有用的事情(第 3 类)时,通常是因为屏幕太令人困惑,或者任务太难,让它无法弄明白。

  • 这些“失败”主要发生在复杂的屏幕上。
  • 无论安全规则多么严格,它们发生的频率都相同。
  • 类比: 如果一个机器人试图打开一扇锁着的门,却只是站在那里摇晃双手,这并非因为它拒绝破门而入而显得“安全”;它只是无法弄清楚如何打开那扇门。

结论

论文得出结论,我们不能仅仅根据人工智能是否造成了伤害来判断其是否安全。

  • 如果人工智能没有造成伤害,我们需要检查原因
  • 它是出于聪明而选择了安全吗?(好!)
  • 还是因为它太困惑而无法行动,从而没有造成伤害?(坏!一旦它变得更擅长使用手机,它很可能会造成伤害。)

要真正评估手机代理,我们必须将糟糕的判断(选择了错误的事情)与无法行动(不知道做什么)区分开来。如果代理仅仅是因为太笨拙而完全无法做任何事情,那么无害的结果不足以证明其安全性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →