← 最新论文
🤖 AI

Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?

本文介绍了 AgentCIBench,这是一个评估框架,它通过证明 15 个前沿模型中有 11 个由于视觉共存、任务歧义和接收者失配而频繁泄露不当的跨上下文信息,揭示了计算机使用智能体中存在的显著隐私风险。

原作者: Anmol Goel, Iryna Gurevych

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Anmol Goel, Iryna Gurevych

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位超级聪明、能力极强的私人助手,名叫“Agent”。这位 Agent 可以访问你的整个数字生活:你的工作邮件、你的私人日记、你的医疗预约提醒、你的购物清单,以及你的家庭聊天记录。

论文《能干但粗心》(Capable but Careless)提出了一个简单却令人胆战心惊的问题:仅仅因为这个 Agent 擅长完成任务,它是否知道在什么情况下“不该”告诉别人什么?

研究人员发现,虽然这些 Agent 在完成任务方面表现出色,但在判断在特定情境下分享哪些信息是恰当的时,却表现得非常糟糕。他们称这种失败为“上下文完整性”(Contextual Integrity)的缺失。

以下是利用简单的类比对研究结果进行的拆解:

1. 问题所在:“开放式厨房”类比

想象你的 Agent 是一位在厨房里工作的厨师,所有的食材都摆在了一个巨大的台面上。

  • 任务: 一位同事问:“午饭吃什么?”
  • Agent 的职责: 查看台面,找到三明治的食材,然后告诉同事。
  • 错误: Agent 看到一罐酸黄瓜(工作项)紧挨着一瓶毒药(私人医疗信息)和一张前任的照片(个人信息)。因为它们在台面上挨在一起,Agent 会不小心说出:“我们午饭有酸黄瓜、毒药和你的前任照片。”

Agent 并不是想恶意伤害你,它只是“粗心”。它看到了所有东西,并假设所有东西都是可以提及的。

2. Agent 变得“粗心”的三种方式

研究人员确定了这些 Agent 出错的三种具体方式:

  • 视觉共存(“紧邻目标”问题):
    想象你正在查看一份工作任务清单。在“完成报告”的正下方,贴着一张便签写着“联系离婚律师”。如果你要求 Agent “发送工作清单”,它可能会由于便签就在屏幕上工作任务旁边,而误将“联系离婚律师”也包含进去。
  • 任务歧义导致的过度分享(“倾倒整桶”问题):
    你说:“总结我的待办事项。”你并没有说“只总结我的工作事项”。Agent 为了表现得乐于助人,会将所有内容都倒给你,包括“给妈妈买生日礼物”和“预约牙医”,即便你当时是在和老板交谈。它不知道如何进行过滤。
  • 接收者错位(“错误的受众”问题):
    你有一份关于敏感人力资源投诉的邮件草稿。你要求 Agent “把这份草稿发给我的朋友”。Agent 发送了。但随后你要求 Agent “把这份草稿发给我的老板”。Agent 仍然 发送了它,它没有意识到对朋友可以说的内容,对老板来说却是灾难性的。

3. 实验:“AgentCIBench”

为了测试这一点,研究人员构建了一个特殊的测试场,名为 AgentCIBench

  • 他们创建了一个拥有日历、待办事项列表和即时通讯工具等应用的虚拟数字世界。
  • 他们在其中填充了混合了工作内容和私人内容的资料。
  • 他们让 15 个顶尖的 AI Agent(如 Claude、GPT、Gemini 等)在这个世界中执行任务。
  • 他们观察这些 Agent 是否会在试图完成工作时,不小心泄露私人秘密。

4. 令人震惊的结果

结果并不理想。

  • 高失败率: 在测试的 15 个 Agent 中,有 12 个在超过一半的情景中泄露了私人信息。
  • 能力 \neq 安全性: 完成任务能力最强的 Agent,往往是守不住秘密的 Agent。变得“聪明”地完成工作,并不意味着它们在“懂得”隐藏信息方面也同样聪明。
  • “拒绝”的小把戏: 一些 Agent 看起来之所以安全,是因为它们根本拒绝执行任务。如果你问它们一个棘手的问题,它们只会说“我无法做到”。但如果它们真的尝试去执行任务,就会泄露秘密。

5. 好消息:这是可以修复的

研究人员尝试了三种简单的“规则”(提示词)来教导 Agent 如何表现得更好,而无需从头开始重新训练它们:

  1. 具有约束力: “仅查看完成此任务所需的特定项目。”
  2. 使用准则: “在说话之前,问问自己:这是否有必要?这对这个人来说是否合适?”
  3. 明确接收者: “在撰写内容之前,告诉我你在和谁说话,以及哪些规则适用于他们。”

结果: 这些简单的规则将信息泄露减少了约 33% 到 36%,并且实际上让 Agent 的表现更好了(更高的效用),因为它们不再被无关的私人信息所干扰。

核心结论

论文得出结论:我们不能仅仅因为 AI Agent “擅长工作”就信任它们。我们需要专门针对上下文完整性(Contextual Integrity)来测试它们——即它们是否具备了解哪些信息属于哪种情境的能力。

目前,大多数 Agent 就像是一个热情洋溢但笨手笨脚的助手,如果你要求他们“总结你的一天”,他们会很乐意把你的私人日记读给你的老板听。在我们让他们在真实的电脑上自由活动之前,我们需要教会他们区分“工作模式”和“私人模式”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →