← 最新论文
💻 computer science

ToolMinimize: Auditing and Rewriting LLM Agent Tool Calls to Minimize Privacy Exposure

ToolMinimize 是一个中间件系统,它通过模式感知分析和参数转换,对 LLM 智能体工具调用进行审计与重写,以剔除不必要的隐私敏感数据,在实现显著隐私降减的同时保持 100% 的任务有效性。

原作者: Wenbiao Li, Yuqiao Xu

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenbiao Li, Yuqiao Xu

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代数字化景观中,人工智能助手已从简单的聊天机器人演变为能够执行复杂任务的主动代理。当用户要求此类代理检查天气、预订机票或安排会议时,系统不仅仅是回复文本;它会向外部服务(称为“工具”)发出请求,以获取必要的信息并执行请求。这一过程涉及代理向第三方服务器发送一组特定的指令和数据。虽然这种架构实现了强大的功能,但也创造了一个隐藏的漏洞:代理发送的信息往往远超工具执行任务实际所需的量。正如一个人可能会向出租车司机讲述完整的人生故事,而对方其实只需要一个目的地地址一样,这些 AI 代理经常在请求中包含敏感的个人细节——例如医疗状况、财务状态或家庭住址——从而跨越了用户与服务提供商之间的信任边界。

凯斯西储大学的研究人员将这一现象识别为当前 AI 代理运行中的一个系统性缺陷。他们发现,在标准条件下,这些代理经常过度分享隐私数据,包括揭示用户健康状况、位置或个人习惯的细节,即使所使用的工具仅需要城市名称或日期。这种过度分享的发生是因为代理被优化为追求“有用性”,导致它们倾向于在请求中包含所有可用的上下文信息,而不论这些上下文是否安全。仅仅告诉 AI 要更加谨慎并不能解决问题;即使在用户明确指示系统最小化数据共享的情况下,代理仍然会泄露大量的敏感信息。现有的安全措施通常仅作为简单的门卫,要么允许请求,要么完全拦截请求,但它们无法编辑消息的内容。如果一个请求包含了一部分必要数据和一部分不必要的数据,那么拦截它会导致任务无法完成,而允许它则会暴露用户的隐私。

为了解决这一问题,研究团队开发了一个名为 ToolMinimize 的新系统,它作为一个精密的过滤器,位于 AI 代理与它调用的外部工具之间。该系统并非通过拦截请求或依赖 AI 自我审查来工作,而是拦截每一条消息,分析特定工具运行究竟需要哪些数据,然后重写消息以剔除除此之外的所有内容。该系统通过首先识别敏感信息(例如暗示某种诊断结果的具体医院名称或完整的街道地址),然后应用四种策略之一来保护用户。它可以完全移除不必要的字段、将具体细节泛化为更广泛的类别(例如将精确地址改为仅显示城市名称)、用通用的占位符替换敏感值,或者将数据截断至更安全的长度。至关重要的是,这种重写过程不会破坏任务;工具仍能接收到成功执行任务所需的准确信息,但用户的隐私细节却得以隐藏。

研究人员在三种主要的 AI 模型和各种现实场景中测试了这种方法,涵盖了从预约医疗门诊到搜索支持小组的广泛领域。他们的测量结果显示,在没有干预的情况下,81% 到 88% 的工具调用包含了不必要的隐私数据。即使在用户在提示词中加入了特定的隐私指令后,代理在 36% 到 76% 的案例中仍然存在过度分享行为。然而,当 ToolMinimize 系统启动时,它成功地将这些交互中的隐私成本降低了 81% 到 92%,同时保持了任务执行的完美成功率。事实证明,该系统即使在处理传统隐私工具经常遗漏的复杂数据(例如虽然不是直接标识符、但明显暗示了严重健康状况的癌症治疗中心名称)时也非常有效。通过结合对每个工具需求的深度理解以及对发送数据的仔细分析,该系统确保了只有最少必要的信息跨越了信任边界。

该系统的性能既稳健又高效。在涉及数百次工具调用的实时测试中,该中间件处理请求仅需极短的时间,对用户体验造成的延迟微乎其微。研究人员还发现,该系统可以有效地跨不同类型的软件框架工作,并且能够处理那些没有详细说明严格必要数据的工具。在系统必须猜测需求的情况下,它仍能减少近 80% 的隐私暴露。当增加一个可选层来分析自由文本字段的具体内容时,隐私风险的降低程度甚至更高,在某些情况下达到了 95% 以上。这表明,过度分享的问题并非源于用户缺乏谨慎或 AI 训练不足,而是一个结构性问题,即代理与外部服务进行通信的方式。

该研究明确排除了当前的安全性训练或简单的隐私提示足以解决这一问题的观点。数据表明,即使是最先进的模型,在不受约束的情况下仍会持续泄露敏感信息,这是由其核心目标——尽可能提供帮助所驱动的。此外,研究反对认为“拦截整个请求”是一种可行的解决方案,因为这会使代理在许多常见任务中变得毫无用处。相反,研究结果指向了一个折中方案:一个理解数据最小化细微差别的系统,能够区分什么是任务必需的,什么是仅仅作为背景信息的。通过重写工具调用的参数而非拒绝它们,这种方法在保留代理效用的同时,大幅降低了隐私暴露的风险。

最终,本文呈现的工作为保障下一代 AI 助手的安全性提供了一条切实可行的路径。它将重点从“试图训练 AI 变得不那么热心”转向“构建一个保护层,确保 AI 的热心不会以牺牲用户隐私为代价”。结果表明,只要在数据离开用户设备之前进行仔细筛选,我们完全可以拥有既具备高度能力又尊重个人边界的代理。随着这些系统日益融入日常生活,自动剥离不必要细节的能力对于在日益互联的世界中维持信任与安全至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →