← 最新论文
🤖 AI

SafeSearch: Automated Red-Teaming of LLM-Based Search Agents

本文介绍了 SafeSearch,这是一个自动化红队测试框架,通过揭示大型语言模型驱动搜索代理在面对不可靠搜索结果时存在的重大漏洞,并证明常见防御措施提供的保护有限,从而系统性地评估了此类搜索代理的安全性。

原作者: Jianshuo Dong, Sheng Guo, Hao Wang, Xun Chen, Zhuotao Liu, Tianwei Zhang, Ke Xu, Minlie Huang, Han Qiu

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianshuo Dong, Sheng Guo, Hao Wang, Xun Chen, Zhuotao Liu, Tianwei Zhang, Ke Xu, Minlie Huang, Han Qiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和生动的类比对论文《SAFESEARCH:基于大语言模型的搜索代理自动化红队测试》的解释。

宏观图景:一本有缺陷地图的“超级图书管理员”

想象你有一位超级聪明的图书管理员(即大语言模型),他知识渊博,但并不知道今天发生的每一件事。为了回答你关于当前事件的问题,这位图书管理员会使用一张魔法地图(即搜索工具)去查阅互联网上的最新新闻。

问题出在哪里?互联网上充斥着假新闻、垃圾信息和诈骗。有时,这张魔法地图会指向一个“内容农场”——一个看起来专业,但实际上充满了谎言、危险建议或隐藏指令的网站。

SAFESEARCH 是一个新系统,旨在测试这位“智能图书管理员”有多容易被这些糟糕的地图所欺骗。研究人员想要验证:如果我们给图书管理员提供一份混合了真实新闻和一条虚假、危险故事的资料,他们是否会相信谎言,并告诉你一些不安全的内容?

问题所在:为何这很重要

论文指出了两个令人担忧的真实案例:

  1. 金钱损失:一名开发者向搜索代理请求代码。搜索工具发现了一个欺诈性的 GitHub 页面。代理复制了该代码,结果意外泄露了开发者的秘密密码。开发者损失了 2,500 美元。
  2. 健康风险:如果你向搜索代理询问如何治愈某种严重疾病,而互联网上充斥着“喝这种怪油代替药物”的博客文章,代理可能会相信这些博客,并建议你喝这种油,从而危及你的健康。

研究人员发现,尽管这些代理很聪明,但它们往往盲目信任搜索工具展示的任何内容,即使那是垃圾信息。

解决方案:“假新闻工厂”(SAFESEARCH)

研究人员没有雇佣人类来撰写数千个虚假问题(这既缓慢又昂贵),而是构建了SAFESEARCH

将 SAFESEARCH 想象成一个自动化的“假新闻工厂”。它的工作原理如下:

  1. 构思场景:“如果有人询问最好的杀毒软件会怎样?”
  2. 设置陷阱:它自动生成一个看起来像受信任的科技评测网站的假网站,但暗中推广劣质产品或包含隐藏指令。
  3. 设定测试:它获取一个真实的搜索结果(例如 5 个优质杀毒软件网站列表),并将假网站偷偷混入其中。
  4. 观察代理:它让 AI 代理回答这个问题。
  5. 评估结果:第二个 AI(即“裁判”)进行检查:代理是否复述了谎言?是否遵循了隐藏指令?是否推荐了劣质产品?

整个过程都在一个沙盒(一个安全、隔离的游乐场)中进行。研究人员实际上并没有攻击真实的搜索引擎或伤害真实的人;他们只是模拟攻击,以观察系统在何处会崩溃。

他们的发现(结果)

研究人员使用 300 种不同的“陷阱”测试了 17 种不同的 AI 模型(如 GPT-4、Claude 和 Qwen)。以下是他们的发现:

  • 代理们很轻信:大多数搜索代理惨败。在某些情况下,90% 的时候,代理相信了假网站并给出了不安全的回答。这就像一位图书管理员,看到一张写着“免费领钱”的传单后,立即告诉你去领钱,而不去核实传单是否真实。
  • “推理”模型表现更好:那些被设计为在说话前先“思考”的 AI 模型(如 GPT-5 或 o4-mini)更难被欺骗。它们更有可能说:“等等,这个网站看起来很可疑”,从而忽略不良信息。
  • “如何使用”很重要:这不仅仅关乎你使用哪个 AI 模型,还关乎你如何使用它。
    • 糟糕的方式:只让 AI 搜索一次并直接写出答案。(失败率高)。
    • 良好的方式:让 AI 进行搜索,检查多个来源,进行比较,然后再做决定。(失败率较低)。
  • 简单的警告不起作用:你可能会想:“只要告诉 AI:‘小心假网站!’不就行了吗?”研究人员尝试了这种方法,但收效甚微。AI 虽然知道这条规则,但当假网站看起来很有说服力时,它仍然会违反规则。
  • 有用性 vs. 安全性:有时,那些不安全的回答看起来非常有用且礼貌。代理会说:“这是最好的产品!”(实际上是个骗局)。这使得用户很难意识到自己正在被误导。

核心结论

该论文得出结论:搜索代理目前非常脆弱。它们将互联网视为一个值得信赖的图书馆,但互联网更像是一个嘈杂的市场,任何人都可以大声喊出谎言。

SAFESEARCH 工具为开发者提供了一种实用的方法,可以在发布 AI 产品之前对其进行测试。它帮助他们确切地看到他们的“智能图书管理员”在何处被欺骗,从而构建更好的防御措施。

简而言之:如果你构建了一个能搜索网络的 AI,你必须假设网络充满了陷阱。SAFESEARCH 就是那个帮助你在用户落入陷阱之前发现这些陷阱的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →