← 最新论文
💬 NLP

Semantic-Preserving Prompt Hijacking: A Black-Box Adversarial Attack on Auto-Prompt Optimization

本文介绍了“语义保持型提示词劫持”(Semantic-Preserving Prompt Hijacking),这是一种利用自适应贪婪局部搜索方法(Adaptive Greedy Local Search method)来操纵自动提示词优化模块的黑盒对抗攻击,通过诱导细微的语义偏移,在保持与原始输入高度语义相似性的同时,实现输出偏差的最大化。

原作者: Chong Zhang, Xiang Li, Jia Wang, Shan Liang, Haochen Xue, Xiaobo Jin

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Chong Zhang, Xiang Li, Jia Wang, Shan Liang, Haochen Xue, Xiaobo Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在与一位非常聪明、乐于助人的助手交谈。在它回答你的问题之前,它有一个“体贴的编辑”会将你的句子重写,使其听起来更清晰、更礼貌。你在屏幕上看到了这个重写后的版本,于是你心想:“哦,这样表达真不错!”于是你让助手继续执行。

这篇名为**《语义保持型提示词劫持》(Semantic-Preserving Prompt Hijacking)**的论文揭示了一个狡猾的技巧:攻击者可以利用这个技巧来诱导这个“编辑”去修改你的问题,使得修改后的版本虽然让你察觉不到异样,却会让助手的最终回答完全陷入混乱。

以下是该原理的详细拆解,使用了简单的类比:

1. 背景设定:“体贴的编辑”

许多现代 AI 系统(如 Bing Copilot 或 Claude)都有一项功能,即它们会接收你的输入并表示:“我想你的意思应该是这样……”然后向你展示一个经过润色的版本。

  • 目标: 这旨在建立信任。它展示了 AI 正在倾听并试图提供帮助。
  • 缺陷: AI 必须从许多可能性中仅挑选出一个“最佳”版本。研究人员发现,如果你通过稍微打乱原句的词序,就可以诱导 AI 的编辑选择一个对来说看起来很正常,但实际上对 AI 来说却是陷阱的版本。

2. 攻击手段:“特洛伊木马”句子

研究人员将这种方法称为 AGLS(自适应贪婪局部搜索)。你可以把它想象成一场由顶级间谍参与的“传声筒”游戏。

  • 目标: 攻击者希望改变 AI 的答案(例如,让它给出一个错误的数学答案),但又不想过多改变句子的原意(这样用户就不会察觉到)。
  • 问题: 如果你改变了太多词,AI 的编辑就会意识到:“嘿,这看起来不像用户输入的呀!”从而拒绝执行。如果改变得太少,AI 仍会给出正确的答案。
  • 解决方案 (AGLS): 该方法将句子分解成小的块(如从句或短语)。然后,它会在每一步都玩一场**“金发姑娘与三只熊”式的平衡游戏**(即寻找“刚刚好”的过程):
    1. 它替换一个词(比如将“吃”改为“消耗”)。
    2. 它检查:“这是否仍然足够接近原始含义?”
    3. 转折点: 如果含义过于接近,它会换成一个稍微更令人困惑的词。如果含义偏离太远,它会换回一个更安全的词。
    4. 它通过这种逐步调整的方式,不断进行微调,直到找到那个对人类来说看起来很无辜,但能将 AI 引入歧途的“完美”版本。

3. 结果:“被劫持”的答案

该论文在涉及数学、阅读理解和逻辑推理的 2,400 多个不同问题上进行了测试,使用了包括 GPT-4 和 Llama 在内的流行 AI 模型。

  • 结果: “被劫持”的提示词成功诱导 AI 给出错误答案的频率,比以往任何攻击方法都要高得多
  • 隐蔽性: 由于攻击者仔细平衡了这些变化,AI 的“编辑”仍然认为它是在帮助用户,用户也认为句子读起来完全正常。但 AI 的最终答案却被彻底误导了。

4. 为什么这很重要(根据论文观点)

作者认为这是一种新型的安全漏洞。

  • 讽刺之处: 那些旨在让 AI 更具透明度(向你展示它的思考过程)的功能,实际上却创造了一种新的欺骗它的方式。
  • 规模: 它既适用于免费的开源模型,也适用于昂贵的商业模型(如 GPT-4)。
  • 防御: 论文建议,为了阻止这种情况,AI 开发者需要让他们的“编辑”变得更聪明,以便检测出这些细微的、逐步的操纵,例如通过增加随机检查,或者观察全局而非仅仅关注单个词的替换。

简而言之: 论文表明,通过在不断检查“与原意有多接近”的同时,逐一微调单词,攻击者可以劫持 AI 的“体贴编辑”,从而迫使它给出错误的答案,而用户看到的却是一个完全正常的句子。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →