← 最新论文
💻 computer science

Mental Damage: Caption Poisoning Attacks on Retrieval-Augmented Text-to-Music Generation

本文介绍了“精神损伤”(Mental Damage),这是一种双层描述词投毒攻击,通过向知识数据库中注入恶意描述词,在不改变用户提示词或系统组件的情况下,微妙地引导检索增强型文本生成音乐系统生成的音乐向攻击者的目标意图偏移。

原作者: Yizhu Wen, Shuhao Zhang, Nan Zhang, Long Cheng, Hanqing Guo

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Yizhu Wen, Shuhao Zhang, Nan Zhang, Long Cheng, Hanqing Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常有才华但有点糊涂的音乐作曲家。这位作曲家非常擅长将文字转化为声音,但当你给他模糊的指令时,比如“给我做一些适合学习的宁静音乐”,他就会感到困惑。他知道“宁静”是什么感觉,但他不知道如何去构建它(例如,该使用什么乐器、节奏应该是多快、或者纹理听起来应该是怎样的)。

为了解决这个问题,系统使用了一个图书管理员(检索增强生成,即 RAG 系统)。当你要求“宁静的学习音乐”时,图书管理员会冲向一个巨大的音乐描述(标题)库,寻找最好的示例。他会抓取一些描述,比如“缓慢的钢琴、柔和的衬底音、温柔的节奏”,并将它们交给作曲家。随后,作曲家利用这些具体的细节来创作出完美的曲目。

攻击方式:“精神损伤”(Mental Damage)

论文《精神损伤》(Mental Damage)揭示了一种巧妙的方法,可以在不破坏作曲家或图书管理员的情况下欺骗这个系统。攻击者并不是直接攻击机器,而是毒化了图书馆

以下是这种攻击是如何运作的,通过一个简单的故事进行拆解:

1. 设定:被毒化的书籍

攻击者潜入图书馆,编写了一些虚假的图书描述(标题),并将它们偷偷塞到书架上。这些描述旨在看起来像是属于“宁静学习音乐”板块的,但实际上却包含了“恐怖惊悚音乐”的秘密指令。

2. 诡计:“双层”欺骗

攻击者使用了一个三步走的策略,使这种毒化既隐蔽又强大:

  • 锚点(伪装): 虚假描述以符合你请求的无害、高层级词汇开头。它会说诸如“非常适合学习”或“放松的背景音乐”之类的话。这确保了图书管理员会认为:“啊,这正是用户想要的!”并将其选中。
  • 相反的目标(反转): 攻击者选择了一个与你意图完全相反的目标(例如,将“宁静”变为“阴森恐怖”),但他们选择了一个在低层级特征上具有相似性的目标。例如,“宁静的学习音乐”和“阴森的恐怖音乐”都可能使用缓慢的节奏和深沉的回响声。这使得这种转变对系统来说不那么突兀。
  • 载荷(秘密配方): 隐藏在描述内部的是具体的、低层级的声学指令,如“空洞的回响空间”、“遥远的叮当声”或“缓慢的脉动低音”。这些才是真正指挥作曲家如何构建声音的命令。

3. 结果:无声的接管

当你要求“宁静的学习音乐”时,图书管理员因为“锚点”词汇完美匹配你的请求而检索到了那条被毒化的描述。作曲家阅读了描述,看到了“宁静”的词汇,并感到很有信心。但随后,他读到了“载荷”指令(“空洞的回响”、“遥远的叮当声”),并开始构建一段阴森且诡异的曲目。

可怕之处在于:

  • 你没有改变你的提示词。 你仍然是在要求宁静的音乐。
  • 图书管理员没有改变。 他仍然检索了他认为最匹配的内容。
  • 作曲家没有改变。 他仍然遵循了给予他的指令。

唯一改变的是图书馆的书架,即指令的来源。

研究人员的发现

研究人员在一个真实的系统上测试了这一点,该系统使用了一个包含音乐描述的数据库和一个名为 MusicGen 的音乐生成器。

  • 成功率: 当他们使用这些被毒化的描述时,计算机生成的音乐变得比之前**更加接近(两倍之多)**于攻击者的目标(恐怖音乐)。
  • 隐蔽性: 至关重要的是,音乐听起来仍然像是试图回答你的原始问题。系统并没有崩溃;它只是微妙地将情绪从“宁静学习”转向了“阴森学习”,而过程中没有任何人会察觉到其中的差异。

核心结论

这篇论文表明,在那些使用外部数据库来辅助思考的 AI 系统中,数据库本身就是一个薄弱环节。如果攻击者能将一些精心设计的“假书”混入图书馆,他们就能引导 AI 的创造力走向一个完全不同的目的地,同时让它看起来就像是在精准执行你的要求一样。

作者称之为“精神损伤”,因为他们毒化了 AI 的“心境”(上下文),导致它生成了与用户原意完全不同的内容,而用户甚至从未意识到指令被篡改了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →