← 最新论文
🤖 AI

Jailbreaking on Text-to-Video Models via Scene Splitting Strategy

本文介绍了 SceneSplit,这是一种新颖的黑盒越狱方法,它将有害叙事分解为一个个独立的良性场景,以操纵文生视频模型的生成输出空间,在多个最先进系统中实现了高攻击成功率,并揭示了其安全机制中的关键漏洞。

原作者: Wonjun Lee, Haon Park, Doehyeon Lee, Bumsub Ham, Suhyun Kim

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Wonjun Lee, Haon Park, Doehyeon Lee, Bumsub Ham, Suhyun Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在机场将一件危险物品偷偷带过安检员。如果你手持一把巨大且显而易见的剑穿过金属探测器,警报会立即响起,你也会被拦下。当前的“文生视频”AI 模型正是如此运作:它们设有安全过滤器,会扫描你的请求(提示词),并拦截任何看似可能生成有害内容(如暴力或裸露)的请求。

本文介绍了一种名为SceneSplit的巧妙技巧,用于绕过这些“安检员”。攻击者不再试图一次性将整把剑偷偷带过,而是将剑拆解成看似无害的碎片,逐一通过,然后让 AI 将这些碎片重新组装成危险物品。

以下是该方法的运作原理,分为三个简单步骤:

1. “乐高”技巧(场景拆分)

想象你想生成一段暴力打斗的视频。如果你输入“两名男子持刀打斗”,AI 的安全守卫会说:“不行,这很危险”,并予以拦截。

SceneSplit将那个危险的想法拆解成 3 到 5 个独立的微小场景,这些场景单独看完全无害:

  • 场景 1:“一名男子手持闪亮的金属物体。”(安全)
  • 场景 2:“一名女子躺在椅子上,看起来很放松。”(安全)
  • 场景 3:“镜头拉近,特写红色液体滴落在地板上。”(安全)

单独来看,这些提示词中的任何一个都不会触发警报。它们就像无害的乐高积木。然而,当 AI 被指示按顺序播放这些场景时,它会将这些点连接起来。“闪亮的物体”变成了刀,“放松的女子”变成了受害者,“红色液体”变成了血液。这种组合迫使 AI 生成原本被请求的暴力视频,尽管它在单个提示词中从未见过“打斗”或“刀”这些危险词汇。

2. “微调”(场景操纵)

有时,即使有了这些“乐高积木”,AI 仍可能感到困惑并生成安全的视频(例如,男子手持勺子而不是刀)。

为了解决这个问题,该方法使用了一个反馈循环。它会查看 AI 生成的视频,并询问:“是哪个具体场景导致 AI 产生了混淆?”如果 AI 生成了勺子而不是刀,系统会识别出场景 1 过于模糊。随后,它会要求一个智能 AI 助手仅重写那个特定场景,使其稍微更明确一些,同时保持其他场景不变。它会不断调整那个场景,直到 AI 最终生成有害视频,这实际上是在“搜寻”安全过滤器失效的确切临界点。

3. “作弊表”(策略库)

每当研究人员成功欺骗 AI 时,他们都会保存所使用的“配方”。如果他们成功地将一个关于暴力的提示词拆分成 4 个场景,并使用了某种特定的措辞方式,他们就会保存这种模式。

下次当他们想用不同的暴力提示词攻击 AI 时,他们会查看自己的“作弊表”。他们会发现:“哦,上次拆分成 4 个场景很管用”,于是立即使用相同的策略。随着系统从自身的成功中学习,这种攻击会变得越来越快、越来越有效。

他们发现了什么?

研究人员在几个主要的商业 AI 视频生成器(如 Veo2、Hailuo 和 Luma Ray2)上测试了这种“乐高技巧”。他们发现:

  • 效果非常显著: 在不同模型中,该方法成功生成有害视频的比例约为 77% 至 84%。
  • 现有防御薄弱: 当前的安全过滤器擅长识别明显的坏词,但在理解一系列看似无害的场景如何组合成危险故事方面表现极差。
  • “安全缺口”: 论文得出结论,虽然我们对单个句子拥有良好的守卫,但我们缺乏对事件序列的有效守卫。

简而言之: 该论文表明,你可以通过将一个坏主意拆解成许多看起来良好、细小的片段,让 AI 将它们拼凑起来,然后不断调整这些片段,直到坏主意呈现出来,从而欺骗视频 AI。这揭示了我们在当前保护这些 AI 系统方面存在的一个重大漏洞。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →