← 最新论文
💻 computer science

TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks

TrajShield 是一个无需训练、在推理阶段部署的防御框架,它通过模拟提示词轨迹来因果定位并最小化改写不安全内容,同时保持语义保真度,从而缓解文本到视频模型中的越狱攻击和随时间涌现的风险。

原作者: Quanchen Zou, Nizhang Li, Wenxin Zhang, Jiaye Lin, Yangchen Zeng, Xiangzheng Zhang, Zonghao Ying

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Quanchen Zou, Nizhang Li, Wenxin Zhang, Jiaye Lin, Yangchen Zeng, Xiangzheng Zhang, Zonghao Ying

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一台神奇的讲故事机器人,它能将你写下的句子转化为短片。这台机器人极其擅长让场景从一个时刻流畅地过渡到下一个时刻,宛如真正的电影。然而,存在一个问题:有时,如果你给它一个听起来无害却暗藏隐患的句子,机器人就会在讲故事时失控。它可能从两人之间的无害争执开始,为了追求故事的戏剧性和连贯性,将其升级为你从未要求过的暴力打斗。

这正是TrajShield所要解决的核心问题。

问题:讲故事的“滑坡”

这些机器人现有的安全机制就像俱乐部门口的保安。他们会检查你的门票(文本提示)中是否包含“炸弹”或“刀”等坏词。一旦发现坏词,就会阻止你进入。

但这种做法存在盲点。它无法理解随时间推移的叙事

  • 旧方法: 如果你说“两个男人在停车场争吵”,保安没看到武器,就让你进去了。
  • 机器人的错误: 机器人为了拍出好电影,心想:“好吧,争吵通常会导致推搡,而推搡会导致打斗。”于是,它生成了一段残酷打斗的视频。
  • 结果: 你要求的只是争吵,却得到了一部暴力电影。“坏”的部分并不在你的话语中,而在于机器人对故事应当如何展开的想象。

解决方案:TrajShield(“剧本编辑”)

这篇论文的作者创建了TrajShield,这是一种新的安全系统,它不仅仅检查门票,更像是一位剧本编辑,在电影开拍前阅读故事。

以下是它的工作原理,通过一个简单的三步流程实现:

1. 拆解故事(运动 - 语义解耦)

想象机器人的提示语是一团纠缠的毛线球。TrajShield 将其解构成三个 distinct 的部分:

  • 场景(静态): 谁在那里?他们在哪里?看起来怎么样?(例如:“两个男人,一个停车场,夜晚。”)
  • 情节(动态): 接下来会发生什么?(例如:“他们争吵,然后……")
  • 目标(意图): 用户实际上想展示什么?(例如:“一个紧张的场景。”)

通过将场景动作分离,系统确保在修正故事时,不会意外改变人物或地点。它只修改情节。

2. 模拟未来(时间风险传播)

在机器人实际制作视频之前,TrajShield 会运行一次“思维模拟”。它会问:“如果我从这场争吵开始,接下来最可能出现的场景是什么?再之后呢?”

它会构建故事未来的“风险地图”,寻找故事开始滑向危险的确切时刻。

  • 示例: 它看到“争吵” \rightarrow “吼叫” \rightarrow “推搡”是一条危险的路径。
  • 它识别出触发点:故事从“安全”转向“不安全”的确切时刻(例如,吼叫转变为推搡的那一刻)。

3. 最小化重写(时间一致的安全重写)

一旦找到触发点,TrajShield 就会对故事进行“手术”。它不会删除整部电影,而是只重写情节中危险的部分,将其引回安全方向,同时保持其他一切完全不变。

  • 原始危险路径: 争吵 \rightarrow 吼叫 \rightarrow 打斗(不安全!)
  • TrajShield 的重写: 争吵 \rightarrow 吼叫 \rightarrow 愤怒地离去(安全!)

结果是一部视频,它仍然感觉像是用户的原始构思(紧张、戏剧性、停车场里的两个男人),但在变得暴力之前停了下来。“故事”自然地流动,只是朝着安全的方向。

为什么这很重要

该论文在 14 种不同的安全风险(如暴力、非法行为或令人不安的内容)以及 6 种不同的视频生成模型上测试了这一系统。

  • 结果: 与以往的方法相比,TrajShield 阻止了约**52%**更多的不安全视频。
  • 质量: 关键在于,它没有破坏好的视频。当输入安全的提示时,生成的视频看起来仍然完全符合用户的期望。它没有把和平的场景变得无聊;它只是阻止了滑向危险的“滑坡”。

总结

TrajShield想象成一张安全网,它在故事跌下悬崖之前将其接住。它不仅仅是禁止某些词汇,而是理解故事具有方向性。它观察故事在机器人脑海中的展开,发现故事即将脱轨的时刻,并温和地将其引回安全路径,同时不改变场景或人物。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →