← 最新论文
💻 computer science

Video Deepfake Abuse: How Company Choices Predictably Shape Misuse Patterns

本文认为,在缺乏充分保障措施的情况下发布基于未筛选网络数据训练的开权重视频生成模型,再加之平台监管不足,可预见地推动了非自愿亲密图像和儿童性虐待材料的泛滥,因此开发者和分发者必须采取主动风险管理以减轻这些危害。

原作者: Max Kamachee, Stephen Casper, Michelle L. Ding, Rui-Jie Yew, Anka Reuel, Stella Biderman, Dylan Hadfield-Menell

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Max Kamachee, Stephen Casper, Michelle L. Ding, Rui-Jie Yew, Anka Reuel, Stella Biderman, Dylan Hadfield-Menell

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对这篇论文的解读。

宏观图景:“开源”的双刃剑

想象这样一个世界:任何人都能制造一台高性能的 3D 打印机。2022 年,AI 图像生成器(如 Stable Diffusion)就发生了这种情况。突然间,人们可以创造出任何他们想象出来的极其逼真的照片。

这对艺术家和创作者来说是一件好事。但是,就像 3D 打印机既能制造玩具也能制造武器一样,这些 AI 工具很快就被用来制作非自愿亲密影像(NCII)——即把真人(包括儿童)置于尴尬境地的虚假照片。

这篇论文认为,同样的事情正在 2025 年当下的AI 视频生成器领域重演。我们正跨越一个门槛:制作虚假且逼真的视频变得容易、廉价,且几乎对任何人都触手可及。

主要问题:“食谱”与“厨师”

论文使用了一个供应链类比(图 1)来解释这些糟糕的视频是如何被制作出来的。不妨将其想象成一个烹饪生态系统:

  1. 开发者(厨师): 大公司(如阿里巴巴、Stability AI 等)创建基础的“食谱”(即 AI 模型)。
  2. 分发平台(食品储藏室):CivitaiHugging Face 这样的网站是人们下载这些食谱的地方。
  3. 修改者(家庭厨师): 成千上万的人下载基础食谱,对其进行微调,并加入自己的“香料”(微调),使其在特定方面(例如制作 NSFW(不适宜工作场所)内容)表现更好。
  4. 用户(食客): 数百万人下载这些经过微调的食谱来制作最终的视频。

论文的核心发现:
论文发现,少数几个“食谱”(模型) 导致了绝大多数此类糟糕视频的产生。具体而言,像 Wan 2.xStable Video DiffusionHunyuanVideoLTX-Video 这样的模型被不成比例地用于制作虚假色情和虐待材料。

为什么会发生这种情况?(2022 年的教训)

论文回顾了 2022 年,以解释为何现在会发生这种情况。

  • “坏”食谱: 2022 年,一家公司发布了一个名为 Stable Diffusion 1.0 的模型。他们免费提供了“权重”(代码),但没有很好地过滤训练数据。这就像是用一本包含毒药食谱的烹饪书来教导厨师。由于数据杂乱无章,AI 很容易学会了制作糟糕的东西。
  • “好”食谱: 后来,同一家公司发布了 Stable Diffusion 2.0。他们清理了这本烹饪书,去除了“毒药”食谱。结果呢?AI 在制作 NSFW 内容方面变得非常糟糕。社区实际上抱怨它“审查过度”。
  • 教训: 当开发者在发布模型之前清理数据并添加安全过滤器时,这就为制作不良内容设置了巨大的障碍。当他们不这样做时,糟糕的东西就会像野火一样蔓延。

当前局势:“猫已经出袋了”?

有些人争辩说:“好吧,糟糕的模型已经在那里了。太晚了。即使我们现在制作安全的模型,人们也会继续使用那些旧的糟糕模型。”

论文表示这是错误的。他们使用了一个盗版类比

  • 想想非法电影下载。虽然盗版电影在技术上是可以获取的,但搜索引擎和各大公司都在努力让它们更难被发现。这并不能阻止所有人,但它能阻止那些不想深入挖掘的普通用户和青少年。
  • 同样,如果开发者和平台让查找和使用糟糕的 AI 模型变得更加困难,那么造成的总伤害量就会显著下降。关键在于提高作恶所需的“摩擦”(即所需的努力)。

解决方案是什么?

论文建议两个主要群体需要挺身而出:

1. 开发者(厨师)
他们需要停止发布“裸奔”的模型。相反,他们应该:

  • 清理数据: 确保 AI 从一开始就没有在色情或虐待材料上进行训练。
  • 添加安全网: 使用“遗忘”技术,使 AI 忘记如何制作糟糕的东西,即使有人试图稍后对其进行微调。
  • 自我测试: 在发布模型之前尝试破解自己的模型,看看它们是否会被滥用。
  • 保持透明: 向公众确切说明他们采取了哪些安全措施。目前,大多数公司对此保持沉默(参见论文中的表 1)。

2. 分发平台(食品储藏室)
像 Civitai 和 Hugging Face 这样的网站是守门人。

  • 它们目前托管着数千个专门用于制作虚假色情和儿童虐待材料的模型。
  • 论文认为,这些平台必须主动监管它们的“货架”。如果它们不移除这些特定的“坏食谱”,它们就是在放大伤害。

结论

论文得出结论:公司的选择至关重要

  • 如果开发者发布没有安全过滤器的模型,他们就是在可预见地造成伤害。
  • 如果平台不移除旨在用于滥用的模型,他们就是在使问题恶化。

这并非关于禁止 AI。这是关于风险管理。就像我们不会因为有些人危险驾驶就禁止汽车一样,我们也不需要禁止 AI 视频。但是,我们确实需要安装刹车、安全带和限速器(保障措施),以防止最坏的结果。如果公司现在采取这些步骤,他们可以在未来大幅减少虚假和虐待内容的数量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →