← 最新论文
💻 computer science

BusterX++: Towards Unified Cross-Modal AI-Generated Content Detection and Explanation with MLLM

本文介绍了 BusterX++,一种用于检测并解释 AI 生成图像与视频的统一多模态大语言模型(MLLM),以及配套的 GenBuster-Bench++ 基准测试,并证明了单阶段纯强化学习策略通过保持策略熵,能够实现自发的跨模态能力迁移,从而优于传统的 SFT+RL 方法。

原作者: Haiquan Wen, Tianxiao Li, Zhenglin Huang, Yiwei He, Guangliang Cheng

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Haiquan Wen, Tianxiao Li, Zhenglin Huang, Yiwei He, Guangliang Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观: “数字侦探”难题

想象一下,互联网是一个巨大的图书馆。最近,一种新型的图书管理员(生成式人工智能)开始创作书籍、照片和电影,它们看起来如此逼真,以至于你无法将它们与真实的区分开来。这是危险的,因为人们可以利用这些虚假视觉内容来传播谎言(误导信息)。

长期以来,我们一直拥有“侦探”(AI 模型)来识别伪造品,但它们就像是只盯着一种证据类型的专家:

  • 有些侦探只看照片
  • 另一些侦探只看视频

这篇论文的作者提出了一个问题:如果我们有一个超级侦探,能够同时观察照片和视频,并利用来自一者的线索来破解另一者的谜团,情况会怎样?

他们打造了这个名为 BusterX++ 的侦探,并同时构建了一个全新的、极其严格的“训练场”(基准测试)来测试它。


1. 全新的训练场:“GenBuster-Bench++”

要训练一名侦探,你需要练习案例。但旧的练习案例很混乱:

  • 有些太简单了(比如识别一张模糊的卡通图)。
  • 有些只有照片,有些只有视频。
  • 那些“伪造品”并不够逼真。

作者创建了 GenBuster-Bench++。你可以把它想象成一个为 AI 设计的高风险密室逃脱

  • 平衡性: 它拥有数量相等的棘手照片和棘手视频。
  • 真实性: 这些虚假图像和视频是由目前市面上最先进、最强大的 AI 工具制作的。
  • 人工过滤: 在 AI 接触这些内容之前,人类专家对每一项内容都进行了检查。他们只保留了那些足以骗过 5 名人类专家中的 3 名的“伪造品”。如果某个伪造品过于明显,就会被剔除。

这确保了侦探不仅仅是在死记硬背简单的技巧,而是在学习识别那些细微的、现实世界的差异。


2. 秘诀所在:跳过“教科书”(为什么他们跳过了 SFT)

通常,当你教 AI 变得聪明时,你会遵循两个步骤:

  1. 第一步(SFT - 有监督微调): 你给 AI 一本教科书。你向它展示 1 万个例子,并说明“这是一张假照片,原因如下”。你强迫它背诵这些解释。
  2. 第二步(RL - 强化学习): 你让 AI 自行练习,当它答对时,给予它一个“小星星”(奖励)。

作者的重要发现:
他们发现第一步(教科书)实际上损害了 AI 的能力。

  • 类比: 想象你在教一名棋手。
    • 教科书方法 (SFT): 你强迫棋手背诵 1 万种特定的开局走法以及它们奏效的确切原因。这会让棋手变得僵化。由于害怕偏离书本,他们停止了创造性思考。
    • 纯练习方法 (Pure RL): 你只是把棋手放入一场锦标赛。你不告诉他们如何下棋,你只是说,“如果你赢了,你就得一分。” 棋手可以自由地探索那些他们在书里从未见过的奇特、有创意的策略。

结果:
“纯练习”AI(BusterX++)成为了更好的侦探。因为它没有被强迫去背诵特定的解释,它保持了它的“探索自由”(高熵)。它学会了通过观察细微的线索来自行寻找答案,而不是仅仅重复被告知的内容。


3. 超能力:跨模态协同作用

由于 BusterX++ 在训练过程中同时处理照片和视频,且没有被强迫进入僵化的教科书模式,它发展出了一种独特的超能力:跨模态迁移(Cross-Modal Transfer)

这可以想象成一名侦探学习了两种相互辅助的不同技能:

  • 视频帮助照片: 视频具有动态。通过观察视频,你会学习光影是如何移动以及物体是如何变化的。BusterX++ 利用这种“运动知识”来观察一张静态照片,并意识到:“等等,这个人脸上的阴影与背景的光照不匹配。在真实的照片中,情况会不同。”
  • 照片帮助视频: 高分辨率照片拥有极其锐利的细节(如皮肤或织物的纹理)。BusterX++ 利用这种“锐利细节知识”来观察视频,从而捕捉到普通视频检测器可能会忽略的微小运动瑕疵。

论文的观点:
通过同时进行训练,AI 不仅仅在两方面都变得更强,它还变得擅长于将从一处学到的知识迁移到另一处。它意识到,“现实的规则”同时适用于静态和动态。


4. 结果:谁赢得了比赛?

作者将 BusterX++ 与以下对象进行了对比测试:

  • 其他顶尖的 AI 模型(如 GPT-4o、Claude 以及其他专门的检测器)。
  • 他们自己开发的另一个使用了“教科书”方法(SFT + RL)的版本。

最终结果:

  • BusterX++ (Pure RL) 胜出了。它在识别图像和视频中的伪造品方面准确率最高。
  • 它还提供了更好的解释。当它说“这是伪造的”时,它能指出具体的、细微的线索(如奇怪的阴影或模糊的手部),这些线索与人类专家的观察一致。
  • “教科书”版本(SFT + RL)表现不错,但经常会被那些表面看起来“真实”但存在细微缺陷的东西所欺骗。

总结

该论文认为,要构建最好的 AI 侦探来识别伪造媒体:

  1. 不要强迫它先死记硬背一本关于“伪造解释”的教科书。
  2. 相反,让它通过实践来学习,只在它得到正确答案时给予奖励。
  3. 将它同时在照片和视频上进行训练,以便它可以利用来自一者的线索来解决另一者的谜团。

这种方法创造了 BusterX++,一个统一的 AI,它是目前在识别并解释 AI 生成的图片和电影方面的佼佼者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →