← 最新论文
💬 NLP

Detecting AI-Generated Content on Social Media with Multi-modal Language Models

本文提出了一种鲁棒的多模态视觉-语言模型流水线,该流水线通过利用多样化的社交媒体数据来克服现有人工智能生成内容检测器的泛化与可解释性局限,从而实现了最先进的性能和积极的现实世界用户参与影响。

原作者: Chenyang Yang, Shen Yan, Yibo Yang, Litao Hu, Yuchen Liu, Yuan Zeng, Hanchao Yu, Yinan Zhu, Sumedha Singla, Brian Vanover, Huijun Qian, Zihao Wang, Fujun Liu, Aashu Singh, Jianyu Wang, Xuewen Zhang

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenyang Yang, Shen Yan, Yibo Yang, Litao Hu, Yuchen Liu, Yuan Zeng, Hanchao Yu, Yinan Zhu, Sumedha Singla, Brian Vanover, Huijun Qian, Zihao Wang, Fujun Liu, Aashu Singh, Jianyu Wang, Xuewen Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将社交媒体想象成一个巨大、繁忙的数字城镇广场。最近,出现了一种新型的“魔术技巧”:人们可以使用人工智能(AI)来创造看起来如此真实、以至于与现实无法区分的照片和视频。虽然这对于艺术创作很酷,但坏人正利用它来传播谎言、诈骗和垃圾信息,欺骗人们相信从未发生过的事情。

这篇论文的作者们——来自 Meta 和卡内基梅隆大学的研究人员——构建了一个新的“数字侦探”来解决这个问题。以下是他们如何实现的简单解释:

旧侦探的问题

在此前的工具出现之前,那些用于识别 AI 生成内容的“侦探”存在三个主要缺陷:

  1. 学习缓慢: 它们是在旧照片上训练出来的。一旦出现了新的 AI 生成器(就像出现了一个新的魔术棒),旧的侦探就无法识别出新的把戏。
  2. 只有一只眼睛: 它们只观察图片本身,忽略了周围的文本、评论或语境。这就像试图通过只看一个指纹来破解谜题,却忽略了嫌疑人的陈述。
  3. 沉默寡言: 如果它们抓到了假货,只会说“假的!”,而不解释为什么。这让人们很难信任它们,或者难以理解其中的错误。

新型侦探:IFM-AIGCSPOTTER-3B

团队构建了一个名为 IFM-AIGCSPOTTER-3B 的新侦探。把它想象成一个聪明的、多感官的调查员,可以同时观察、阅读和推理。

1. 训练营(数据策展)
为了训练这个侦探,他们没有仅仅使用一本静态的教科书。他们建立了一个持续的“训练营”,不断从社交媒体中收集真实的和虚假的帖子示例。

  • 第一阶段(学习观察): 他们教会模型详细描述图像,就像孩子学习命名物体一样。
  • 第二阶段(学习语境): 他们教会它理解标签(Hashtags)、关键词以及帖子的“氛围”。
  • 第三阶段(实战测试): 他们向它展示了数千个 AI 生成内容的案例,专门教它如何识别 AI 经常留下的细微“瑕疵”或“恐怖谷”效应。

2. 侦探的工具箱(模型)
他们没有构建一个庞大、缓慢的超级计算机,而是构建了一个“紧凑型”模型。想象一个身材精干、敏捷且极其敏锐的侦探。

  • 它使用一个 视觉编码器(它的眼睛)来观察图像和视频。
  • 它使用一个 语言模型(它的大脑)来阅读文本并理解故事。
  • 至关重要的是,他们教会它有时要忽略文本。在训练期间,他们会 90% 的时间隐藏文本。这迫使侦探学会仅凭视觉线索来识别假货,这样即使有人在假图片上写着“这是真的!”,它也不会被骗。

3. 超能力:解释“为什么”
与旧的沉默侦探不同,这个侦探会说话。当它标记一个帖子为假时,它会写一份报告来解释其推理过程。

  • 示例: “这看起来是假的,因为狗站在银行柜台上(行为不符合常理)、手部看起来像融化的塑料(视觉伪影),且标牌上的文字是乱码(AI 瑕疵)。”

效果如何?

研究人员通过两种方式对他们的侦探进行了测试:

  • 模拟考试(公开基准测试): 他们使用其他研究人员使用的标准数据集对其进行了测试。他们的侦探得分高于几乎所有人,证明它非常擅长识别假货,甚至是那些它从未见过的假货。
  • 现实工作(内部社交媒体数据): 他们在来自 Facebook、Instagram 和 Threads 的实际帖子中测试了它。它在所有平台上都表现得非常可靠。
  • “实战”测试(部署): 他们实际上将这个侦探投入到了真实用户的使用中。他们利用它来过滤新用户的生成内容。结果如何?用户在应用上的停留时间更长,参与度更高。这证明了移除不良 AI 内容实际上让人们的社交媒体体验变得更好。

局限性(不足之处)

作者坦诚地说明了这位侦探的弱点:

  • 它是反应性的: 如果明天出现了一个全新的、超先进的 AI 生成器,侦探可能会在看到足够多的例子并学会新把戏之前,反应稍慢。
  • 它并不完美: 有时,如果一张假图像只是巨大真实照片中的极小部分,侦探可能会漏掉它。
  • 它会产生幻觉: 有时,侦探可能会编造一个理由来解释为什么某物是假的(比如在纹理其实很正常的情况下,说纹理看起来“不自然”),尽管这种情况很少发生。

核心结论

这篇论文表明,我们可以构建一个智能、可解释的系统,通过不断从混乱、真实的社交媒体世界中学习,来捕捉 AI 伪造内容。这不仅仅是一个实验室实验;它在现实世界中行之有效,帮助为每个人提供更安全、更值得信赖的社交媒体环境。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →