← 最新论文
🤖 machine learning

YTClickbait21K: Human-Annotated Multimodal Dataset for YouTube Clickbait Detection Across Diverse Channels and Content Categories

本文介绍了 YTClickbait21K,这是一个大规模、经人工标注的多模态数据集,包含超过 21,000 个经过严格标记并具有多样化元数据的 YouTube 视频,旨在推进自动化标题党检测和内容审核研究。

原作者: Md. Minhazul Islam, Md. Tanbeer Jubaer, Amith Khandakar, Shovon Sarker, Sumaiya Rahman, Md. Masum Mia, Mohamed Arselene Ayari, Hamed Noori

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Md. Minhazul Islam, Md. Tanbeer Jubaer, Amith Khandakar, Shovon Sarker, Sumaiya Rahman, Md. Masum Mia, Mohamed Arselene Ayari, Hamed Noori

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个规模宏大、熙熙攘攘的集市。在这个集市里,有成千上万个视频摊位(YouTube 频道),售卖着从烹饪技巧到游戏精彩瞬间的一切内容。但是,就像在任何拥挤的集市中一样,有些摊主会使用华丽且具有误导性的招牌来诱骗你停下脚步。他们可能会大喊:“你绝对不会相信接下来会发生什么!”或者展示一张巨型汉堡的照片,而实际视频讲的却是一个小三明治。这就是点击诱饵(Clickbait)

虽然我们已经非常擅长识别文本中的这些诡计(比如假新闻标题),但要识别视频中的点击诱饵却要困难得多,因为这涉及到文字和图像的结合。直到现在,研究人员还没有一个足够大的“培训学校”来有效地教计算机如何识别这些视频诡计。

这篇论文介绍了 YTClickbait21K,这是一个旨在解决这一问题的庞大新工具。以下是他们工作的简单拆解:

1. “巨大的视频图书馆”

把这个数据集想象成一个包含 21,238 个视频 的巨大图书馆。

  • 他们从哪里获取的? 他们并没有随机挑选视频。他们仔细选择了来自 29 个不同国家的 40 个不同的“摊位”(频道)。这些频道涵盖了从严肃新闻、纪录片到趣味娱乐、游戏和教育等各种内容。
  • 盒子里有什么? 对于每一个视频,他们都保存了标题、描述、观看次数/点赞数以及缩略图(你在点击之前看到的那个小图)。他们没有下载实际的视频文件(为了节省空间),但保留了链接,以便研究人员日后查看。

2. “人类陪审团”系统

你不能直接问计算机某个视频是否属于点击诱饵;它首先需要向人类学习。为了确保标签的准确性,研究人员并没有只依赖一个人。

  • 流程: 他们雇佣了 15 个不同的人(标注员)充当陪审团。
  • 规则: 每一个视频都会由 三名不同的人 独立观察。他们在判断过程中不能互相交流。
  • 评分表: 每个人都有一个必须遵守的具体清单。他们会问类似这样的问题:
    • 标题是否通过制造好奇心来撒谎?
    • 缩略图是否展示了视频中实际并不存在的内容?
    • 整体是否存在承诺与交付内容之间的不匹配?
  • 判决: 如果至少有两人认为该视频是点击诱饵,它就会被贴上“点击诱饵”的标签。如果他们意见不一,系统将使用投票法来决定最终答案。

3. 为什么这个图书馆很特别

作者解释说,以往构建此类库的尝试都存在一些缺陷:

  • 规模太小: 有些库只有几百个视频,这不足以教会一台聪明的计算机。
  • 过于侧重文本: 许多研究只关注文字,忽略了图片(缩则略图),而图片是识别视频点击诱饵的重要线索。
  • 标注过于草率: 有些研究使用计算机来猜测标签,而不是使用真实的人类。
  • YTClickbait21K 通过其规模巨大(超过 21,000 个视频)、多模态(文字 + 图片)以及经过严格的人类校验解决了这些问题。

4. 人类达成共识了吗?

研究人员想要了解人类的判断是否在同一水平线上。他们运行了一个统计测试(称为 Cohen's Kappa),这就像是一个“一致性得分”。

  • 结果: 得分约为 0.65。在人类判断领域,这被认为是“显著的一致性”。这意味着,虽然点击诱饵可能具有误导性和主观性(就像判断一个笑话是否有趣一样),但人类在判断什么是误导性内容、什么不是方面,总体上是一致的。
  • 信心: 人类对自己的选择也非常确定,大多数时候给出了很高的信心得分(接近 5 分满分)。

5. 人们可以用它做什么?

论文指出,该数据集现在是一个公开的“基准(benchmark)”。

  • 对于研究人员: 它是一个标准测试集。如果一位计算机科学家开发了一种新的用于检测点击诱饵的 AI,他们可以将该 AI 在这个数据集上进行测试,以观察其表现如何以及与其他模型相比的效果。
  • 对于开发者: 它有助于构建更好的工具,用于在平台上自动标记误导性视频。

总结

简而言之,作者构建了一本庞大且高质量的计算机训练手册。他们收集了数千个真实的 YouTube 视频,让团队根据严格的规则对它们进行仔细标注,并将整个集合免费开放。这使得研究人员终于能够教计算机如何利用文字和图片,来识别真实视频与误导性视频之间的区别。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →