← 最新论文
💻 computer science

How Do Data Owners Say No? A Case Study of Data Consent Mechanisms in Web-Scraped Vision-Language AI Training Datasets

该研究通过分析 DataComp 数据集,揭示了大量网络图像样本存在版权标识、水印或网站条款明确禁止抓取,但当前 AI 数据收集流程未能充分尊重这些数据所有者的意愿,从而凸显了建立统一数据同意框架的紧迫性。

原作者: Chung Peng Lee, Rachel Hong, Harry H. Jiang, Aster Plotnik, William Agnew, Jamie Morgenstern

发布于 2026-04-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Chung Peng Lee, Rachel Hong, Harry H. Jiang, Aster Plotnik, William Agnew, Jamie Morgenstern

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一次对AI 训练数据“黑箱”的侦探调查

想象一下,现在的 AI(比如能画图的 Stable Diffusion 或 Midjourney)就像是一个超级贪吃的美食家。为了学会画画,它需要吃掉互联网上数以亿计的“图片大餐”。这篇论文的作者们就是去检查这些“大餐”的来源是否合法,以及厨师(数据收集者)有没有问过食材主人(图片作者):“我可以拿你的菜去喂我的 AI 吗?”

以下是用通俗语言和比喻对这篇论文的解读:

1. 核心问题:AI 是在“偷吃”吗?

现在的 AI 模型大多是通过“网络爬虫”从互联网上抓取海量图片来训练的。

  • 现状:就像有人把超市里所有货架上的商品都搬走,不管老板同不同意,直接拿去煮大锅饭。
  • 争议:很多图片作者(画家、摄影师)觉得这侵犯了他们的版权。最近有很多官司(比如 Getty Images 告 Stability AI),就是在这个问题上打起来的。
  • 论文目的:作者们想搞清楚,在那些被用来训练 AI 的庞大数据库(比如 DataComp 的 CommonPool,里面有 128 亿张图)里,到底有多少图片的主人其实并不愿意被这样使用?

2. 他们是怎么查的?(三个侦探手段)

作者们没有直接去问每个人,而是像侦探一样,通过三个线索来寻找“拒绝信号”:

  • 线索一:看“标签”和“水印” (样本级检查)

    • 比喻:就像检查食材包装上有没有贴“版权所有”的标签,或者有没有画着作者的签名水印。
    • 发现:他们发现至少有 1.22 亿 张图片上贴着明显的“版权标签”(比如文字里的"©",或者图片文件里的版权信息)。这意味着这些图片的主人明确说过“这是我的”,但 AI 还是把它们吃掉了。
    • 难点:很多水印藏得很深,或者被 AI 识别错了。就像有些水印画得很隐蔽,或者被误认为是普通的文字,导致现有的检测工具经常“漏网”。
  • 线索二:看“网站规则” (域名级检查)

    • 比喻:就像检查食材来源的“超市”门口有没有挂牌子。
    • 发现:他们检查了前 50 大来源网站(比如 Pinterest 等)的服务条款 (ToS)。结果惊人:60% 的热门网站在条款里明确写了“禁止爬虫抓取”或者“禁止用于 AI 训练”。
    • 讽刺:虽然网站门口挂着“禁止入内”的牌子,但 AI 训练的数据集还是把这些“违禁品”打包卖给了大家。
  • 线索三:看“门卫指令” (Robots.txt)

    • 比喻:网站都有一个叫 robots.txt 的“门卫指令单”,告诉机器人(爬虫)哪些地方能进,哪些不能进。
    • 发现:很多网站专门在指令单里写了:“禁止 AI 机器人(如 GPTBot)进入”。但是,当 AI 公司去抓取数据时,他们往往不遵守这个指令,或者通过其他方式绕过了门卫。

3. 发现了什么大问题?(三大痛点)

A. “只给菜单,不给菜”的狡猾做法

  • 比喻:数据集发布者(Curator)只给了你一张菜单(图片的链接和文字描述),而不直接给你图片文件
  • 问题:当你拿着菜单去下载图片时,你实际上是在自己去爬取网站。
  • 后果:发布者可以说:“我只是给了你菜单,没让你去偷菜,是你自己爬的,责任在你(用户)。”这种“甩锅”行为让数据收集变得不透明,也规避了版权责任。

B. “信号太乱,没人听得懂”

  • 比喻:想象一下,有的厨师说“别吃这个”,有的厨师在盘子上画个叉,有的厨师在菜单上写小字。
  • 问题:图片主人表达“不同意”的方式太五花八门了(有的靠水印,有的靠网站条款,有的靠文件元数据)。目前的 AI 收集系统就像个聋子,听不到这些分散的信号,导致很多拒绝信号被忽略。

C. “时间差”的陷阱

  • 比喻:网站主人在 2023 年把菜放进了仓库(被 CommonCrawl 抓取),但在 2024 年挂上了“禁止 AI 使用”的牌子。
  • 问题:AI 数据集可能还在用 2023 年的旧数据,完全不知道主人后来改了主意。这种“时差”让很多原本同意的数据,后来变成了“被偷”的数据。

4. 作者的建议:我们需要一个新的“通用语言”

这篇论文最后呼吁,我们需要建立一个统一的“数据同意框架”

  1. 不要甩锅:数据集发布者应该直接提供图片,并负责检查版权,而不是只给链接让用户自己去冒险。
  2. 统一信号:就像交通灯一样(红灯停,绿灯行),我们需要一个全球通用的标准,让图片主人能清晰地表达“同意”或“拒绝”,让 AI 公司一眼就能看懂。
  3. 从“默认同意”变成“默认拒绝”:目前很多是“你不说不行,我就默认行”(Opt-out)。作者建议应该反过来,除非你明确说“可以”,否则就是“不可以”(Opt-in),这样才能真正尊重创作者。

总结

这篇论文告诉我们:现在的 AI 训练数据收集方式,就像是在一个没有统一规则的集市里,大家随意拿取别人的东西。 虽然技术很先进,但伦理和法律规则没跟上。如果不解决这些“谁同意、谁拒绝”的问题,AI 的发展可能会因为版权官司和道德争议而停摆。

一句话总结:AI 想学会画画,不能光靠“偷”互联网上的画,得先问问画家同不同意,而且得有个大家都懂的方式来说“行”或“不行”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →