← 最新论文
🤖 AI

How Hyper-Datafication Impacts the Sustainability Costs in Frontier AI

本文认为,前沿人工智能向“超数据化”的转变驱动了显著的环境成本,并系统性地将劳动风险与表征伤害重新分配至全球南方,从而呼吁建立一个新的“数据 PROOFS”框架以缓解这些可持续性挑战。

原作者: Sophia N. Wilson, Sebastian Mair, Mophat Okinyi, Erik B. Dam, Janin Koch, Raghavendra Selvan

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Sophia N. Wilson, Sebastian Mair, Mophat Okinyi, Erik B. Dam, Janin Koch, Raghavendra Selvan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将人工智能(AI)的世界看作一位正在试图烹饪完美佳肴的、饥肠辘辘的大厨。多年来,这位大厨只是环顾厨房,抓取桌上现有的食材(现有的互联网数据)进行烹饪。但最近,大厨改变了策略。大厨不再仅仅是抓取现有的东西,而是开始建造新的工厂来专门为这锅菜培育食材,甚至使用机器人来合成看起来真实的假食材。论文将这种转变称为**“超数据化”(Hyper-Datafication)**。

作者认为,虽然这种新方法让 AI 变得更聪明,但也带来了一份我们尚未察觉的隐藏“账单”。这份账单由三个部分组成:能源成本(环境)、人力成本(社会)和金钱成本(经济)。

以下是该论文研究结果的拆解,使用了简单的类比:

1. 环境账单:“数字仓库”

把 AI 数据想象成仓库里的物理箱子。

  • 爆炸式增长: 这些“箱子”(数据集)的数量增长得如此之快,以至于仓库正以惊人的速度填满。论文研究了一个流行的公共仓库(Hugging Face),发现添加的数据量呈爆炸式增长。
  • 隐藏的能源: 大多数人担心的是“烹饪”美食(训练 AI 模型)所需的能量。但本文指出,存储这些食材所需的能量也是巨大的。
    • 类比: 想象一下,如果你必须把你读过的每一本书都备份一份放在自己的地下室里,即使你再也不会读它们。这就是研究人员下载这些数据集时发生的情况。论文估计,仅用于存储这些下载副本的能源就相当于 21.7 万人 的年碳足迹。
  • 位置问题: 这些仓库大多位于美国,那里的电力来源较为肮脏(如煤炭)。如果它们在欧洲,电力来源更清洁,污染就会低得多。但目前,“数字仓库”正位于这个最污染的社区。

2. 社会账单:“看不见的工厂工人”

为了让大厨准备好这些食材,必须有人来进行分类、清洗和标注。

  • 工人: 论文采访了 134 名来自肯尼亚的数据工作者,肯尼亚是这类数字劳动的枢纽国家之一。
  • 工作条件: 这些工人的薪资通常很低(每月约 200 至 300 美元,低于当地平均水平),且每周工作时间很长(40 至 60 小时)。
  • 创伤: 一个重要的发现是,许多工人每天都会接触到令人不安、暴力或血腥的内容(例如为了“安全性”而筛选不良图像)。
    • 类比: 想象一下你的工作是翻找垃圾以寻找好东西,但这些垃圾中包含了噩梦。论文发现,你所接触的内容越具有创伤性,你获得的额外报酬反而越少。这是一种没有得到补偿的“创伤税”。
  • 不平等: 这些工人主要来自全球南方(如肯尼亚),而制造 AI 的公司(如 Google 或 Meta)则来自全球北方。工人承担着心理健康风险,而公司则获取利润。

3. 经济账单:“淘金热”

  • 投资: 建造这些庞大的数据仓库及其内部的服务器需要巨额资金。论文指出,目前全球对数据中心的投资规模已经超过了全球对石油的投资。
  • 垄断: 就像少数几家公司拥有大部分油井一样,少数几家大型科技公司拥有大部分数据基础设施。
  • 失衡: 论文指出,尽管数据是由世界各地的人们产生的(包括印度和非洲),但处理这些数据的“工厂”主要在美国。这意味着创造的价值留在了美国,而产生数据的人却获益甚微。

4. 代表性问题:“回声壁垒”

论文还研究了这些数据仓库中包含什么

  • 偏见: 尽管互联网是全球性的,但用于训练 AI 的数据主要以英语为主。
  • 类比: 想象一下,你想教一个孩子了解整个世界,但你只给他看用英语写的书。这个孩子会认为全世界都说英语,并且认为英语文化是唯一重要的。论文发现,英语在数据中占据主导地位,而数十亿人使用的语言几乎没有得到体现。这使得 AI 偏向于英语使用者。

解决方案:“Data PROOFS”

作者不仅想指出问题,还提出了名为 Data PROOFS 的一套规则来解决问题:

  • P (Provenance) 溯源: 了解数据的来源,并向创造数据的人致敬/给予认可。
  • R (Resource-awareness) 资源意识: 不要假装数据是“免费”的。衡量每个数据集的能源和人力成本。
  • O (Ownership) 所有权: 创造数据的人应该拥有数据,而不是大型科技公司。
  • O (Openness) 透明度: 对成本保持透明。
  • F (Frugality) 节俭: 停止囤积数据。如果使用较少的数据也能达到同样的效果,那就少用一些。
  • S (Standards) 标准: 建立衡量和报告这些成本的规则。

核心结论

论文总结道,通过收集无限量的数据来构建“超级智能”AI 的冲刺,并不是一条中立的进步之路。这是一个悄悄消耗地球能源、剥削发展中国家工人、并强化“只有英语文化才重要”这一观念的系统。作者敦促我们放慢脚步,审视隐藏的成本,并开始建立一个公平且可持续的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →