← 최신 논문
🤖 AI

How Hyper-Datafication Impacts the Sustainability Costs in Frontier AI

이 논문은 프런티어 AI에서의 '하이퍼 데이터화(hyper-datafication)'로의 전환이 상당한 환경적 비용을 초래하고 노동 위험과 재현적 해악을 글로벌 사우스(Global South)로 체계적으로 재분배한다고 주장하며, 이러한 지속 가능성 문제를 완화하기 위한 새로운 데이터 PROOFS 프레임워크를 제안한다.

원저자: Sophia N. Wilson, Sebastian Mair, Mophat Okinyi, Erik B. Dam, Janin Koch, Raghavendra Selvan

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sophia N. Wilson, Sebastian Mair, Mophat Okinyi, Erik B. Dam, Janin Koch, Raghavendra Selvan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능(AI)의 세계를 완벽한 요리를 만들기 위해 노력하는 거대하고 배고픈 요리사라고 상상해 보십시오. 수년 동안 이 요리사는 주방을 둘러보며 카운터에 이미 놓여 있는 재료들(기존 인터넷 데이터)을 집어 들어 요리하기만 했습니다. 하지만 최근 이 요리사는 전략을 바꿨습니다. 단순히 있는 것을 가져오는 대신, 특정 용도의 재료를 직접 키우기 위해 새로운 공장을 짓고 있으며, 심지어 진짜처럼 보이는 가짜 재료를 합성하는 로봇까지 사용하고 있습니다. 이 논문은 이러한 변화를 **"하이퍼 데이터화(Hyper-Datafication)"**라고 부릅니다.

저자들은 이러한 새로운 접근 방식이 AI를 더 똑똑하게 만들기는 하지만, 우리가 주목하지 못하는 숨겨진 "청구서"가 따른다고 주장합니다. 이 청구서에는 세 가지 부분이 있습니다: 에너지 비용(환경적), 인간의 비용(사회적), 그리고 돈의 비용(경제적)입니다.

다음은 논문의 내용을 쉬운 비유를 사용하여 정리한 것입니다.

1. 환경적 청구서: "디지털 창고"

AI 데이터를 물리적인 상자가 가득 찬 창고라고 생각해 보십시오.

  • 폭발적 증가: 이 "상자"(데이터셋)의 수가 너무 빠르게 늘어나고 있어서 창고가 경고 수준으로 빠르게 채워지고 있습니다. 논문은 인기 있는 공공 창고인 허깅페이스(Hugging Face)를 조사했으며, 데이터가 추가되는 양이 폭발적으로 증가했음을 발견했습니다.
  • 숨겨진 에너지: 대부분의 사람들은 요리를 하는 데 드는 에너지(AI 모델을 학습시키는 과정)를 걱정합니다. 하지만 이 논문은 재료를 '저장'하는 데 드는 에너지가 엄청나다는 점을 지적합니다.
    • 비유: 만약 당신이 읽었던 모든 책의 복사본을 다시 읽지도 않을 텐데도 자신의 지하실에 보관해야 한다면 어떨까요? 연구자들이 이 데이터셋들을 다운로드할 때 발생하는 일이 바로 이것입니다. 논문은 이 다운로드된 복사본들을 저장하는 데 사용되는 에너지가 217,000명의 연간 탄소 발자국과 맞먹는다고 추정합니다.
  • 위치의 문제: 이 창고들의 대부분은 미국에 있으며, 그곳의 전기는 석탄과 같은 더 더러운 에너지원에 의존하고 있습니다. 만약 이 창고들이 전기가 더 깨끗한 유럽에 있었다면 오염이 훨씬 적었을 것입니다. 하지만 현재 "디지털 창고"는 가장 오염이 심한 동네에 위치해 있습니다.

2. 사회적 청구서: "보이지 않는 공장 노동자들"

요리사가 재료를 준비할 수 있도록 누군가는 이를 분류하고, 깨끗하게 다듬고, 라벨을 붙여야 합니다.

  • 노동자들: 논문은 이러한 종류의 디지털 노동의 허브로 알려진 케냐의 데이터 노동자 134명을 인터뷰했습니다.
  • 근무 조건: 이들은 종종 매우 적은 임금(월 약 200300달러로, 국가 평균 미만)을 받으며 장시간(주당 4060시간) 근무합니다.
  • 트라우마: 주요 발견 중 하나는 많은 노동자가 매일 그래픽이 포함된 충격적이거나 폭력적인 콘텐츠(예: 안전을 위해 나쁜 이미지를 분류하는 작업)에 노출되어 있다는 점입니다.
    • 비유: 쓰레기 속에서 좋은 물건을 찾아내기 위해 쓰레기를 분류해야 하는데, 그 쓰레기에 악몽 같은 장면들이 포함되어 있는 직업을 상상해 보십시오. 논문은 접하는 콘텐츠가 더 트라우마적일수록 추가 보상이 적어진다는 사실을 발견했습니다. 이는 보상받지 못하는 "트라우마 세금"입니다.
  • 불평등: 노동자들은 주로 글로벌 사우스(케냐와 같은 국가)에 위치해 있는 반면, AI를 만드는 기업들(구글이나 메타 등)은 글로벌 노스에 위치해 있습니다. 노동자들은 정신적 건강 위험을 짊어지는 반면, 기업들은 이익을 독점합니다.

3. 경제적 청구서: "골드러시"

  • 투자: 이러한 거대한 데이터 창고와 그 안의 서버를 구축하는 데는 엄청난 돈이 듭니다. 논문은 데이터 센터에 대한 전 세계적 투자가 현재 전 세계 석유 투자보다 더 크다고 언급합니다.
  • 독점: 몇몇 대기업이 대부분의 유정을 소유하는 것처럼, 몇몇 빅테크 기업들이 대부분의 데이터 인프라를 소유하고 있습니다.
  • 불균형: 논문은 데이터가 전 세계 사람들(인도와 아프리카 포함)에 의해 생성되지만, 이를 처리하는 "공장"은 대부분 미국에 있다는 점을 지적합니다. 이는 데이터로 창출된 가치가 미국에 머무는 반면, 데이터를 생성한 사람들은 아주 적은 것만을 가져가게 됨을 의미합니다.

4. 대표성의 문제: "에코 체임버(반향실)"

논문은 또한 이 데이터 창고 안에 무엇이 들어있는지도 살펴보았습니다.

  • 편향성: 인터넷은 전 세계적이지만, AI 학습에 사용되는 데이터는 대부분 영어로 되어 있습니다.
  • 비유: 아이에게 세상에 대해 가르치려 하는데, 영어로 쓰인 책만 주는 상황을 상상해 보십시오. 그 아이는 온 세상이 영어를 사용하며 영어 문화만이 유일하게 중요하다는 생각을 갖게 될 것입니다. 논문은 영어가 데이터를 지배하고 있는 반면, 수십억 명이 사용하는 다른 언어들은 거의 표현되지 않고 있음을 발견했습니다. 이는 AI가 영어 사용자들에게 편향되도록 만듭니다.

해결책: "Data PROOFS"

저자들은 단순히 문제점을 지적하는 데 그치지 않고, 이를 해결하기 위한 Data PROOFS라는 규칙을 제안합니다.

  • P (Provenance, 출처): 데이터가 어디에서 왔는지 알고, 그것을 만든 사람들에게 공로를 돌려야 합니다.
  • R (Resource-awareness, 자원 인식): 데이터가 "공짜"라고 생각하는 것을 멈춰야 합니다. 모든 데이터셋의 에너지와 인간적 비용을 측정해야 합니다.
  • O (Ownership, 소유권): 데이터를 생성하는 사람들이 그것을 소유해야 하며, 빅테크 기업이 소유해서는 안 됩니다.
  • O (Openness, 개방성): 비용에 대해 투명해야 합니다.
  • F (Frugality, 절약): 데이터를 쌓아두는 것을 멈춰야 합니다. 효과적이라면 더 적은 데이터를 사용하십시오.
  • S (Standards, 표준): 이러한 비용을 측정하고 보고하는 규칙을 만들어야 합니다.

결론

이 논문은 무한한 양의 데이터를 모음으로써 "초지능" AI를 구축하려는 질주가 결코 중립적인 진보의 경로가 아니라고 결론짓습니다. 이는 지구의 에너지를 조용히 소모하고, 개발도상국의 노동자들을 착취하며, 영어권 문화만이 중요하다는 생각을 강화하는 시스템입니다. 저자들은 우리가 속도를 늦추고, 숨겨진 비용을 살펴보고, 더 공정하고 지속 가능한 시스템을 만들기 시작할 것을 촉구합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →