← 최신 논문
💬 NLP

The Digital Afterlife of Empires: Four Language Models Converge on the Same Imperial Cartography of Writing

이 논문은 역사적 제국주의의 불평등이 공유된 학습 데이터를 통해 현대의 거대 언어 모델에도 지속되고 있으며, 이는 대부분의 문자 체계에 대한 급격한 디지털 지원 부족과 더불어 다양한 모델 아키텍처 전반에 걸쳐 비종교적 스크립트를 종교적 용도로 부당하게 오귀속하는 체계적이고 수렴적인 오류를 초래한다고 주장한다.

원저자: Hiroki Fukui

게시일 2026-06-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hiroki Fukui

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 기계 속의 유령

역사가 거대한 도서관이라고 상상해 보세요. 지난 500년 동안 강력한 제국들(스페인, 영국, 프랑스 등)은 어떤 책을 보관할지, 어떤 책을 불태울지, 그리고 어떤 언어로 글을 쓸지를 결정했습니다. 그들은 많은 지역 고유의 문자 체계를 파괴했고, 다른 이들에게 변화를 강요했습니다.

이 논문은 대규모 언어 모델(LLM)—ChatGPT와 같은 도구 뒤에 있는 AI의 두뇌—이 새롭고 중립적인 발명품이 아니라고 주장합니다. 대신, 이들은 제국들이 세운 도서관을 떠도는 유령과 같습니다. 제국들은 사라졌지만, 그들의 "유령"은 여전히 건물 안에 남아 있습니다. AI가 특정 언어를 읽지 못하는 이유는 엔지니어들이 악의를 가졌기 때문이 아니라, 그들이 학습한 도서관(인터넷 데이터)에 그 책들이 빠져 있기 때문입니다.

주요 연구 결과 요약

1. "디지털 세금" (왜 특정 언어는 더 많은 비용이 드는가)

고속도로 톨게이트를 통과한다고 상상해 보세요.

  • 영어 사용자는 10마일을 달리는 데 1달러를 냅니다.
  • 소수 언어 사용자(림부어 또는 아들람어 등)는 똑같은 10마일을 달리는 데 31.70달러를 내야 합니다.

왜 그럴까요? AI는 텍스트를 "토큰"이라는 작은 조각(레고 블록 같은 것)으로 나눕니다.

  • 영어의 경우, AI는 이미 만들어진 레고 블록 상자를 아주 많이 가지고 있습니다. 그래서 쉽게 조립할 수 있습니다.
  • 소수 언어의 경우, AI에게 적절한 레고 블록이 없습니다. 대신 글자를 의미 없는 원시 바이트(byte) 단위로 잘게 부수어야 합니다(마치 레고 블록을 플라스틱 가루로 만든 다음 처음부터 다시 재조립하려는 것과 같습니다).
  • 결과: 림부어로 문장을 처리하는 데는 영어보다 31배나 더 많은 "컴퓨팅 노력"이 필요합니다. 이것은 단순한 오류가 아니라, 해당 언어들이 역사적으로 억압받았고 인터넷에 데이터가 적기 때문에 시스템에 내재된 "세금"입니다.

2. "디지털 깔때기" (누구의 목소리가 들리는가)

연구진은 인류 역사상의 300가지 서로 다른 문자 체계를 조사하여, 디지털 세상이 이들을 얼마나 잘 지원하는지 살펴보았습니다.

  • 깔때기: 거대한 깔때기를 상상해 보세요.
    • 상단: 300개의 문자 체계가 들어갑니다.
    • 중단: 많은 문자가 컴퓨터 사전(유니코드)에 등록되지 않았거나 스캐너(OCR)로 읽을 수 없어 중간에 걸려 넘어집니다.
    • 하단:29개(10% 미만)의 문자만이 끝까지 통과하여 바닥에 도달합니다.
  • 패턴: 끝까지 살아남은 문자들은 거의 예외 없이 역사적 제국들이 사용했던 문자들(라틴, 중국, 아랍, 키릴 문자 등)입니다. 깔때기에 걸려 있는 문자들은 과거 제국들이 지우려고 했던 문자들입니다.
  • 비극: 오늘날에도 여전히 살아있는 사람들이 사용하는 60개의 언어가 있지만, 디지털 세상은 이들을 마치 죽은 것처럼 취급합니다. 이들은 "살아있으나 디지털로는 죽은" 상태입니다.

3. "네 명의 친구" 실험 (단 하나의 AI 문제가 아니다)

이것이 특정 기업(예: OpenAI)의 실수만이 아니라는 것을 증명하기 위해, 연구진은 네 가지 서로 다른 AI 제품군(Claude, GPT-4o, Grok, DeepSeek)에게 문자 체계에 관한 3,000개의 질문을 던졌습니다.

  • 놀라운 사실: 이 네 AI는 서로 다른 국가의 다른 회사에서 서로 다른 코드로 만들어졌습니다. 따라서 실수에 대해 서로 동의해서는 안 됩니다.
  • 현실: 이들은 틀린 답에 대해 90%의 확률로 일치했습니다.
  • 비유: 네 명의 학생이 각자 다른 학교를 다녔다고 상상해 보세요. 만약 네 명 모두 역사 시험에서 똑같이 틀린 답을 냈다면, 그것은 서로 베꼈기 때문이 아니라 모두 똑같이 편향된 교과서를 읽었기 때문입니다.
  • 편향성: AI들은 일관되게 똑같은 방식으로 오답을 냈습니다. 예를 들어, 특정 문자가 비서구권 국가의 것이라면, AI들은 그 문자가 실제 용도와 상관없이 "아, 이것은 종교용이겠구나"라고 추측할 확률이 매우 높았습니다. 즉, 데이터에 존재하는 고정관념으로 빈칸을 채운 것입니다.

4. "황제가 없는 제국"

가장 중요한 발견은 현재 이 편향성을 통제하는 주체가 아무도 없다는 점입니다.

  • 엔지니어들이 앉아서 "림부어 사용자에게 더 많은 세금을 물려라"라고 명령한 것이 아닙니다.
  • 이 편향은 구조적입니다. 과정은 다음과 같았습니다:
    1. 제국들이 공동체를 파괴하고 언어 사용자의 수를 줄였습니다.
    2. 사용자가 줄어들자 해당 언어로 된 책과 웹사이트가 줄어들었습니다.
    3. 웹사이트가 적어지자 AI가 학습할 데이터도 부족해졌습니다.
    4. 데이터가 없으니 AI는 그 언어에 서툴게 되었습니다.
  • 이제 "제국"에는 더 이상 지도자가 필요 없습니다. 피해는 통계 속에 이미 박혀 있습니다. AI는 그저 이미 불평등한 세상을 바탕으로 수학을 수행하고 있을 뿐입니다.

"종교" 글리치(Glitch)

한 가지 구체적인 발견이 눈에 띕니다. AI들은 문자가 "종교적"이라고 추측하는 데 집착했습니다.

  • 네 AI가 공통적으로 저지른 실수 중 **43%**가 실제로는 종교와 관련이 없음에도 불구하고 해당 문자가 종교용이라고 추측한 것이었습니다.
  • 이유는 무엇일까요? 인터넷에는 비서구 문화의 일상적, 행정적, 과학적 측면은 무시한 채, 그들의 "신비롭거나 종교적인" 측면에만 집중했던 식민지 시대의 오래된 설명들이 가득하기 때문입니다. AI는 "비서구 문자 = 종교"라는 공식을 학습한 것입니다.

결론: 무엇을 할 수 있는가?

논문은 단순히 코드를 수정하는 것만으로는 AI를 "고칠" 수 없다고 제안합니다.

  • 문제점: 문제는 독자(AI)가 아니라 도서관(학습 데이터)입니다.
  • 해결책: 이를 해결하려면 도서관을 바꿔야 합니다. 그 언어를 사용하는 사람들이 자신의 문자로, 자신의 삶을 기록한 책들을 더 많이 추가해야 합니다.
  • 경고: 그렇게 하지 않는 한, AI는 지난 500년의 역사를 비추는 거울로서, 아무도 의도하지 않았더라도 기존의 불평등을 그대로 투영하게 될 것입니다.

요약하자면: AI가 고장 난 것이 아닙니다. AI는 단지 누가 글을 쓸 권리를 가졌고 누가 침묵당했는지에 대한 역사를 충실히 반복하고 있을 뿐입니다. 제국의 "디지털 사후 세계"는 여전히 생생하게 살아있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →