← 최신 논문
💬 NLP

Which English Do LLMs Prefer? Triangulating Structural Bias Towards American English in Foundation Models

이 논문은 대규모 언어 모델 (LLM) 이 학습 데이터, 토크나이저 구조, 생성 결과 등 전 개발 단계에서 미국 영어를 체계적으로 선호하고 영국 영어를 소외시키는 구조적 편향을 드러냈으며, 이는 언어 동질화와 인식적 불의를 초래할 수 있음을 지적합니다.

원저자: Mir Tafseer Nayeem, Davood Rafiei

게시일 2026-04-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mir Tafseer Nayeem, Davood Rafiei

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎬 핵심 비유: "AI 의 식탁과 요리사"

이 논문의 내용을 한 마디로 요약하면, **"AI 가 배우는 영어는 전 세계의 다양한 영어가 섞인 스프가 아니라, 미국식 레시피로만 만든 수프"**라는 것입니다.

1. 재료 준비 단계 (학습 데이터) 📚

AI 는 인터넷에 떠도는 엄청난 양의 글을 먹고 자라납니다. 연구진은 이 '식재료'들을 조사했습니다.

  • 비유: AI 의 학습 데이터는 거대한 식료품 창고와 같습니다. 이 창고에 '영국식 소스 (colour, theatre)'도 있지만, '미국식 소스 (color, theater)'가 압도적으로 많이 쌓여 있었습니다.
  • 현실: 연구 결과, 주요 학습 데이터 (책, 위키백과, 웹 페이지 등) 에서 미국식 철자와 단어가 70~80% 이상을 차지하고 있었습니다. 영국식 표현은 창고 구석에 처박혀 있는 셈입니다.

2. 재료를 자르는 단계 (토크나이저) 🔪

AI 는 글을 읽을 때 단어들을 잘게 쪼개서 (토큰화) 처리합니다. 이 과정을 '토크나이저'가 담당합니다.

  • 비유: 이 과정은 요리사가 재료를 썰 때와 같습니다.
    • 미국식 단어 (예: color) 는 한 번에 깔끔하게 썰어집니다. (효율적)
    • 영국식 단어 (예: colour) 는 불필요하게 여러 조각으로 잘게 썰립니다. (비효율적)
  • 현실: 영국식 단어는 미국식 단어보다 조각 수가 더 많아, AI 가 처리하는 데 더 많은 '에너지'와 '공간'을 쓰게 됩니다. 마치 영국식 영어를 쓰는 사람이 AI 에게 더 비싼 요금을 내거나 더 느리게 응답받는 것과 같습니다.

3. 요리를 완성하는 단계 (생성) 🍽️

마지막으로 AI 가 사용자의 질문에 답을 만들어낼 때입니다.

  • 비유: 사용자가 "영국식 영어로 말해줘"라고 주문해도, 요리사 (AI) 는 습관적으로 미국식 레시피대로 요리를 해냅니다.
  • 현실: 연구진은 AI 에게 "영국식 영어로 답해라"라고 명시적으로 지시했음에도, 대부분의 모델이 여전히 미국식 철자 (color) 와 표현 (elevator, fall) 을 사용했습니다. 영국식 표현을 쓰려면 모델이 아주 강하게 "영국식"이라고 명령해야만 겨우 바뀌었습니다.

🌍 왜 이것이 문제일까요? (포스트식민주의적 관점)

이 논문은 단순히 "철자가 다르다"는 문제를 넘어, 역사와 권력의 문제를 지적합니다.

  • 역사적 배경: 과거 영국 제국이 식민지를 거치며 영국식 영어를 전파했습니다. 하지만 20 세기 이후 미국의 문화와 기술 (할리우드, 인터넷, 실리콘밸리) 이 세계를 장악하면서 미국식 영어가 '세계 표준'처럼 자리 잡았습니다.
  • AI 의 문제: AI 는 이 역사적 흐름을 그대로 답습합니다. AI 가 미국식 영어를 '정상 (Norm)'으로 여기고 영국식 영어를 '예외'로 취급하면, 영국식 영어를 사용하는 국가들 (인도, 나이지리아, 싱가포르 등) 의 사용자들은 AI 와 소통할 때 언어적 불이익을 겪게 됩니다.
  • 결과: 이는 **'인지적 불의 (Epistemic Injustice)'**를 낳습니다. 즉, 특정 지역의 언어와 문화가 AI 에 의해 무시당하거나 하위 문화로 전락하게 되는 것입니다.

💡 연구진이 제안하는 해결책

이 문제를 해결하기 위해 연구진은 다음과 같은 방법을 제안합니다.

  1. 균형 잡힌 식재료 (데이터): AI 를 학습시킬 때 미국식 데이터만 쌓지 말고, 영국식 및 다른 영어권 (인도, 호주 등) 데이터를 균형 있게 섞어야 합니다.
  2. 공정한 칼질 (토크나이저): 영국식 단어가 불필요하게 잘게 썰리지 않도록, 토크나이저의 사전 (Vocabulary) 을 고쳐서 모든 영어 변형이 똑같이 효율적으로 처리되게 해야 합니다.
  3. 새로운 도구 (DIALIGN): 연구진은 DIALIGN이라는 새로운 도구를 개발했습니다. 이는 AI 가 쓴 글이 미국식인지 영국식인지, 그리고 얼마나 편향되어 있는지를 자동으로 측정하는 '언어 나침반' 역할을 합니다.

📝 한 줄 요약

"현재의 AI 는 미국식 영어를 '기본 설정'으로 삼고 있어, 영국식 영어를 사용하는 전 세계 수억 명의 사용자에게 언어적 불평등을 강요하고 있습니다. 우리는 AI 가 더 공정하고 다양한 영어를 배울 수 있도록 데이터와 설계 방식을 바꿔야 합니다."

이 연구는 기술이 단순히 중립적이지 않으며, 우리가 만든 AI 가 역사적 권력 관계를 어떻게 재생산하는지 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →