← 최신 논문
💬 NLP

The Dialect Tax: Dialectal Biases Persist throughout the Language Modeling Pipeline

이 논문은 '방언세(dialect tax)'—언어 모델에서 표준 미국 영어와 다른 방언들 사이의 체계적인 성능 격차—가 단일 단계에 의해 발생하는 것이 아니라, 토큰화와 사전 학습부터 사후 학습 및 추론에 이르기까지 전체 모델링 파이프라인 전반에 걸쳐 축적된다는 것을 입증한다.

원저자: Elle

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Elle

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어 모델은 일상생활에 깊숙이 스며든 챗봇, 번역기, 글쓰기 보조 도구들의 엔진 역할을 하고 있습니다. 이 시스템들은 방대한 양의 텍스트를 읽음으로써 문법, 어휘, 스타일의 패턴을 흡수하고, 다음에 올 단어를 예측하는 법을 배웁니다. 수십 년 동안 연구자들은 이러한 시스템이 어떤 사람들에게는 다른 이들보다 더 잘 작동한다는 사실을 알고 있었습니다. 사용자가 표준 영어로 말하면 컴퓨터는 대개 완벽하게 이해합니다. 하지만 아프리카계 미국인 영어(AAVE)와 같은 방언을 사용하면, 시스템은 종종 비틀거리며 더 많은 실수를 하거나 낮은 품질의 응답을 내놓곤 합니다. 이러한 성능 격차는 단순한 작은 결함이 아닙니다. 이는 비표준 방언을 사용하는 이들에게서 모두와 동일한 결과를 얻기 위해 더 많은 노력, 시간, 정확성을 요구함으로써 부과되는 '숨겨진 세금'처럼 작용합니다. 과학자들을 오랫동안 고민하게 만든 질문은 이 세금이 어디에서 기인하느냐는 것입니다. 컴퓨터가 처음에 단어를 더 작은 조각으로 나누는 방식의 문제일까요, 아니면 모델이 학습하는 과정에서 편향이 모델의 뇌 속에 각인되는 것일까요?

옥스퍼드 대학교의 한 연구자는 현대 언어 모델링 파이프라인의 모든 단계에 걸쳐 이 "방언 세금"을 추적하기 위해 나섰습니다. 그는 문제가 컴퓨터가 텍스트를 처음 읽을 때 시작되는지, 컴퓨터가 공부하고 학습하는 동안 지속되는지, 아니면 질문에 답하려고 할 때만 나타나는지를 확인하고자 했습니다. 이를 위해 그는 영리한 설정을 사용했습니다. 의미는 완전히 같지만 서로 다른 방언으로 작성된 문장 쌍을 가져온 것입니다. 각 쌍의 한 문장은 표준 미국 영어로 작성되었고, 다른 한 문장은 아프리카계 미국인 영어, 애팔래치아 영어, 또는 치카노 영어와 같은 방언으로 작성되었습니다. 의미가 동일했기 때문에, 컴퓨터가 두 문장을 처리하는 방식의 차이는 단어가 어떻게 말해지거나 쓰였는지에 의한 것이지, 어느 한쪽이 이해하기 더 어렵기 때문은 아니어야 했습니다.

연구자는 먼저 컴퓨터가 이 두 문장이 같은 의미라는 것을 인지하는지부터 확인했습니다. 그는 모델들이 그 의미를 이해하고 있다는 것을 발견했습니다. 두 버전 사이의 수학적 거리는 매우 짧았으며, 이는 시스템이 두 문장이 동등하다는 것을 알고 있음을 보여주었습니다. 그러나 컴퓨터가 텍스트를 처리하려고 시로하자마자 세금이 나타났습니다. 컴퓨터가 문장을 '토큰'이라 불리는 작은 조각들로 나누는 첫 번째 단계에서, 방언 버전은 불공평하게 취급되었습니다. 시스템은 표준 버전보다 방언 문장을 더 많은 조각으로 나누었습니다. 예를 들어, "building"이라는 단어는 표준 버전에서는 한 조각일 수 있지만, 방언 버전인 "buildin'"은 세 개의 별개 조각으로 분리될 수 있습니다. 이는 컴퓨터가 동일한 양의 정보를 처리하기 위해 더 많은 일을 해야 함을 의미했습니다. 연구자는 이것이 얼마나 최신이거나 발전된 시스템인지와 상관없이, 그가 테스트한 거의 모든 주요 언어 모델에서 발생한다는 것을 발견했습니다.

이 초기 단어 분할이 문제의 유일한 원인인지 알아내기 위해, 연구자는 대담한 실험을 시도했습니다. 그는 컴퓨터가 평소의 단어 분할 방식을 무시하고 대신 모든 글자를 개별적으로 바라보며, 텍스트를 긴 문자열로 취급하도록 강제했습니다. 그는 이것이 단어 분할 단계로 인한 편향을 제거할 수 있기를 바랐습니다. 하지만 효과가 없었습니다. 컴퓨터가 글자를 하나씩 살펴볼 때조차, 여전히 방언 문장에서 더 낮은 성능을 보였습니다. 정확도 격차는 그대로 유지되었고, 컴퓨터는 여전히 방언 텍스트를 예측하는 데 어려움을 겪었습니다. 이는 문제가 텍esian의 첫 단계에서 발생하는 실수가 아님을 증명했습니다. 편향은 더 깊숙이 이동하여 모델의 내부 지식의 일부가 되었습니다.

조사는 컴퓨터가 수백만 개의 사례로부터 배우는 훈련 단계로 이어졌습니다. 연구자는 모델이 학습하는 동안 수행하는 수학적 업데이트를 살펴보았습니다. 그는 모델이 방언 문장으로부터 배우려고 할 때, 의미가 동일함에도 불구하고 표준 문장에서보다 훨씬 더 크고 혼란스러운 조정을 한다는 것을 발견했습니다. 마치 모델이 방언 텍의 내용을 혼란스럽고 노이즈가 심한 것으로 간주하여, 동일한 개념을 파악하기 위해 훨씬 더 힘들게 노력해야 하는 것과 같았습니다. 이는 모델이 정답을 맞혔을 때조차 마찬가지였으며, 학습 과정 자체가 방언에 대해 더 어려웠습니다. 나중에 연구자가 좋은 답변에 대해 모델에게 보상을 주는 시스템을 살펴보았을 때, 또 다른 층위의 편향을 발견했습니다. 이러한 보상 시스템은 방언 단어가 단독으로 제시될 때는 높은 점수를 주기도 했지만, 동일한 단어가 전체 문장에 포함되어 나타날 때는 그 단어를 처벌했습니다. 이러한 불일치는 모델이 맥락에 따라 방언 사용에 대해 보상을 받기도 하고 처벌을 받기도 하는 혼란스러운 신호를 받게 만들었습니다.

최종적으로 드러난 그림은 방언 세금이 시스템의 한 부분에서 발생하는 단일 오류에 의한 것이 아니라는 점입니다. 대신, 그것은 모든 단계에서 쌓여가는 누적된 효과입니다. 컴퓨터는 방언 단어를 더 많은 조각으로 나누면서 입력을 덜 효율적으로 만듭니다. 학습할 때, 모델은 동일한 정보를 더 이해하기 어려운 것처럼 취급하며 고군분투합니다. 마지막으로, 모델이 답변을 생성하려고 할 때 내부 신호와 보상 시스템은 계속해서 표준 방언을 선호합니다. 연구자는 단순히 컴퓨터가 단어를 나누는 방식을 고치는 것만으로는 문제를 해결하기에 충분하지 않다고 결론지었습니다. 편향은 모델이 학습하고 생각하는 방식의 근간에 이미 짜여 있습니다. 진정으로 공정한 언어 기술을 만들기 위해서, 개발자들은 모델이 모든 방언을 매 단계마다 작은 불이익을 축적하는 대신, 동일한 용이함과 존중을 가지고 다루도록 학습하는 전체 훈련 과정을 재고해야 할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →