← 최신 논문
💬 NLP

Measuring the Cross-Lingual Comprehension Gap: How the language of the evidence shapes what language models understand

본 연구는 언어 모델이 영어에 비해 비영어권 언어에서 이해 능력이 현저히 저하됨을 입증하기 위해 교차 언어 이해 격차(CLCG)를 도입하며, 이는 영어 중심의 평가가 저자원 언어 사용자들에 대한 성능을 과대평가하고 있음을 드러낸다.

원저자: Rafael da Silva, Jeff Eicher

게시일 2026-08-10
📖 5 분 읽기🧠 심층 분석

원저자: Rafael da Silva, Jeff Eicher

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 읽고 질문에 답할 수 있는 아주 똑똑한 로봇을 테스트하고 있다고 상상해 보세요. 당신은 영어로 된 이야기를 주고 질문을 던졌고, 로봇은 정답을 맞혔습니다. 이제, 똑같은 이야기를 가져왔지만 이번에는 스페인어, 프랑스어, 또는 인터넷에 책이 거의 없는 언어로 작성되었습니다. 로본은 여전히 그 이야기를 똑같이 잘 이해할까요? 이것은 인공지능, 특히 "자연어 처리(Natural Language Processing)"라고 불리는 분야에서 매우 중요한 질문입니다. 과학자들은 오래전부터 이러한 AI 모델들이 다른 언어보다 영어에 더 능숙하다는 것을 알고 있었지만, 그 이유를 밝혀내는 것은 어려웠습니다. 로봇이 그 언어로 된 책을 충분히 읽지 못해서일까요? 번역이 나쁘기 때문일까요? 아니면 단어가 바뀌면 로봇이 단순히 의미를 "이해하지" 못하는 것일까요? 이 문제를 해결하기 위해 연구자들은 다른 것은 바꾸지 않고—새로운 질문도, 다른 이야기도 없이—오직 다른 언어만을 사용하여 로봇의 두뇌를 테스트할 방법을 필요로 했습니다.

"교차 언어 이해 격차 측정(Measuring the Cross-Lingual Comprehension Gap)"이라는 제목의 이 논문은 마침내 그 특정 문제를 분리해 낸 과학적 탐정 이야기와 같습니다. 연구진은 559개의 기사를 18개의 서로 다른 언어(포르투갈어와 같이 널리 쓰이는 언어부터 폰(Fon)이나 아야쿠초 케추아(Ayacucho Quechua)와 같은 매우 희귀한 언어까지)로 번역하여 완벽하게 매칭된 거대한 테스트 세트를 구축했습니다. 그들은 다섯 가지 서로 다른 AI 모델에게 이 기사들에 대해 똑같은 질문을 던졌습니다. 비결은 질문과 "정답"이 항상 영어로 되어 있었다는 점입니다. 즉, 로봇이 새로운 언어로 글을 쓰는 데 어려움을 겪을 필요가 없게 만든 것입니다. 로봇은 오직 새로운 언어를 읽고 이해하기만 하면 되었습니다. 이렇게 함으로써, 그들은 언어가 바뀌었을 때문에 AI가 얼마나 많은 "이해력"을 잃었는지 정확히 측정할 수 있었습니다. 연구 결과 명확하고 측정 가능한 격차가 발견되었습니다. 이야기가 영어가 아닐 때, 특히 디지털 자원이 적은 언어의 경우 AI의 이해도가 현저히 떨어졌습니다. 이 연구는 AI가 영어를 잘한다고 해서 다른 모든 언어에서도 똑같이 똑똑하다는 뜻은 아니라는 것을 증로하며, 우리가 이 다른 언어들을 사용하는 사람들에게 이 로봇들이 얼마나 잘 기능하고 있는지 과대평가하고 있을 수도 있음을 시사합니다.

거대한 언어의 함정

언어 모델을 학교 도서관의 모든 책을 다 읽은 아주 똑똑한 학생이라고 생각해 보세요. 하지만 그 책의 거의 대부분은 영어로 되어 있습니다. 만약 당신이 이 학생에게 영어로 된 역사 시험지를 준다면, 학생은 만점을 받을 것입니다. 하지만 만약 똑같은 시험지를 주되, 그 이야기가 아주 작은 공동체에서 사용되는 희귀한 방언처럼 본 적이 거의 없는 언어로 번역되어 있다면 어떻게 될까요? 당신은 그 학생의 "두뇌"가 문제를 풀 수 있을 만큼 똑똑하다면 똑같이 잘 해낼 것이라고 예상할 것입니다. 하지만 이 논문은 그 학생의 두뇌가 실제로 안개가 낀 것처럼 흐릿해지기 시작한다는 것을 보여줍니다.

연구자들은 이 안개를 **교차 언어 이해 격차(Cross-Lingual Comprehension Gap, CLCG)**라고 부릅니다. 이것은 AI가 영어로 된 이야기를 이해하는 능력과, 똑같은 이야기를 다른 언어로 이해하는 능력 사이의 차이입니다. 이를 측정하기 위해, 그들은 단순히 인터넷에서 무작위로 테스트를 가져온 것이 아닙니다. 대신, 그들은 "평행 우주"의 데이터를 구축했습니다. 그들은 559개의 기사(대부분 다국어 출판 소스에서 가져옴)를 가져와 18개의 서로 다른 언어로 완벽하게 정렬했습니다. 이는 마치 18개의 동일한 미스터리 소설 복사본을 각 언어별로 가지고 있는 것과 같습니다.

그다음, 그들은 엄격한 실험을 설정했습니다. 다섯 개의 서로 다른 연구실에서 나온 다섯 가지 AI 모델에게 이 이야기들을 읽고 질문에 답하도록 요청했습니다. 여기서 마법 같은 부분은, 질문과 "표준 정답"이 항 всегда 영어였다는 점입니다. AI는 스페인어나 스와힐리어로 답을 써야 하는 것이 아니라, 단지 스페인어나 스와힐리어 이야기를 읽고 영어로 답을 말하면 되었습니다. 이것은 매우 중요한데, AI가 새로운 언어로 글을 쓰는 데 "서툰" 문제를 제거해주기 때문입니다. 만약 AI가 답을 틀렸다면, 그것은 단어를 형성하지 못해서가 아니라 이야기를 이해하지 못했기 때문입니다.

결과: 명확한 이해도의 하락

결과는 마치 주자가 매끄러운 트랙에서 진흙탕으로 옮겨갔을 때 속도가 줄어드는 것을 보는 것과 같았습니다. AI가 영어로 이야기를 읽었을 때 점수는 높았습니다. 하지만 동일한 이야기가 16개의 대상 언어로 제시되었을 때 점수는 떨어졌습니다.

연구에 따르면, 영어를 다른 언어로 바꿀 때 AI의 성능은 평균적으로 약 17% 하락했습니다. 논문의 용어로 표현하면, 이는 (높을수록 좋은 척도에서) 0.078의 격차입니다. 이것은 사소한 오류가 아니라 상당한 이해력의 손실입니다.

연구진은 또한 언어의 "풍부함"이 중요한지도 살펴보았습니다. 그들은 디지털 자원(책이나 웹사이트 등)이 얼마나 존재하는지에 따라 언어를 분류하는 시스템을 사용했습니다. 그들은 명확한 패턴을 발견했습니다: 언어의 자원이 적을수록 격차는 커집니다.

  • 고자원 언어(그들이 기준점으로 사용한 포르투갈어와 같은 언어)는 영어와 비교했을 때 여전히 작은 격차를 보였습니다.
  • 저자원 언어(폰이나 아야쿠초 케추아와 같은 언어)는 훨씬 더 큰 격차를 보였습니다.

예를 들어, 텍스트가 저자원 언어로 되어 있을 때 AI는 이야기의 "목적"이나 복잡한 추론에 관한 질문에서 눈에 띄게 낮은 성적을 보였습니다. 논문은 AI가 단순히 단어를 "잊어버리는" 것이 아니라, 디지털 "보조 바퀴"가 없을 때 전체 이야기의 의미를 구성하는 데 어려움을 겪고 있다고 제안합니다.

무엇을 배제하고, 무엇을 배제하지 못했는가

연구진은 점수 하락의 다른 원인들을 배제하기 위해 매우 주의를 기울였습니다.

  • 나쁜 번역이 아니다: 그들은 전문적인 소스에서 가져온 고품 quality의 인간 번역 텍스트를 사용했으므로 이야기는 훌륭했습니다. 격차는 번역이 망가졌기 때문이 아니라, AI가 의미를 파악하지 못했기 때문에 발생했습니다.
  • 단순 암기가 아니다: 그들은 AI가 영어 버전의 이야기를 단순히 "기억"하고 있는 것인지 확인했습니다. 그들은 AI의 학습 데이터 컷오프 날짜 이후에 발표된 기사들로 테스트를 진행했습니다(즉, AI가 이전에 본 적이 없어야 함을 의미합니다). 그럼에도 격차는 여전히 존재했으며, 이는 AI가 단순히 기억된 사실을 읊는 것이 아니라 실제로 읽고 이해하려고 노력하고 있음을 증명했습니다.
  • 질문 유형의 문제가 아니다: 그들은 단순한 "단어 찾기" 작업부터 복잡한 "작가의 의도는 무엇인가?"와 같은 질문까지 다양한 종류의 질문을 테스트했습니다. 격차는 전반적으로 나타났지만, 특정 사고 유형에서 때때로 더 크게 나타나기도 했습니다.

하지만 논문은 이것이 "해결된" 문제라거나 AI가 "고장 났다"고 말하는 것이 아님을 분명히 합니다. 이 연구는 단지 격차를 측정할 뿐입니다. 또한 인간 평가자들도 일반적인 경향에는 동의했지만(인간은 영어 기반의 답변을 더 선호하는 경향이 있음), 특정 답변이 왜 틀렸는지에 대해서는 의견이 일치하기 어려웠다는 점을 언급하며, 인간의 판단조차도 여기에서는 한계가 있음을 보여주었습니다.

이것이 왜 중요한가

이 연구는 경종을 울리는 메시지입니다. 오랫동안 우리는 AI가 영어에 능숙하다면 어디에서나 똑똑할 것이라고 가정해 왔습니다. 이 논문은 그것이 사실이 아님을 보여줍니다. 만약 당신이 저자원 언어가 사용되는 국가의 의사, 교사, 또는 변호사를 돕는 도구를 만들고 있다면, 영어로 훈련된 AI가 완벽하게 작동할 것이라고 가정해서는 안 됩니다. "이해 격차"는 AI가 중요한 세부 사항을 놓치거나, 복잡한 지시를 오해하거나, 불완데한 답변을 제공할 수 있음을 의미합니다.

저자들은 단순히 문제를 발견한 것에 그치지 않고, 이를 측정하기 위한 새로운 도구를 만들었습니다. 그들은 다른 과학자들이 새로운 AI 모델을 점검할 수 있도록 데이터와 방법론을 공개했습니다. 이는 과학계에 AI가 세계를 얼마나 진정으로 이해하는지 측정할 수 있는 새로운 자를 제공하는 것과 같습니다. 핵심은 간단합니다: 영어 유창함이 보편적인 이해를 의미한다고 가정하는 것을 멈추고, 어떤 언어를 말하든 AI가 모두에게 공정하고 정확할 수 있도록 그 격차를 측정하기 시작해야 한다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →