← 최신 논문
💬 NLP

Mind the Gap... or Not? How Translation Errors and Evaluation Details Skew Multilingual Results

이 논문은 다국어 거대언어모델(LLM)에서 고자원 언어와 저자원 언어 사이의 겉으로 보이는 성능 격차가 MGSM 벤치마크의 번역 오류와 일관되지 않은 정답 추출에 의한 인위적인 결과이며, 이러한 데이터 품질 문제가 수정될 때 사라진다는 점을 밝히고 있다.

원저자: Jan-Thorsten Peter, David Vilar, Tobias Domhan, Dan Malkin, Markus Freitag

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jan-Thorsten Peter, David Vilar, Tobias Domhan, Dan Malkin, Markus Freitag

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 다양한 언어를 사용하는 학생들을 위해 수학 시험을 채점하려는 교사라고 상상해 보세요. 당신은 학생들이 영어를 쓰든, 프랑스어를 쓰든, 스와힐리어를 쓰든, 벵골어를 쓰든 상관없이 수학 실력이 동일한지 알고 싶습니다.

이 논문은 본질적으로 우리가 이 시험들을 어떻게 채점해 왔는지에 대한 성적표이며, 충격적인 실수를 드러내고 있습니다: 우리는 망가진 시험지와 결함이 있는 채점기를 바탕으로 학생들을 채점하고 있었습니다.

다음은 연구자들이 발견한 내용을 이해하기 쉽게 정리한 내용입니다:

1. 초기 (잘못된) 결론

연구자들은 MGSM이라는 유명한 수학 테스트를 살펴보는 것으로 시작했습니다. 이 테스트는 250개의 간단한 수학 문제(예: "사과가 5개 있다면...")를 가져와 10개의 다른 언어로 번역합니다.

연구진이 자신들의 AI 모델(학생들)을 이 테스트에 통과시켰을 때, 결과는 비영어권 사용자들에게 매우 처참하게 나타났습니다.

  • 비유: 이는 마치 프랑스어를 사용하는 학생은 수학 시험에서 60%를 받고, 영어 사용 학생은 98%를 받는 것과 같았습니다.
  • 초기 생각: 모두가 AI가 프랑스어나 스와힐리어로 말할 때 수학적 "지능"이 떨어진다고 가정했습니다. 즉, 다른 언어로 사고할 때 AI가 어려움을 겪는 거대한 "언어 격차"가 존재한다고 생각한 것입니다.

2. 조사: "잠깐, 시험지가 고장 났다!"

연구자들은 탐정이 되어 시험 문제를 정밀 조사하기로 했습니다. 그들은 점수를 망치고 있는 두 가지 주요 문제를 발견했습니다.

문제 A: "번역 과정에서의 손실" 오류
테스트를 만든 인간 번역가들이 미묘한 실수를 저질렀습니다.

  • 은유: 수학 문제가 "화요일에 나는 월요일보다 6배 더 멀리 걸었다"라고 되어 있다고 가정해 봅시다. 그런데 독일어 번역본에서 실수로 "화요일"을 "목요일"로 바꾸어 버린 것입니다.
  • 결과: 매우 논리적인 AI 모델은 질문을 보고 이렇게 말합니다. "잠깐, 요일이 서로 맞지 않잖아! 이 문제를 풀 수 없어!" 그래서 오답을 냈습니다. 하지만 이것은 AI의 수학 실력 문제가 아니라, 깨진 질문의 문제였습니다.

문제 B: "결함이 있는 채점기"
AI가 정답을 맞혔을 때조차, 답을 읽어내는 컴퓨터 프로그램이 너무 경직되어 있었습니다.

  • 은유: AI가 답을 "2.000"(유럽에서 흔히 쓰이는 천 단위 구분 기호인 점 사용)이라고 썼다고 가정해 봅시다. 영어 스타일을 기대하는 채점기는 점을 보고 이렇게 생각합니다. "오, 이건 소수점이구나! 이건 2.000... 아니, 그냥 2네." 또는 최악의 경우, 쉼표를 보고 혼란에 빠집니다.
  • 결과: AI는 실제로 문제를 올바르게 풀었지만, "채점기"가 국가마다 숫자를 쓰는 방식이 다르다는 것을 이해하지 못했기 때문에 오답으로 처리했습니다.

3. 해결책: 난장판 정리하기

연구자들은 두 가지 작업을 수행했습니다:

  1. 질문 수정: 번역 오류(예: "화요일 vs 목요일" 혼동)를 찾아내어 질문을 수정했습니다.
  2. 채점기 수정: 숫자를 읽는 데 더 똑똑해지도록 컴퓨터 프로그램을 업데이트했습니다. 이제 프로그램은 프랑스어의 쉼표가 소수점일 수 있고, 독일어의 점이 천 단위 구분 기호일 수 있다는 것을 학습했습니다.

4. 새로운 결과: 격차가 사라지다

연구진이 수정된 질문더 똑똑해진 채점기로 다시 테스트를 진행했을 때, 결과는 완전히 바뀌었습니다.

  • 비유: 이는 마치 프랑스어 학생도 사실 98%를 받았는데, 우리가 단지 그들의 시험지를 잘못 읽었다는 것을 깨달은 것과 같습니다.
  • 결과: 영어와 다른 언어 사이의 거대한 성능 격차는 거의 사라졌습니다. 가장 강력한 AI 모델들의 경우, 프랑스어나 러시아어, 혹은 스와힐리어에서도 영어에서와 마찬가지로 잘 수행했습니다.

핵심 교훈

이 논문은 강력한 AI 모델들에게는 언어 간의 "수학 격차"가 실제로 존재하지 않는다고 결론짓습니다.

우리가 격차가 있다고 생각했던 이유는 다음과 같습니다:

  1. 테스트 질문이 제대로 번역되지 않았습니다.
  2. 우리는 현지 숫자 형식을 이해하지 못하는 도구로 답을 채점했습니다.

시사점:
AI가 "다른 언어로 수학을 못 한다"고 비난하기 전에, 우리는 먼저 우리의 테스트가 실제로 공정한지, 그리고 우리의 채점 도구가 제대로 작동하고 있는지 확인해야 합니다. 연구자들은 다른 사람들이 미래를 측정할 때 공정한 자를 사용할 수 있도록 수정된 테스트를 공개했습니다.

이 논문이 말하고자 하는 것이 '아닌' 것:

  • AI가 모든 언어에서 완벽하다는 뜻이 아닙 (작고 약한 모델들은 여전히 약간의 어려움을 겪습니다).
  • 다른 언어로 테스트하는 것을 중단해야 한다는 뜻이 아닙.
  • 모든 벤치마크가 고장 났다고 주장하는 것이 아니라, 오직 이 특정 벤치마크(MGSM)에 이러한 구체적인 문제가 있었다는 것을 의미합니다.

요약하자면: 문제가 된 것은 AI가 아니라, 테스트였습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →