← 최신 논문
💬 NLP

MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation

본 논문은 다양한 언어에서 수학적 추론의 견고성을 평가하기 위해 여러 자릿수가 변하는 인스턴스를 생성하는 GSM-Symbolic 벤치마크의 다국어 확장인 MGSM-Pro 를 소개하며, 이를 통해 저자원 언어에서 성능이 크게 저하되고 이러한 교란에 대한 모델의 복원력이 다양함을 밝힙니다.

원저자: Tianyi Xu, Kosei Uemura, Alfred Malengo Kondoro, Tadesse Destaw Belay, Catherine Nana Nyaah Essuman, Ifeoma Okoh, Ganiyat Afolabi, Ayodele Awokoya, David Ifeoluwa Adelani

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tianyi Xu, Kosei Uemura, Alfred Malengo Kondoro, Tadesse Destaw Belay, Catherine Nana Nyaah Essuman, Ifeoma Okoh, Ganiyat Afolabi, Ayodele Awokoya, David Ifeoluwa Adelani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

여러분이 다양한 국가의 학생들로 구성된 학급에 수학 시험을 치르게 하는 선생님이라고 상상해 보세요. 여러분은 누가 진정으로 수학에 능한지, 그리고 누가 연습 문제집의 답을 단순히 암기하고 있는지를 확인하고 싶습니다.

이 논문은 수학 문제에서 대규모 언어 모델 (AI) 을 평가하는 새로운 더 까다로운 방법인 MGSM-Pro를 소개합니다. 그들이 발견한 바를 간단히 설명한 이야기입니다.

문제: "연습 문제집"의 함정

오랫동안 AI 모델은 수학 단어 문제를 해결하는 데 점점 더 능숙해져 왔습니다. 하지만 연구자들은 의아한 점을 발견했습니다. AI 가 실제로 수학을 "생각"하고 있는 것이 아닐 수 있다는 것입니다. 대신 훈련 중에 본 시험 문제의 구체적인 세부 사항을 암기하고 있을 뿐일 수 있습니다.

특정 단어 문제의 답을 암기하는 학생을 생각해 보세요: "존이 사과 5 개를 가지고 있고 3 개를 더 사면..." 학생은 답이 8 이라는 것을 압니다. 하지만 질문을 *"사라가 오렌지 5 개를 가지고 있고 3 개를 더 사면..."*으로 바꾸면, 첫 번째 문제만 암기한 학생은 당황할 수 있습니다.

최근 연구자들은 영어에서도 수학 문제의 이름이나 숫자를 약간만 변경하면 많은 AI 모델이 실패한다는 것을 발견했습니다. 그들은 AI 가 이러한 작은 변화를 처리할 수 있는지 확인하지 않았기 때문에 기존 시험이 너무 쉬웠다는 것을 깨달았습니다.

해결책: MGSM-Pro ("셔플" 테스트)

저자들은 MGSM-Pro라는 새로운 데이터 세트를 만들었습니다. 그들은 250 개의 수학 문제를 가져와 각 문제의 5 가지 버전을 만들어 1,240 개의 문제로 변환했습니다.

그들은 다음과 같이 덱을 셔플했습니다:

  1. 이름 변경: "존"을 "자이나부"나 "카를라"로 바꾸기.
  2. 숫자 변경: "사과 5 개"를 "사과 7 개"로 바꾸기.
  3. 방해 요소 추가: 중요해 보이지만 실제로는 터무니없는 문장을 추가하기 (예: "하늘은 파란색이므로 존은 사과 5 개를 샀다").

이 작업은 영어와 중국어처럼 널리 사용되는 언어부터 스와힐리어, 요루바어, 이그보어처럼 디지털 자원이 상대적으로 적은 언어에 이르기까지 아홉 가지 다른 언어로 수행되었습니다.

큰 발견: "저자원" 언어의 고난

테스트를 실행했을 때, 연구자들은 "고자원" 언어 (영어 등) 와 "저자원" 언어 (트위어나 이그보어 등) 사이에 엄청난 격차가 있음을 발견했습니다.

  • 고자원 학생들: 영어나 중국어에서 이름이나 숫자를 변경했을 때, AI 모델의 점수는 약간 떨어졌지만 대체로 흐름을 유지했습니다. 그들은 실제로 수학 개념을 이해한 학생과 같았습니다.
  • 저자원 학생들: 트위어나 이그보어와 같은 언어로 동일한 셔플 작업을 수행했을 때, AI 모델은 붕괴되었습니다. 점수가 급락했습니다. 마치 선생님이 과일의 이름을 다르게 불렀을 때 학생이 갑자기 세는 법을 잊어버린 것처럼 보였습니다.

비유: 영어로 수학은 훌륭하지만 모국어로는 수학이 매우 나쁜 학생을 상상해 보세요. 선생님이 영어로 꼬인 질문을 하면 학생은 문제를 해결합니다. 하지만 선생님이 학생의 모국어로 정확히 같은 꼬인 질문을 할 때, 학생은 얼어붙습니다. 이 논문은 AI 모델도 똑같은 일을 하고 있음을 발견했습니다: 데이터가 상대적으로 적게 제공된 언어에서는 훨씬 덜 "견고한" (신뢰할 수 있는) 것입니다.

누가 합격하고 누가 불합격했는가?

이 논문은 다양한 AI 모델 (일부는 대형 기술 회사가 만든 것, 일부는 오픈 소스) 을 테스트했습니다.

  • 견고한 모델들: Gemini 3.0 ProGPT-OSS 120B와 같은 새롭고 더 똑똑한 모델들은 변경 사항을 잘 처리했습니다. 숫자나 이름이 바뀌어도 당황하지 않았습니다.
  • 취약한 모델들: Gemma 3 4BLlama 3와 같은 구형 모델이나 작은 모델들은 무너졌습니다. 그들은 "꼬임"을 처리할 수 없었습니다.
  • 크기에 대한 신화: 더 큰 두뇌 (더 많은 파라미터) 가 항상 더 똑똑한 학생을 의미한다고 생각할 수 있습니다. 하지만 이 논문은 이것이 사실이 아니라고 발견했습니다. 때로는 거대한 모델이 처참하게 실패하는 반면, 약간 더 작은 모델은 성공하기도 합니다. 단순히 크기에 관한 문제가 아니라 모델이 어떻게 훈련되었는지에 관한 문제입니다.

교훈: 한 번만 테스트하지 마십시오

가장 중요한 교훈은 앞으로 우리가 AI 를 어떻게 테스트해야 하는지에 관한 것입니다.

현재 많은 리더보드 (최고 AI 순위표) 는 모델에 문제의 단일 버전으로만 테스트합니다. 저자들은 이는 학생에게 연습 문제 하나만 주고 맞히면 천재라고 부르는 것과 같다고 말합니다.

그들의 제안: AI 가 수학에 정말로 능한지 진정으로 알기 위해서는 동일한 문제에 대해 이름과 숫자를 변경한 최소 다섯 가지 버전으로 테스트해야 합니다. AI 가 다섯 개 모두를 맞히면, 그때 비로소 진짜로 똑똑한 것입니다. 만약 첫 번째 문제만 맞힌다면, 그것은 단순히 암기한 것입니다.

요약

이 논문은 쉬운 시험을 통과한다고 해서 AI 를 완벽하게 취급하는 것을 멈춰야 한다고 주장합니다. 다양한 언어의 수학 문제에서 이름과 숫자를 셔플함으로써 그들은 다음과 같은 것을 보여주었습니다:

  1. AI 는 디지털 데이터가 적은 언어에서 훨씬 더 약합니다.
  2. 많은 현재의 순위는 이러한 "셔플"을 테스트하지 않기 때문에 오해의 소지가 있습니다.
  3. AI 의 수학 실력에 대한 진정한 그림을 얻으려면 하나의 문제가 아니라 동일한 문제의 여러 변형으로 테스트해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →