← 최신 논문
💬 NLP

M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models

이 논문은 캥거루 수학 경시 대회에서 유도된 최초의 대규모 다국어, 다중 모달 수학적 추론 데이터셋인 M3Kang을 소개하며, 이는 108개 언어에 걸쳐 최첨단 시각-언어 모델을 인간의 성능과 비교 벤치마킹하고 기초 수학 및 도표 기반 추론에서의 현재 한계를 드러낸다.

원저자: Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, Jordi Ros-Giralt

게시일 2026-01-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, Jordi Ros-Giralt

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

전 세계적인 거대 수학 경진 대회인 "캥거루 수학 경시 대회(Kangaroo Math Competition)"를 상상해 보세요. 매년 90개국 이상의 18세 미만 어린이 600만 명 이상이 이 대회에 참여합니다. 이들은 까다로운 수학 퍼즐을 해결하는데, 어떤 문제는 단순히 글자로만 되어 있지만, 많은 문제는 답을 찾기 위해 도표, 도형, 그림을 살펴봐야 합니다.

이제 Qualcomm AI Research의 연구진이 이 수학 경진 대회를 인공지능을 위한 거대한 테스트로 바꾸기로 결정했다고 상상해 보세요. 그들은 M3Kang이라는 새로운 도구를 만들었습니다. M3Kang은 일종의 "만능 번역기이자 수학 선생님"이 결합된 데이터셋이라고 생각하면 됩니다.

다음은 그들이 수행한 작업과 발견한 내용에 대한 간단한 요약입니다.

1. 거대한 프로젝트: 궁극의 수학 테스트 구축

연구진은 원래의 수학 문제들(주로 카탈루냐어와 영어로 작성됨)을 가져와 108개의 다양한 언어로 번역했습니다.

  • 규모: 그들은 단순히 단어를 번역한 것이 아니라, 질문에 붙어 있는 그림과 도표도 그대로 유지했습니다. 그 결과 111,000개 이상의 고유한 수학 문제가 만들어졌습니다.
  • 목표: 연구진은 AI 모델(챗봇이나 이미지 생성기의 "두뇌")이 영어 이외의 언어로 된 수학 문제를 풀 수 있는지, 그리고 단순히 텍스트를 읽는 것을 넘어 실제로 도표를 "보고" 이해할 수 있는지 확인하고 싶었습니다.

2. 구축 방법 (조립 라인)

이 정도 규모의 데이터셋을 만드는 것은 공장의 조립 라인을 구축하는 것과 같습니다.

  • 1단계: 원래의 PDF 파일을 깨끗한 텍스트가 포함된 이미지로 변환했습니다.
  • 2단계: AI를 사용하여 질문을 영어로 먼저 번역한 후, 번역 과정에서 수학적 논리가 깨지지 않았는지 이중으로 확인했습니다.
  • 3단계: 다른 108개 언어를 확인하기 위해 영리한 "역번역(back-translation)" 기술을 사용했습니다. 스페인어를 영어로 번역한 다음, 즉시 다시 스페인어로 번역하는 상황을 상상해 보세요. 만약 결과가 원래 문장과 달라 보인다면 그 번역은 잘못된 것입니다. 그들은 이 방법을 사용하여 잘못된 번역을 자동으로 걸러냈습니다.

3. 결과: AI는 어떻게 했는가?

그들은 사용 가능한 가장 똑똑한 AI 모델들(무료/오픈 소스 모델과 유료/폐쇄형 모델 모두)을 이 새로운 테스트로 시험했습니다. 여기서 그들은 다음과 같은 사실을 발견했습니다.

  • "영어의 이점"은 실재한다: 영어로만 공부한 학생이 프랑스 교실에서 어려움을 겪을 수 있는 것처럼, AI 모델들도 영어로 된 수학 문제를 훨씬 더 잘 풀었습니다. 인터넷상에서 해당 언어의 비중이 낮아질수록(예: 스와힐리어 또는 몰타어), AI의 성능은 현저히 떨어졌습니다. 마치 언어가 바뀌자 AI가 수학을 하는 법을 잊어버린 것과 같습니다.
  • 크기가 중요하다 (하지만 모든 것에 해당되지는 않는다): 더 큰 AI 모델일수록 일반적으로 더 뛰어난 성적을 냈습니다. 하지만 아무리 크고 똑똑한 모델이라도 기본적인 논리와 도표 앞에서는 고전했습니다.
  • "맹점" 문제: 이것이 가장 놀라운 발견이었습니다. 인간이 이 테스트를 치를 때는 그림이 있는 문제가 글자로만 된 문제보다 더 쉽다고 느낍니다. 하지만 AI에게는 정반대였습니다! AI 모델들은 그림이 개입될 때 성능이 눈에 띄게 저하되었습니다. 이는 마치 글자로 된 문제를 잘 풀다가 그래프를 봐야 하는 순간 얼어붙는 학생과 같습니다. AI는 텍스트와 이미지 사이의 점들을 연결하는 데 어려움을 겪는 듯 보입니다.
  • AI vs 인간: 그들은 AI의 점수를 68,000명의 실제 학생들의 점수와 비교했습니다.
    • 가장 뛰어난 AI(Gemini-2.5-Pro)는 영어에서는 최상위권 학생 수준의 성적을 보였지만, 자원이 부족한 언어에서는 "평균" 또는 "평균 이하" 수준으로 성적이 떨어졌습니다.
    • 흥 nghiệm스럽게도, AI는 수학이 어려워짐에 따라 인간과 같은 방식으로 더 나아지지 않았습니다. 때때로 AI는 가장 어려운 문제를 완벽히 풀어내면서도 쉬운 문제에서 틀리기도 했는데, 이는 AI가 "추측"을 하거나 인간 아이와는 다른 종류의 추론 방식을 사용하고 있음을 시사합니다.

4. 해결할 수 있을까?

연구진은 AI가 다른 언어를 더 잘 말할 수 있도록 돕기 위해 몇 가지 "훈련 기술"을 시도했습니다.

  • "번역가" 기술: 만약 AI에게 "먼저 이 질문을 머릿속으로 영어로 번역하고, 문제를 푼 다음, 답을 내라"고 지시하면, AI가 다른 언어로 된 문제를 훨씬 더 잘 푼다는 것을 발견했습니다. 이는 마치 학생에게 시험 직전에 사전 하나를 쥐여주는 것과 같습니다.
  • "스티어링(Steering)" 기술: AI의 내부 사고 과정을 다른 언어로 말할 때도 "영어와 유사하게" 움직이도록 유도하는 실험을 했습니다. 이는 약간의 도움이 되었지만, "번역가" 기술이 승자였습니다.

핵심 요약

이 논문은 AI가 믿기지 않을 정도로 똑똑해지고 있지만, 여전히 중대한 사각지대를 가지고 있다고 결론짓습니다. 즉, 다양한 언어에 걸쳐 읽기, 보기, 그리고 생각하기를 결합하는 데 어려움을 겪는다는 것입니다.

연구진은 다른 과학자들이 이 "캥거루 테스트"를 사용하여, 단순히 영어를 말하는 것을 넘어 어떤 언어로든, 그림이 있든 없든 수학을 할 수 있는 더 포용적인 AI를 만들 수 있도록 모든 데이터와 코드를 공개(오픈 소스)했습니다. 그들은 이것이 진정으로 글로벌하고 모두에게 공정한 AI를 만드는 데 도움이 되기를 바랍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →