MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese
본 논문은 유럽 및 브라질 포르투갈어 native 대회와 시험에서 발췌한 1,729 개의 수학 문제로 구성된 새로운 벤치마크 데이터셋인 Math-PT 를 소개하며, 최첨단 LLM 은 객관식 문제에서는 잘 수행하지만 시각적 및 서술형 과제에서는 그 능력이 저하됨을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대 언어 모델 (LLM) 이 전 세계 도서관의 거의 모든 책을 읽은 천재 학생들처럼 상상해 보세요. 수년 동안 우리는 영어로만 작성된 시험을 통해 그들의 수학 실력을 테스트해 왔습니다. 이는 마치 학생에게 영어로만 운전 면허 시험을 보게 한 뒤, 그 한 가지 시험에 합격했다는 이유만으로 그들이 어떤 언어로도 완벽하게 운전할 수 있다고 가정하는 것과 같습니다.
MATH-PT라는 논문은 이러한 접근 방식에 거대한 맹점이 있다고 주장합니다. 이 논문은 AI 학생들이 언어가 바뀔 때 실제로 수학을 처리할 수 있는지 확인하기 위해 포르투갈어(유럽식과 브라질식 모두) 로 특별히 작성된 새로운 '운전 시험'을 도입합니다.
간단한 비유를 통해 그들의 발견 사항을 정리해 보겠습니다:
1. 문제: '영어만' 도서관
대부분의 수학 벤치마크 (MATH 나 MathVista 등) 는 모든 책이 영어로 된 도서관과 같습니다. 연구자들이 다른 언어를 테스트하려고 시도할 때조차도, 그들은 단순히 영어 책을 번역할 뿐입니다. 저자들은 이것이 불공평하다고 말합니다. 왜냐하면 이것이 AI 가 수학 개념을 진정으로 이해하는지, 아니면 단순히 영어 패턴을 암기하고 있는지를 알려주지 않기 때문입니다. 그들은 포르투갈과 브라질의 실제 수학 올림피아드 및 학교 시험에서 가져온, 포르투갈어로 태어난 수학 문제들의 도서관을 구축하고자 했습니다.
2. 새로운 시험: MATH-PT
이 팀은 1,729 개의 문제로 구성된 MATH-PT라는 데이터셋을 만들었습니다.
- 출처: 그들은 단순히 번역한 것이 아니라, Olimpíadas Portuguesas da Matemática와 브라질의 OBMEP와 같은 대회들의 원본 아카이브를 파헤쳤습니다.
- 다양성: 이 시험은 5 학년 퍼즐부터 대학 진학 전의 도전 과제까지 모든 것을 다룹니다.
- 형식: 객관식 문제 (버블 시트와 같은) 와 주관식 문제 (답을 처음부터 작성해야 하는) 가 포함됩니다. 중요한 점은 많은 질문에 도식과 그림(기하학적 도형 등) 이 포함되어 있으며, 팀은 AI 가 이를 '볼' 수 있도록 코드를 사용하여 신중하게 보존했다는 것입니다.
3. 결과: '똑똑한' 대 '부진한'
그들은 최강의 '프런티어' 모델 (초고수) 에서부터 작은 오픈소스 모델 (평균 학생) 에 이르기까지 13 개의 서로 다른 AI 모델을 테스트했습니다.
- 객관식 이점: 객관식 문제를 '차이 찾기' 게임이라고 생각해 보세요. AI 모델들은 이에 매우 능했습니다. 작은 모델들조차도 종종 정답인 알파벳 (A, B, C, D, 또는 E) 을 맞출 수 있었습니다.
- 주관식 부진: 시험이 AI 가 스스로 답을 생성해야 하는 주관식 문제로 바뀌자 점수는 크게 떨어졌습니다. 이는 줄서기에서 얼굴을 인식하는 것과 기억에서 그 얼굴을 그려내는 것의 차이와 같습니다. AI 는 단순히 하나를 고르는 것이 아니라 스스로 '생각'하고 답을 작성해야 할 때 더 어려움을 겪었습니다.
- '그림' 문제: 이것이 가장 큰 장애물이었습니다. 질문에 도식 (그림) 이 포함되면 AI 의 성능이 급격히 떨어졌습니다. 가장 똑똑한 모델들조차 텍스트와 함께 시각적 도형을 해석해야 할 때 혼란을 겪었습니다. 이는 학생에게 눈가리개를 하고 기하학 문제를 풀게 하는 것과 같습니다. 그들은 글자는 읽을 수 있지만, 도형을 '볼' 수는 없습니다.
4. 승자와 패자
- 챔피언: '프런티어' 모델 (GPT-5 와 Qwen3-235B 등) 이 명확한 승자들이었습니다. 그들은 특히 객관식 문제를 잘 처리하며 포르투갈어 수학을 잘 다뤘습니다.
- 부진한 이들: 작은 오픈소스 모델 (Llama-3 와 Gemma-3 등) 은 수학을 훨씬 더 어렵게 느꼈습니다. 질문이 어려워지거나 그림이 포함되면 정확도가 급격히 떨어졌습니다.
- 확장 효과: 논문은 Qwen 계열 모델의 경우 모델을 더 크게 만드는 것 (더 많은 '두뇌 능력' 추가) 이 큰 도움이 된다고 발견했습니다. 이는 자전거에서 스포츠카로 업그레이드하는 것과 같습니다. 더 큰 모델들은 작은 모델들보다 복잡한 추론 작업을 훨씬 잘 처리했습니다.
결론
이 논문은 AI 가 수학에 매우 능숙해지고 있지만, 여전히 '언어 편향'이 있으며 시험이 어려워지거나 (주관식) 시각적 요소 (도식) 가 포함될 때 어려움을 겪는다고 결론 내립니다. 이 포르투갈어 데이터셋을 공개함으로써 저자들은 연구자들에게 영어가 아닌 다른 언어에서 AI 가 실제로 얼마나 잘 생각하는지 측정할 수 있는 더 공정하고 새로운 자를 건네고 있습니다. 그들은 AI 가 아직 완벽하다고 말하지 않습니다. 대신, "여기 AI 가 여전히 배우고 있는 부분을 정확히 보여줄 새로운 시험이 있습니다"라고 말하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.