← 최신 논문
💬 NLP

mmPISA-bench: Do LLMs Reason Equally Well Across 43 Languages?

이 논문은 43개 언어에 걸친 PISA로부터 파생된 다국어 추론 벤치마크인 mmPISA-bench를 소개하며, 현대의 거대언어모델(LLM)이 기계 번역으로 인한 성능 저하가 최소화된 상태에서 인간과 비교 가능한 수준의 추론 성능을 달성함을 입증하는 동시에, 언어에 따라 정확도와 추론 비용에서 상당한 차이가 있음을 밝히고 있다.

원저자: Yerzhan Sapenov, Jaromir Savelka

게시일 2026-06-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yerzhan Sapenov, Jaromir Savelka

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 거의 모든 언어를 말할 수 있는 아주 똑똑한 학생이 있다고 상상해 보세요. 당신은 알고 싶습니다: 이 학생이 프랑스어로 시험을 볼 때도 영어로 시험을 볼 때만큼 똑똑한가요? 혹은, 만약 그 학생이 모르는 언어(하지만 로봇이 번역한 것)로 된 시험지를 준다면, 여전히 정답을 맞힐 수 있을까요?

mmPISA-bench라고 불리는 이 논문은 세계에서 가장 진보된 두 AI "학생"(구체적으로 OpenAI와 Anthropic의 모델들)에 대한 거대한 다국어 성적표와 같습니다. 여기 그들이 발견한 내용을 일상적인 비유를 사용하여 정리했습니다.

1. 시험: 글로벌 수학 및 독해 시험

연구진은 단순히 무작위 질문을 만든 것이 아닙니다. 그들은 전 세계 15세 학생들이 수학 문제를 풀고 독해 지문을 이해할 수 있는지 증명하기 위해 치르는 유명한 국제 시험인 PISA 시험에서 25개의 실제 문항을 가져왔습니다.

  • 설정: 그들은 이 25개 문항을 43개의 서로 다른 언어로 번역했습니다.
  • 반전: 모든 언어에 대해 두 가지 버전을 준비했습니다:
    1. "공식" 버전: 전문 번역가와 같은 인간 전문가가 번역한 것.
    2. "로봇" 버전: 구글 번역기(기계 번역)가 번역한 것.
  • 목표: AI가 이 43개 언어로 된 논리 퍼즐을 해결할 수 있는지, 그리고 번역을 사람이 했는지 로봇이 했는지가 중요한지를 확인하는 것입니다.

2. 결과: AI 학생들은 어디서나 똑같이 똑똑한가?

좋은 소식: 네, 대체로 그렇습니다.
AI 모델들은 43개 언어 전반에서 매우 우수한 성능을 보였습니다. 실제로 그들의 정확도는 똑똑한 15세 인간 학생에게 기대할 수 있는 수준과 비슷했습니다. 아이슬란드어나 태국어로 문제가 나왔다고 해서 갑자기 수학을 하는 법을 "까먹지는" 않았습니다.

함정: 완벽하게 평등하지는 않았습니다.

  • "방언" 효과: 인간이 제2외국어로 이야기를 읽을 때 모국어로 읽을 때보다 약간 더 어려움을 느낄 수 있듯이, AI도 특정 언어에서는 다른 언어보다 약간 더 높은 정확도를 보였습니다.
  • "로봇" 번역의 신화: 여러분은 "질문이 로봇에 의해 번역되면 AI가 혼란스러워할 것"이라고 생각할 수 있습니다. 하지만 논문은 아니라고 말합니다. AI는 "사람" 번역본을 사용했을 때만큼이나 "로봇" 번역본으로도 정답을 똑같이 잘 맞혔습니다. 이는 새로운 언어로 AI를 테스트할 때 반드시 비싼 인간 번역가가 필요하지는 않다는 것을 의미하며, 훌륭한 기계 번역기만으로도 충분하다는 점에서 큰 의미가 있습니다.

3. 숨겨진 비용: "생각"의 가격표

이 부분이 이 논문에서 정말 흥eli로운 지점입니다. 단순히 정답을 맞히는 것만이 문제가 아닙니다. 그 정답에 도달하기 위해 얼마나 많은 비용이 드는가가 중요합니다.

두 명의 학생이 시험을 치르는 상황을 상상해 보세요:

  • 학생 A (Claude): 모든 정답에 대해 매우 길고 상세한 설명을 씁니다.
  • 학생 B (GPT): 짧은 설명을 씁니다.

연구진은 어떤 언어에서는 AI가 정답을 맞히기 위해 훨씬 더 많이 "생각해야" 했다(더 많은 텍스트를 생성해야 했다)는 사실을 발견했습니다. 이는 테스트를 실행하는 데 더 많은 비용이 들게 만들었습니다.

  • "비싸고 서툰" 언어들: 특정 언어들(한 모델에게는 태국어, 다른 모델에게는 그리스어 등)의 경우, AI가 간단한 문제를 풀기 위해 엄청난 양의 텍스트를 생성해야 했습니다. 이는 마치 동네 편의점에 가기 위해 럭셔리 택시를 타는 것과 같았습니다.
  • 결과: 이러한 "비싼" 언어들에서 AI는 실제로 정확도는 떨어지면서 비용은 더 많이 드는 현상을 보였습니다. 즉, 돈은 더 쓰는데 결과는 더 나쁜 '이중고'를 겪은 것입니다.

4. 비밀스러운 언어 전환

연구진은 AI가 어떻게 생각하고 있는지 내부를 들여다보았습니다. 그리고 놀라운 사실을 발견했습니다:

  • 때때로 AI에게 카자흐어로 질문을 하면, AI는 단순히 카자흐어나 영어로 생각하는 것이 아니었습니다. AI는 카자흐어로 답을 내놓기 전에 실제로 러시아어로 수학과 논리를 풀기 시작했습니다.
  • 이는 어떤 사람이 스페인어와 영어를 모두 구사하지만, 어려운 수학 문제를 풀 때 자신의 "수학적 뇌"가 존재하는 프랑스어로 본능적으로 생각을 전환하는 것과 같습니다. AI도 이와 유사하게, 문제를 해결하기 위해 "피벗 언어(매개 언어)"를 사용하고 있었습니다.

요약: 이것이 의미하는 바는 무엇인가?

  • AI는 언어에 능숙해지고 있습니다: 현대의 AI는 43개의 다양한 언어로 논리 퍼즐을 풀어내는 능력이 인간 십 대와 거의 비슷할 정도로 뛰어납니다.
  • 기계 번역은 괜찮습니다: AI를 테스트하기 위해 완벽한 인간 번역이 필요한 것은 아닙니다. 로봇 번역도 충분히 잘 작동합니다.
  • 언어는 비용에 영향을 미칩니다: 어떤 언어들은 AI가 처리하기에 더 "어렵습니다". 이러한 언어들은 AI를 더 많이 말하게 만들어(비용 증가) 때로는 더 많은 실수를 유발하기도 합니다.
  • 더 깊이 들여다봐야 합니다: AI가 얼마나 뛰어난지 진정으로 이해하려면 단순히 최종 점수만 봐서는 안 됩니다. 그 점수를 얻기 위해 얼마나 많은 "노력"(그리고 돈)이 들었는지, 그리고 AI가 비밀리에 어떤 언어로 생각하고 있었는지를 함께 살펴봐야 합니다.

요약하자면, AI는 다국어 천재이지만, 여전히 조금씩 비틀거리거나 일을 완수하기 위해 용돈을 훨씬 더 많이 써야 하는 "방언" 영역이 존재합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →