GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models
이 논문은 영어 GSM-Plus 데이터셋에서 파생된 벵골어 수학적 추론을 위한 새로운 섭동 기반 벤치마크인 GSM-Plus-BN을 소개하며, 이를 통해 6개 대규모 언어 모델의 강건성과 추론 능력을 평가하는 동시에 저자원 언어 맥락에 내재된 상당한 성능 격차와 과제를 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 수학 문제를 푸는 법을 가르친다고 상상해 보세요. 단순히 로봇에게 를 계산하라고 요구하는 것이 아니라, 로봇이 정말로 왜 답이 4인지 '이해'하고 있는지, 아니면 그저 ""는 항상 4라는 것을 암기하고 있는 것인지를 알고 싶을 것입니다. 이것이 인공지능 세계의 거대한 질문입니다. 대규모 언어 모델(LLM)—챗봇 뒤에 있는 초지능형 컴퓨터 뇌—은 실제로 '생각'을 하는 것일까요, 아니면 그저 문장에서 다음 단어를 아주 잘 추측하는 것뿐일까요?
이를 알아내기 위해 과학자들은 로봇들에게 수학 문장제 문제로 테스트를 진행해 왔습니다. 하지만 여기 함정이 있습니다. 만약 로봇에게 똑같은 질문을 천 번 던진다면, 로봇은 그 답을 그냥 외워버릴 수도 있습니다. 로봇이 진정으로 똑똑한지 확인하려면, 로봇을 속여야 합니다. 숫자를 바꾸거나, 단어를 교체하거나, 혼란을 주는 추가적인 세부 사항을 더해 로봇이 여전히 정답을 맞히는지 확인해야 합니다. 이것을 "섭동(perturbation)"이라고 부릅니다. 이는 마치 학생에게 "사과 3개가 있는데 1개를 먹으면 몇 개가 남니?"라고 물었다가, 바로 다음 순간 "사과 300개가 있는데 100개를 먹으면 몇 개가 남니?"라고 묻는 것과 같습니다. 똑똑한 학생은 두 문제가 같은 수학적 원리임을 알지만, 첫 번째 답을 암기한 로봇은 혼란에 빠질 수 있습니다.
이제 이 모든 테스트를 로봇들이 가장 많이 학습한 언어인 영어가 아니라, 2억 3천만 명 이상의 사람들이 사용하는 뱅골어로 수행한다고 상상해 보세요. 지금까지는 이 AI 뇌들이 뱅골어로 된 수학적 트릭을 처리할 수 있는지 테스트할 방법이 거의 없었습니다. 이 논문은 그 거대한 공백을 메우기 위해 다음과 같이 질문합니다. 이 AI 모델들은 정말로 뱅골어로 추론할 수 있는 것일까요, 아니면 단어가 바뀌면 비틀거리는 것일까요?
이 연구를 진행한 연구진(방글라데시 대학 팀)은 AI를 위한 거대하고 까다로운 놀이터인 GSM-PLUS-BN을 구축하기로 했습니다. 이것을 뱅골어에 특화된 "수학 장애물 코스"라고 생각하면 됩니다. 그들은 먼저 1,000개의 표준 수학 문제( "시드" 질문)로 시작하여, 영리한 레시피를 사용하여 8,000개의 더 까다로운 새로운 버전들을 만들어냈습니다.
그들은 어떻게 이러한 트릭들을 만들었을까요? 그들은 마술사가 카드 덱에서 카드를 바꾸는 것처럼 여덟 가지 다른 유형의 "왜곡"을 사용했습니다:
- 숫자 변경: "3"을 "4"로 바꾸거나, 작은 숫자를 아주 큰 숫자로 바꾸는 것 (예: 2를 2,000으로 변경).
- 수학적 구조 변경: 문제에 새로운 단계를 추가하거나 질문을 뒤집는 것 (예: "합계는 얼마인가?" 대신 "합계가 X라면, 시작 숫자는 무엇이었는가?"라고 묻기).
- 단어 변경: 문장의 의미는 유지하되 완전히 다르게 들리도록 문장을 다시 쓰는 것.
- "레드 헤링(Red Herring, 엉뚱한 정보)": 질문과 상관없는 정보를 추가하는 것. 예를 들어, 필요한 셔츠의 개수를 묻는 질문에서 셔츠의 가격을 언급하는 식입니다.
- "빠진 조각": 결정적인 정보를 제거하여 로봇이 모른다고 인정하는지, 아니면 그냥 찍어버리는지 확인하는 것.
그들은 여섯 가지 서로 다른 AI 모델을 이 코스에서 테스트했습니다. 어떤 모델은 작고 빠른 것(똑똑한 계산기처럼)이었고, 어떤 모델은 거대하고 복잡한 것(슈퍼컴퓨터 뇌처럼)이었습니다. 그들은 두 가지 방식으로 로봇에게 문제를 풀게 했습니다. 첫째는 직접적인 답만 제시하는 것이고, 둘째는 "단계별로 생각하기"(모델이 풀이 과정을 보여주어야 하는 'Chain-of-Thought' 기법)입니다.
무엇을 발견했을까요?
결과는 "와!" 하는 놀라움과 "어라?" 하는 당혹감이 섞여 있었습니다.
먼저, "단계별로 생각하기" 트릭은 일부 로봇에게는 경이로운 효과를 주었지만, 다른 로bs에게는 역효과를 냈습니다. Qwen3-32B 모델은 수학을 못 하는 학생 같았으나, 선생님이 "풀이 과정을 보여줘!"라고 말하자 갑자기 점수가 13.98%에서 76.25%로 급등했습니다. 이 모델은 지능을 발휘할 잠재력이 있었지만, 이를 끌어낼 데가 필요했던 것입니다.
하지만 가장 거대한 모델들이 반드시 가장 큰 상승폭을 보인 것은 아니었습니다. GPT-OSS-20B(200억 개의 파라미터를 가진 모델)는 추가 도움 없이 표준 질문을 해결하는 데 가장 뛰어났으며, 96.08%의 정답률을 보였습니다. 그러나 "단계별로 생각하기"를 강제하자 오히려 점수가 떨어져 87.80%가 되었습니다. 한편, 거대한 GPT-OSS-120B 모델은 표준 질문에서 88.03%라는 강력한 시작을 보였으나, 역시 풀이 과정을 보여달라는 요청에 약간의 하락을 보였습니다. 이 거대 모델들은 직접 답을 맞히는 데 너무 능숙해서, 추가적인 지침이 오히려 그들을 혼란스럽게 만든 것으로 보입니다.
가장 놀라운 발견은 로봇들이 "비판적 사고" 함정을 얼마나 어려워했는가 하는 점이었습니다. 연구진이 핵심 정보를 제거하고 "이 문제를 풀 수 있나요?"라고 물었을 때, 거의 모든 모델이 처참하게 실패했습니다. 가장 뛰어난 모델조차 정답률이 약 33%에 불과했습니다. 이는 이 AI 모델들이 패턴을 따르는 데는 뛰어나지만, 문제가 해결 불가능하다는 것을 깨닫는 데는 여전히 어려움을 겪고 있음을 시사합니다. 그들은 "정보가 부족합니다"라고 말하는 대신 그냥 답을 찍어버리는 경향이 있습니다.
또 다른 큰 발견은 언어와 상관없이 수학은 여전히 AI에게 어렵다는 점입니다. 최고의 모델들조차 숫자가 쓰인 방식(예: 정수를 분수로 바꾸기)을 바꾸거나 수학적 단계를 추가하는 문제에서 고전했습니다. 이 논문은 이러한 모델들이 텍-트 내의 패턴을 인식하는 데 너무 의존하고 있으며, 머릿속에서 실제 수학 연산을 수행하는 것이 아니라 그럴 가능성이 높다고 제안합니다.
마지막으로, 연구진은 AI 모델들이 영어보다 뱅골어에서 훨씬 더 취약하다는 것을 발견했습니다. 질문이 약간만 바뀌어도 로봇들의 점수는 크게 떨어졌습니다. 이는 AI가 점점 똑똑해지고는 있지만, 인간처럼 뱅골어 같은 언어로 수학을 진정으로 "이해"하기까지는 아직 갈 길이 멀다는 것을 보여줍니다.
요약하자면, 이 논문은 단순히 새로운 테스트를 만든 것이 아닙니다. AI가 수학에 놀라울 정도로 능숙할 수는 있지만, 특히 완벽히 숙달하지 못한 언어에서는 여전히 속임수에 쉽게 혼란을 느낀다는 것을 보여주었습니다. "단계별로 생각하기" 기법은 일부에게는 도움이 되지만, 모든 것을 해결하는 마법 지팡이는 아닙니다. 로봇들은 나아지고 있지만, 아직 궁극의 수학 천재가 되기에는 준비가 덜 된 것 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.