The Effect of Scripts and Formats on LLM Numeracy
이 논문은 거대 언어 모델이 과소 대표된 스크립트나 형식의 수치 표현을 처리할 때 상당한 정확도 저하를 겪는다는 점을 밝히는 동시에, 표적화된 프롬프트 전략이 이러한 격차를 효과적으로 완화할 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
세상의 거의 모든 책을 읽은 천재적인 학생이 있다고 상상해 보세요. 이 학생은 수학의 달인이라서 복잡한 덧셈과 곱셈 문제도 즉각적으로 풀어낼 수 있습니다. 하지만 여기에는 함정이 하나 있습니다. 이 학생은 오직 우리가 영어에서 사용하는 표준 방식(예: 1, 2, 3)으로 쓰인 숫자만을 본 적이 있다는 것입니다.
이 논문은 당신이 이 초천재 학생에게 그들이 잘 접해보지 못한 다른 "언어"나 "스타일"로 쓰인 숫자를 사용하여 수학 문제를 풀도록 요청했을 때 어떤 일이 벌어지는지에 관한 내용입니다.
핵심 발견: "스크립트 세금 (Script Tax)"
연구진은 표준 숫자를 다른 스크립트(예: १, २, ३ (데바나가리) 또는 ۱, ۲, ۳ (페르시아-아랍어))로 바꿨을 때, 학생의 수학 능력이 급격히 떨어지는 것을 발견했습니다.
이렇게 생각해 보세요. 만약 당신이 요리사에게 완벽한 스테이크를 구워달라고 부탁한다면, 그는 아주 쉽게 해낼 것입니다. 하지만 만약 당신이 그에게 읽을 줄 모르는 언어로 된 레시피를 건네주거나, 칼 대신 숟가락으로 양파를 썰라고 말한다면, 그는 재료를 떨어뜨리거나 스테이크를 태워버릴지도 모릅니다. 요리사는 여전히 요리하는 법을 알고 있지만, **형식(format)**이 그를 혼란스럽게 만든 것입니다.
연구진은 이를 **"스크립트 세금(Script Tax)"**이라고 부릅니다. 이는 AI가 다른 형태의 숫자를 보는 것에 대해 지불하게 되는 일종의 페널티입니다. 수학 문제 자체는 동일함에도 불구하고(예: "5 + 5"), 숫자가 표준 영어 스타일이 아닐 경우 AI는 66%에서 87% 더 자주 틀리게 됩니다.
왜 이런 일이 발생할까요?
논문은 두 가지 주요 원인을 지목합니다.
- "훈련 식단 (Training Diet)": AI는 인터넷의 방대한 텍스트를 먹고 자랐습니다. 그 텍스트의 대부분은 표준 영어 숫자를 사용합니다. 이는 마치 학생이 평생 사과만 먹고 자랐는데, 갑자기 배를 주었을 때 어떻게 씹어야 할지 모르는 것과 같습니다.
- "토큰 (Token) 문제": AI는 인간처럼 단어를 읽는 것이 아니라, 텍스트를 "토큰"이라고 불리는 아주 작은 조각들로 나눕니다.
- 표준 숫자(예: 123)는 하나 또는 두 개의 조각이 될 수 있습니다.
- 일부 다른 스크립트는 동일한 숫자를 훨씬 더 많고 혼란스러운 작은 조각들로 나눕니다.
- 논문은 숫자가 더 많은 "조각"으로 나뉠수록 AI가 수학을 수행하기가 더 어려워진다는 것을 발견했습니다. 이는 마치 누군가가 그림을 10개의 큰 조각 대신 100개의 아주 작은 조각으로 잘라놓은 퍼즐을 푸는 것과 같습니다.
좋은 소식: "힌트"로 해결할 수 있습니다
연구진은 단순히 문제점을 찾아내는 데 그치지 않고, 이를 해결할 방법도 찾아냈습니다. 그들은 질문을 던지는 다양한 방식(이를 "프롬프팅"이라고 합니다)을 시도했습니다.
- 그냥 정중하게 묻기: "이것을 풀어주세요." -> 여전히 실패함.
- 언어를 알려주기: "이것은 태국어로 쓰여 있습니다." -> 여전히 실패함.
- 치트 시트 제공 (매핑): AI에게 "이 기호는 1을 의미하고, 저 기호는 2를 의미합니다"와 같은 목록을 보여줌 -> 더 나아졌지만, 완벽하지는 않음.
- 마법의 기술 (Few-Shot Prompting): 이것이 승자였습니다. 연구진은 AI에게 몇 가지 예시를 먼저 보여주었습니다.
- 예시 1: "여기 태국어로 된 문제가 있습니다: 1 + 1 = 2. 여기 정답이 있습니다."
- 예시 2: "또 다른 예시입니다..."
- 이제: "이 문제를 풀어보세요."
이 새로운 숫자 스타일들을 다루는 몇 가지 예시를 AI에게 보여줌으로써, AI의 성능은 급격히 치솟았습니다. 이는 마치 학생에게 실제 시험을 보기 전에 새로운 언어로 된 연습 문제 몇 개를 보여주는 것과 같습니다. 갑자기, 그들은 수학을 완벽하게 해낼 수 있게 되었습니다.
포맷의 반전
논문은 숫자가 어떻게 그룹화되는지도 살펴보았습니다. 미국에서는 큰 숫자를 쓸 때 1,000,000(세 자리마다 쉼표)과 같이 씁니다. 유럽에서는 1.000.000(점)이나 1 000 000(공백)과 같이 쓰기도 합니다.
AI는 이러한 스타일에도 혼란을 느꼈습니다. AI는 미국 스타일은 완벽하게 처리했지만, 유럽 스타일에는 어려움을 겪었습니다. 흥미롭게도, AI는 이러한 숫자 형식을 자신의 훈련 데이터에 흔히 등장하는 IP 주소(예: 192.168.1.1)와 같은 것들과 혼동하곤 했습니다.
결론
이 논문은 AI 모델들이 "수학을 못 하는 것"이 아니라고 결론짓습니다. 그들은 실제로 논리적인 부분에서는 매우 뛰어납니다. 문제는 그들이 매우 **취약하다(fragile)**는 점입니다. 그들은 자신이 배운 특정한, 익숙한 방식으로 숫자를 보는 것에 크게 의존합니다.
만약 당신이 AI에게 다른 언어나 다른 숫자 스타일로 수학을 하도록 시키고 싶다면, 단순히 직접적으로 물어서는 안 됩니다. 먼저 몇 가지 예시를 보여주거나, 기호가 정확히 어떻게 작동하는지 설명해 주어야 합니다. 일단 그렇게 하면, "스크립트 세금"은 사라지고 수학은 다시 쉬워집니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.