Explaining and Tuning Transformer-based LLMs in Arithmetic Tasks with Human Strategies
이 논문은 트랜스포머 기반의 거대 언어 모델이 과업 분해 및 인지적 강화와 같은 인간과 유사한 학습 전략을 채택함으로써 향상된 산술 성능을 달 수 있음을 입증하며, 이는 설명 가능한 AI 검증을 통해 모델의 신뢰성을 높이는 동시에 LLM과 인간 학습자 사이의 공유된 인지 과정을 시사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
똑똑한 로봇과 수학 문제
컴퓨터가 지금까지 쓰인 거의 모든 책, 웹사이트, 대화를 읽는 법을 배웠다고 상상해 보세요. 이것들을 거대 언어 모델(LLM)이라고 부르며, 이들은 이야기를 쓰고, 질문에 답하고, 여러분과 대화할 수 있는 초스마트 로봇과 같습니다. 이들은 '트랜스포머(Transformer)'라고 불리는 특별한 구조를 기반으로 만들어졌는데, 이는 거대한 스포트라이트처럼 작동하여 로봇이 문장에서 가장 중요한 단어들에 동시에 주목할 수 있도록 도와줍니다. 여러분은 언어에 대해 이토록 많은 것을 아는 로봇이라면 수학도 잘할 것이라고 생각할 수도 있습니다. 하지만 여기 반전이 있습니다. 이 로봇들이 언어의 마법사일지는 몰라도, 두 숫자를 더하는 것과 같은 간단한 수학 문제에서는 종종 비틀거리곤 합니다. 이는 마치 아름다운 시를 쓸 줄 알지만, 가게에서 거스름돈을 얼마 받아야 하는지도 계산하지 못하는 사람과 같습니다. 이것은 매우 중요한 문제입니다. 왜냐하면 우리가 이 로로봇들에게 의사를 돕거나 돈을 관리하는 것과 같은 중요한 일을 맡기기를 원한다면, 그들이 기초적인 것을 정확하게 수행할 수 있는지 알아야 하기 때문입니다. 과학자들은 왜 이 똑똑한 로봇들이 단순한 수학에서 실패하는지, 그리고 더 중요한 것은, 어떻게 하면 그들을 더 잘 가르칠 수 있는지 알아내기 위해 노력하고 있습니다.
논문의 이야기: 로봇에게 인간처럼 생각하는 법 가르치기
이 연구에서 연구원들은 수학 문제를 해결해야 할 미스터리처럼 다루기로 했습니다. 그들은 단순히 더 많은 데이터를 로봇에게 던져주고 운 좋게 잘 되기를 바란 것이 아닙니다. 대신, 그들은 매혹적인 질문을 던졌습니다: 이 AI 로봇들은 인간과 같은 방식으로 수학을 배우는가?
이를 알아내기 위해, 그들은 표준적인 "바닐라(vanilla)" 트랜스포머 모델(AI의 기본 버전)을 가져와 정수 산술(정수의 덧셈, 곱셈, 나눗셈)을 가르쳤습니다. 그들은 AI가 단순히 추측하는 것이 아니라, 실제로 학습하고 있지만 연산의 순서와 단계의 복잡함 때문에 어려움을 겪고 있다는 사실을 발견했습니다.
"레고"식 분해
연구원들은 인간이 크고 무서운 수학 문제를 작고 쉬운 단계로 나누는 것처럼, AI도 똑같이 해야 한다는 것을 깨달았습니다. 그들은 과업을 아주 작은 "하위 과업(subtasks)"들로 나누었습니다.
- 덧셈의 경우: 긴 두 숫자를 더한다고 상상해 보세요. 여러분은 전체를 한꺼번에 보지 않습니다. 마지막 자릿수를 더하고, 그다음 자릿수를 더하며, "올림"되는 숫자(예를 들어 1을 올리는 것)를 다음 자리에 넘겨줍니다. 연구원들은 AI가 쉬운 부분(마지막 자릿수 더하기)은 매우 빠르게 배우지만, 그 "올림"된 숫자를 기억하고 다음 단계에서 사용하는 데 혼란을 겪는다는 것을 발견했습니다. 이는 마치 달리기 전에 걷는 법을 배우는 것과 같습니다.
- 곱셈의 경우: 이것은 훨씬 더 까다롭습니다. 큰 숫자를 곱할 때는 여러 번의 작은 곱셈을 수행한 다음 그것들을 모두 더해야 합니다. 논문은 AI가 모든 것을 한꺼번에 처리하려고 하다가 압도당한다는 것을 발견했습니다. 그러나 연구원들이 AI에게 역순으로(reverse order) 답을 쓰도록 가르쳤을 때(사람들이 종이에 적을 때 흔히 하는 것처럼 마지막 자릿수부터 거꾸로 계산하는 방식), 단순한 한 자릿수 곱셈 작업에 대해서는 성능이 크게 향ぎ되었습니다. 하지만 여기에는 함정이 있습니다. 복잡한 다자릿수 곱셈의 경우, 숫자를 뒤집는 것만으로는 문제가 해결되지 않았습니다. 중간 단계들이 단일 레이어 모델이 처리하기에는 너무 어려웠기 때문에 AI는 여전히 고전했습니다.
"인간적인" 기술들
이 논문에서 가장 흥러운 부분은 연구원들이 인간 교사가 학생을 돕기 위해 사용하는 전략들을 테스트했으며, 그것들이 AI에게도 통했다는 점입니다!
- 생각의 사슬 (Chain of Thought, CoT): AI에게 "57257 곱하기 51422는 무엇인가?"라고 묻고 마법 같은 답을 기대하는 대신, 단계별로 풀이 과정을 보여달라고 요청했습니다. 그들은 AI에게 큰 곱셈을 먼저 더 작고 쉬운 곱셈들로 나누라고 말했습니다. 이것은 인간 교사가 학생에게 "당황하지 마, 한 번에 한 단계씩만 해보자"라고 말하는 것과 정확히 일치합니다. AI가 CoT를 역순 숫자 쓰기와 결함하여 사용했을 때, 정확도는 크게 뛰어올랐습니다(약 79%에 도달). 거의 완벽한 점수에 도달하기 위해서, 연구원들은 CoT를 역순 숫자 쓰기와 결합하고 모델을 "더 깊게(deeper)" 만드는 것이 필요하다는 것을 발견했습니다.
- 출력 역순 배치: 언급했듯이, 곱셈의 경우 답을 거꾸로 쓰는 것(일의 자리부터 시작하는 것)이 AI가 올바른 숫자에 집중하도록 도왔지만, 이 기술에는 한계가 있습니다. 단순한 작업에는 효과적이었지만, 복 복잡한 다자릿수 곱셈을 위한 충분한 해결책은 아니었습니다. 흥미롭게도, 나눗셈의 경우 숫자를 역순으로 배치하는 것이 오히려 상황을 악화시켰습니다. 이는 나눗셈 계산이 자연스럽게 높은 자릿수(왼쪽의 큰 숫자들)부터 시작되며, 이것이 인간의 경험과 일치하기 때문입니다. 순서를 뒤집으려는 시도는 모델을 혼란스럽게 만들었습니다.
- 더 깊은 모델 (Deeper Models): 그들은 또한 AI를 "더 깊게" 만드는 것(생각의 층을 추가하는 것)이 나눗셈의 복잡한 중간 단계와 곱셈의 힘든 계산을 처리하는 데 도움이 된다는 것을 발견했습니다. 이것은 모델이 중간 결과값을 놓치지 않고 계속 추적할 수 있는 추가적인 "두뇌 능력"을 제공했습니다.
그들이 발견한 것 (그리고 발견하지 못한 것)
연구원들은 단순히 "작동한다"라고 말하는 데 그치지 않고, 내부를 들여다보며 어떻게 작동하는지 살펴보았습니다. 그들은 "시각화(visualization)" 기법을 사용하여 AI의 어텐션 메커니즘(attention mechanism) 중 어느 부분이 빛나고 있는지 관찰했습니다. 그들은 AI가 특정 "어텐션 헤드(attention heads)"(작은 내부 일꾼들)를 가지고 있으며, 이들이 "기초 곱셈(Base Multiply)"이나 "올림 만들기(Make Carry)"와 같은 특정 업무를 수행하도록 학습되었다는 것을 보았습니다.
- 좋은 소식: AI는 이러한 패턴을 배울 수 있습니다. 적절한 구조(과업을 나누고, CoT를 사용하고, 적절한 경우 숫자를 역순으로 배치하며, 모델의 깊이를 조정하는 것)가 주어지면, AI는 거의 완벽하게 수행합니다.
- 나쁜 소식: 이러한 인간적인 전략 없이는 AI가 고전합니다. 예를 들어, 표준적인 5자리 곱셈 작업에서 기본적인 AI는 겨우 13%만을 맞출 수 있습니다. 하지만 "인간적인" 기술들을 결합하면 100%를 달성합니다.
- 이유: 논문은 AI의 실패가 "멍청해서"가 아니라, 문제가 구성된 방식과 맞지 않는 방식으로 문제를 풀려고 하기 때문이라고 제안합니다. 이는 자동차를 핸들로 조종하는 대신 뒤에서 밀어서 운전하려는 것과 같습니다. 또한, "올바른" 운전 방식은 자동차에 따라 다릅니다. 곱셈의 경우 뒤로 가고 싶을 수 있지만, 나눗셈의 경우 앞으로 가야 합니다.
큰 그림
이 논문은 트랜스포머 기반의 AI 모델들이 인간 학생과 유사한 일부 학습 패턴을 공유할 수 있음을 시사합니다. 둘 다 쉬운 것을 먼저 배우고, 그다음 그것들을 결합하여 더 어려운 문제를 해결합니다. 연구원들은 "설명 가능한 AI(XAI)" 기술을 사용하여 AI가 정확히 어디에서 막히는지 보고 이를 수정할 수 있었습니다.
이 연구는 현재의 AI 모델들이 언어에는 놀라운 능력을 갖추고 있지만, 수학에는 약간의 도움이 필요하다는 결론을 내립니다. 하지만 좋은 소식은 우리가 새로운 종류의 로봇을 발명할 필요는 없다는 것입니다. 우리는 그저 그들에게 인간처럼 생각하는 법을 가르치면 됩니다. 문제를 나누고, 풀이 과정을 보여주고, 생각을 정리하는 법(그리고 언제 순서를 뒤집어야 하고 언제 그러지 말아야 하는지를 아는 법)을 사용하는 데 통해, 우리는 이러한 AI 모델을 훨씬 더 신뢰할 수 있게 만들 수 있습니다. 이는 AI를 더 안전하고 신뢰할 수 있게 만드는 데 있어 큰 진전이며, 특히 수학을 맞히는 것이 성공과 실패를 가르는 중요한 직무에서 매우 중요합니다. 이 논문은 우주의 모든 수학 문제를 해결했다고 주장하는 것이 아닙니다. 다만 명확한 길을 제시하고 있습니다. 만약 우리가 AI를 좋은 선생님이 필요한 학생처럼 대한다면, 우리는 그들이 우리에게 필요한 수학을 할 수 있도록 가르칠 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.