← 최신 논문
💬 NLP

AdaMame: A Training Recipe for Adaptive Multilingual Reasoning

이 논문은 대규모 추론 모델(Large Reasoning Models)이 정확도나 토큰 효율성을 희생하지 않으면서도 언어 붕괴 현상을 극복하고 질의의 언어로 추론할 수 있도록, 지도 미세 조정(supervised fine-tuning)과 새로운 적응형 GRPO 알고리즘(AdaMame-GRPO)을 결합한 2단계 학습 레시피인 AdaMame을 소개한다.

원저자: Dayeon Ki, Kevin Duh, Marine Carpuat

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dayeon Ki, Kevin Duh, Marine Carpuat

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게는 **아다(Ada)**라는 아주 똑똑하고 다국어를 구사하는 학생이 있다고 상상해 보세요. 아다는 수학 문제를 푸는 데 매우 뛰어나지만, 나쁜 습 습관이 하나 있습니다. 어떤 언어(프랑스어, 텔루구어, 태국어 등)로 질문을 하더라도, 아다는 반드시 영어로 생각하고 답변하려고 고집을 피웁니다.

이것은 **"언어 붕괴(language collapse)"**라고 불리는 문제입니다. 심지어 "한 다스에 달걀이 몇 개 들어 있나요?"라고 프랑스어로 물어도, 아다는 *"좋아, 영어로 계산해 보자... 12개"*라고 생각한 뒤, 그 답을 번역해서 내놓을 뿐입니다. 그녀는 질문받은 언어로 실제로 '생각'하는 것이 아닙니다.

기존의 해결 시도들은 마치 "프랑스어로 말하지 않으면 0점이야!"라고 외치는 엄격한 선생님과 같습니다. 이는 아다가 프랑스어를 말하도록 강요하지만, 종종 그녀를 긴장하게 만듭니다. 이 때문에 아다는 말을 더듬거나(프랑스어와 영어를 문장 중간에 섞어서 사용함), 언어 규칙에 너무 집중한 나머지 오답을 내거나, 자신이 노력하고 있다는 것을 증명하기 위해 너무 길게 말하기도 합니다.

**아다메이메(AdaMame)**는 아다의 이런 나쁜 습관을 그녀를 긴장시키거나 느리게 만들지 않고 해결하기 위해 설계된 더 스마트한 훈련 레시피입니다. 작동 방식은 다음과 같습니다.

2단계 훈련 레시피

저자들은 아다를 코치가 올림픽 선수를 준비시키는 것처럼 2단계 과정으로 훈련시켰습니다.

1단계: "몰입 캠프" (SFT)
먼저, 아다를 5가지 다른 언어(프랑스어, 포르투갈어, 일본어, 한국어, 태국어)의 원어민들과만 상호작용하는 캠프에 넣었습니다.

  • 수행 내용: 그녀에게 사고 과정(즉, "생각")이 이미 해당 현지 언어로 완벽하게 작성된 수천 개의 수학 문제를 보여주었습니다.
  • 결과: 아다는 이 언어들로 수학 문제를 푸는 것이 가능하다는 것을 배웠습니다. 그녀는 즉시 영어로 기본 설정하는 습관을 멈췄습니다. 하지만 연습하지 않은 언어(예: 스와힐리어 또는 벵골어)를 접했을 때는 여전히 다소 불안정한 모습을 보였습니다.

2단계: "스마트 코치" (AdaMame-GRPO)
이 부분이 마법 같은 부분입니다. 두 번째 단계에서 그들은 AdaMame-GRPO라고 불리는 특별한 훈련 방법을 사용했습니다.

  • 기존 코치의 문제점: 이전의 방법들은 아다가 정답을 맞히면서 동시에 올바른 언어를 사용했을 때만 보상을 주었습니다. 이것은 마치 "전부 아니면 전무(all-or-nothing)" 식의 스위치와 같았습니다. 만약 아다가 답은 맞혔지만 영어로 말했다면, 보상을 전혀 받지 못했습니다. 이로 인해 아다는 실험적인 시도를 하는 것을 두려워하게 되었습니다.
  • AdaMame의 해결책: 새로운 코치는 점진적 성장 전략을 사용합니다.
    • 훈련 초기: 코치는 관대합니다. "헤이, 일단 문제를 풀어봐! 지금은 네가 영어로 생각하든 프랑스어로 생각하든 상관없어. 그냥 수학 문제를 맞히는 게 중요해." 이를 통해 아다는 탐색하며 문제를 푸는 최선의 방법을 찾을 수 있습니다.
    • 훈련 후기: 훈련이 진행됨에 따라, 코치는 언어 규칙의 볼륨을 서서히 높입니다. "좋아, 이제 수학은 잘하는구나. 이제 너는 사용자가 요청한 언어로 반드시 생각해야 해."
    • 비유: 아이에게 자전거 타기를 가르치는 것을 상상해 보세요. 처음에는 아이가 비틀거리고 넘어지도록 내버려 둡니다(탐색). 일단 아이가 안정되면, 자전거 도로 안에 머물도록 부드럽게 안내합니다(정렬). 처음부터 "도로 안에 있어!"라고 소리치면 아이는 사고가 날 것입니다.

이것이 왜 중요한가

논문은 이 새로운 방법이 기존 방법들과 비교하여 세 가지 주요 승리를 거두었다고 테스트 결과를 밝혔습니다.

  1. "코드 스위칭(언어 교체)" 제거: 아다는 문장 중간에 언어를 바꾸는 짜증 나는 습관(예: 프랑스어로 생각을 시작했다가 영어로 끝내는 것)을 멈췄습니다. 이제 그녀는 일관성을 유지합니다.
  2. "과잉 사고" 방지: 기존 방법들은 아다가 노력하고 있다는 것을 증명하기 위해 말을 길게 늘어지게 만들었습니다. AdaMame은 그녀를 효율적으로 만들었습니다. 그녀는 동일한 결과를 얻기 위해 더 적은 단어(토큰)를 사용합니다.
  3. "언더독(Underdog)" 효과: 가장 큰 개선은 저자원 언어(텔루구어나 스와힐리어처럼 데이터가 적은 언어)에서 나타났습니다. 다른 방법들이 어려움을 겪는 동안, AdaMame은 아다가 놀라울 정도로 잘 수행하도록 도와주어, 주요 언어뿐만 아니라 모두에게 기술이 더 공정하게 작용하도록 만들었습니다.

핵심 요약

논문은 AdaMame이 다음과 같은 모델을 만든다고 주장합니다:

  • 정확함: 수학 문제를 정확히 맞힙니다.
  • 충실함: 요청한 언어로 생각합니다.
  • 효율적임: 시간이나 단어를 낭비하지 않습니다.

이 모델은 저자들이 **"파레토 최적 성능(Pareto-optimal performance)"**이라고 부르는 것을 달 achieves 하는데, 이는 "하나를 희생하면서 다른 것을 얻는 것이 아니라, 세 가지 목표 사이의 최적의 균형을 찾았다"는 뜻의 전문 용어입니다. 이는 마치 빠르면서도 안전하고, 연료 효율까지 좋은 자동차를 얻는 것과 같습니다. 반면 기존 모델들은 대개 빠르지만 안전하지 않거나, 안전하지만 느렸습니다.

저자들은 다른 사람들이 영어에 의존하는 기본 사고 언어 없이도, 특히 수학적 추론을 위한 더 나은 다국어 AI를 구축할 수 있도록 이 "훈련 레시 recipe"와 데이터를 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →