← 최신 논문
💻 computer science

Efficient Multilingual Reasoning Transfer via Progressive Code-Switching

이 논문은 경량화된 번역과 강화 학습을 통해 코드 스위칭(code-switched) 상태에서 완전한 대상 언어 추론 상태로 점진적으로 전환함으로써 기존의 증류 기반 방식이 가진 비용 및 확장성 한계를 극복하고, 영어의 추론 능력을 다른 언어로 전이하는 효율적인 프레임워크인 PCS(Progressive Code-Switching)를 소개한다.

원저자: Zhijun Wang, Junxiao Liu, Hao Zhou, Hao-Ran Wei, Baosong Yang, Shujian Huang

게시일 2026-07-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhijun Wang, Junxiao Liu, Hao Zhou, Hao-Ran Wei, Baosong Yang, Shujian Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 수학 천재인 아주 똑똑한 학생이 한 명 있다고 상상해 보세요. 하지만 이 학생은 오직 영어로만 생각하고 문제를 풀 줄 압니다. 당신은 이 학생에게 일본어를 사용하는 친구를 위해 수학 문제를 풀어달라고 부탁하고 싶지만, 학생에게 일본어로 생각하라고 요구하면 학생은 혼란에 빠지거나 실수를 하거나, 생각하는 도중에 실수로 다시 영어로 돌아가 버립니다.

이것이 현재의 "대규모 추론 모델(Large Reasoning Models)"이 가진 문제입니다. 이 모델들은 영어 수학에는 뛰어나지만, 다른 언어로 된 수학에는 매우 취약합니다.

이 논문은 **PCS(Progressive Code-Switching, 점진적 코드 스위칭)**라는 새로운 훈련 방법을 제안합니다. 이것은 학생이 수학 능력을 잃지 않으면서 새로운 언어로 생각하는 법을 배울 수 있도록 돕는 부드러운 단계별 가교라고 생각하면 됩니다.

작동 방식은 다음과 같습니다. (쉬운 비유를 사용하겠습니다.)

1. 문제점: "강제 전환(Hard Switch)"의 함정

보통, 만약 당신이 학생에게 "지금부터 너는 반드시 오직 일본어로만 생각해야 해"라고 말한다면, 학생은 당황할 것입니다. 학생은 억지로 시도하려 하겠지만, 뇌가 미끄러지거나, 수학 문제를 틀리거나, 같은 단어를 계속 반복하게 될 것입니다. 이것은 마치 새로운 길에서 운전할 때 갑자기 핸들을 90도로 꺾어버리는 것과 같습니다. 사고가 날 가능성이 높죠.

2. 해결책: "이중 언어의 다리(Bilingual Bridge, 코드 스위칭)"

강제로 전환하는 대신, PCS는 다리를 놓습니다. 먼저 학생이 영어와 일본어를 섞어서 생각할 수 있게 해줍니다.

  • 콜드 스타트(The Cold Start): 학생이 수학 문제를 푸는 장면을 상상해 보세요. 학생은 자신이 강점이 있는 영어로 처음 몇 단계를 적습니다. 하지만 논문은 그 단계 중 단 **30%**만을 일본어로 번역하라고 지시합니다.
  • 결과: 학생은 익숙한 영어 논리에 일본어 단어들이 섞이는 것에 익м 익숙해집니다. 이는 무섭게 느껴지는 것이 아니라 자연스럽게 느껴집니다.

3. 훈련 방식: "점진적인 등반(Gradual Hike, 점진적 커리큘럼)"

이것이 핵심 비법입니다. 훈련은 영원히 30%의 일본어 비율에 머물러 있지 않습니다. 이것은 등산객이 강해질 때만 더 가팔라지는 등산로처럼 작동합니다.

  • 1단계: 학생은 30%의 일본어 단계로 문제를 풉니다.
  • 2단계: 학생이 그것에 익숙해지면, 선생님이 말합니다. "좋아, 이제 일본어 단계를 50%로 해보자."
  • 3단계: 그다음은 70%, 그다음은 90%, 마침 finally, 학생은 100% 일본어로 생각하게 됩니다.

학생은 영어로 수학적 논리를 먼저 배웠기 때문에, 생각의 언어를 천천히 번역해 나가는 과정에서 수학 문제를 푸는 능력을 결코 잃지 않습니다. 그저 생각의 "억양"을 바꿀 뿐입니다.

4. 보상 시스템: "엄격하지만 공정한 코치"

AI는 보상 시스템(비디오 게임 점수와 같은)을 사용하여 훈련됩니다.

  • 목표: 정답을 맞히는 것(정확도)과 올-바른 언어를 사용하는 것(일관성)입니다.
  • 기술: 만약 AI가 '언어 감지기'를 속이기 위해 긴 문장 안에 영어 블록을 크게 집어넣는 식으로 속임수를 쓰려고 한다면, 시스템이 이를 잡아냅니다.
  • 차이점: 다른 방법들은 AI가 단순히 올바른 언어를 사용하는 것처럼 "보이도록" 보상하려고 했고, 이는 "보상 해킹(reward hacking, AI가 겉모습만 흉내 내는 것)"으로 이어졌습니다. PCS는 AI가 실제로 모든 단계의 언어를 점진적으로 전환하도록 강제하여, AI가 속임수를 쓸 수 없게 만듭니다.

5. 결과: 진정한 다국어 천재

이 논문은 다섯 가지 언어(프랑스어, 포르투갈어, 일본어, 한국어, 태국어)를 사용하여 수학 문제를 테스트했습니다.

  • 기존 방법들: AI가 수학은 맞혔지만 영어로 말하거나, 혹은 언어는 맞혔지만 수학을 틀리는 경우가 있었습니다.
  • PCS 방법: AI는 수학 문제를 맞혔을 뿐만 아니라, 목표 언어를 완벽하게 구사했습니다. 이 방법은 영어 성능과 다른 언어 간의 격차를 거의 완전히 좁혔습니다.

요약

PCS를 아이에게 수영을 가르치는 과정이라고 생각하세요.

  • 기존 방식: 아이를 깊은 물에 던지며 "수영해!"라고 말하는 것입니다. (아이는 가라앉거나 패닉에 빠집니다.)
  • PCS 방식: 얕은 물에서 부표(영어 + 목표 언어)와 함께 시작합니다. 아이가 강해짐에 따라, 부표를 단계적으로 하나씩 제거하여 아이가 깊은 물(목able 언어만 사용)에서도 절대 익사하지 않고 완벽하게 수영할 수 있게 만듭니다.

이 논문은 이 방법이 모든 답을 채점할 "슈퍼 선생님" AI를 필요로 하지 않고, 단지 간단한 번역기와 스마트한 점진적 훈련 일정만 있으면 되기 때문에 이전 방법들보다 더 저렴하고 쉽다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →