← 최신 논문
💬 NLP

Rethinking the Multilingual Reasoning Gap with Layer Swap

본 논문은 동등한 감독 하에 사용할 때 다국어 대형 언어 모델에서 모국어 추론과 영어 중심 추론 간의 성능 격차가 이전까지 생각했던 것보다 현저히 작음을 입증하고, 영어 추론 능력을 중간 계층에서 모국어 전문 계층으로 이전하여 체인 오브 씽킹 생성 시 목표 언어를 유지하면서 해당 격차를 효과적으로 해소하는'레이어 스왑'기법을 제안한다.

원저자: Maxence Lasbordes, Amélie Chatelain, Djamé Seddah

게시일 2026-05-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Maxence Lasbordes, Amélie Chatelain, Djamé Seddah

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 간단한 언어와 일상적인 비유를 사용하여 설명합니다.

큰 문제: "영어 중개인"

당신이 다재다능한 천재 학생 (AI) 에게 프랑스어로 복잡한 수학 문제를 물어본다고 상상해 보세요. 비록 프랑스어로 질문했더라도, 그 학생은 본능적으로 머릿속에서 "영어로 '흠, 이걸 풀어보자...'라고 생각하기 시작합니다." 그들은 모든 어려운 추론을 영어로 수행한 뒤, 최종 답변만 프랑스어로 전환합니다.

이를 **영어 중심 추론 (English-pivoted reasoning)**이라고 부릅니다. 이는 잘 작동하지만 단점이 있습니다:

  1. 번역 실수: 오가는 과정에서 학생이 작은 번역 실수를 하면, 최종 답변이 틀릴 수 있습니다.
  2. 이해하기 어려움: 영어를 구사하지 못한다면, 그들의 "사고 과정" (Chain-of-Thought) 이 당신이 모르는 언어로 이루어졌기 때문에 그들이 문제를 어떻게 풀었는지 볼 수 없습니다.

연구자들은 학생에게 프랑스어로만 생각하도록 강요했습니다 (원어민 추론, Native Reasoning). 그러나 이전 연구들에 따르면, 이렇게 했을 때 학생들의 문제 해결 능력이 현저히 떨어졌습니다. 마치 프랑스 요리를 프랑스어 레시피만으로 요리하도록 마스터 셰프에게 강요했지만, 그들이 영어 단위를 사용하길惯했기 때문에 재료를 계속 헷갈리게 만든 것과 같았습니다.

새로운 실험: 더 공정한 테스트

이 논문의 저자들은 "원어민 추론" 간의 격차가 실제 것인지, 아니면 단순히 학생들의 훈련이 부족해서인지 확인하고 싶었습니다. 그들은 대규모이고 공정한 실험을 수행하기로 결정했습니다:

  • 학생들: 그들은 똑똑한 기본 AI(Qwen3-8B) 를 가져와 영어, 프랑스어, 독일어, 스페인어, 중국어, 스와힐리어 등 여섯 가지 언어의 전문가로 훈련시켰습니다.
  • 훈련: 그들은 각 전문가에게 약 100 억 단어 분량의 방대한 연습 데이터를 제공하여 모두에게 공정한 기회를 주었습니다.
  • 비교: 그들은 두 그룹을 비교했습니다:
    1. 영어 사고자들: 이 학생들은 영어로 문제를 풀었지만 현지 언어로 답변했습니다.
    2. 원어민 사고자들: 이 학생들은 현지 언어로만 생각하고 풀었습니다.

놀라운 결과:
모두가 동일한 고품질의 훈련을 받았을 때, 두 그룹 간의 격차는 극적으로 축소되었습니다. "원어민 사고자들"은 "영어 사고자들"과 거의 비슷했습니다 (평균적으로 2~3% 정도만 뒤처졌습니다). 이는 충분한 연습을 통해 AI 가 지능을 잃지 않고도 모국어로 생각할 수 있음을 시사합니다.

비밀 재료: "레이어 스왑"

격차가 작았음에도 불구하고, "영어 사고자들"이 가장 어려운 수학 및 과학 퍼즐에서 여전히 약간 더 뛰어났습니다. 연구자들은 궁금해했습니다: 왜?

그들은 AI 의 "뇌"(신경망 계층) 를 들여다보았고 흥미로운 구조를 발견했습니다:

  • 외부 계층 (상단과 하단): 이는 귀와 입과 같습니다. 이들은 특정 언어 (프랑스어 듣기, 프랑스어 말하기) 를 처리합니다. 이 부분들은 언어마다 매우 다릅니다.
  • 중간 계층: 이는 논리 중심부와 같습니다. 연구자들은 AI 가 수학이나 과학 문제를 풀도록 학습할 때, AI 가 프랑스어, 중국어, 영어 중 어떤 언어를 말하든 "논리 중심부"는 거의 동일하다는 것을 발견했습니다. 이는 보편적인 추론 엔진입니다.

해결책: "레이어 스왑"
영어 전문가의 중간 "논리" 부분이 약간 더 날카로웠기 때문에, 연구자들은 "수술"을 수행했습니다. 그들은 영어 전문가의 중간 계층을 가져와 원어민 전문가에게 교체했습니다.

  • 비유: 채소를 다지는 데는 약간 느리지만 요리 실력은 훌륭한 프랑스 요리사가 있다고 상상해 보세요. 당신은 세계 최고의 영어 요리사로부터 "다지는 손"(중간 계층) 을 가져와 프랑스 요리사에 부착합니다.
  • 결과: 이제 프랑스 요리사는 영어 요리사만큼 채소를 빠르게 다질 수 있지만, 여전히 프랑스어를 말하고 프랑스 요리를 요리합니다. AI 는 프랑스어로 생각하면서 (현지 언어의 "사고 과정"을 유지) 영어 모델의 추론 능력을 얻었습니다.

최종 결과

이 "레이어 스왑"을 통해 연구자들은 프랑스어와 독일어와 같은 언어에서 남은 성능 격차의 **80~90%**를 해소했습니다. 스페인어의 경우, 격차를 완전히 없앴습니다. 이제 AI 는 다음과 같이 할 수 있습니다:

  1. 사용자의 언어로 생각하여 (이해하기 쉽게 만듦).
  2. 영어로 생각하듯 어려운 문제를 똑같이 해결합니다.

요약

이 논문은 "AI 가 똑똑해지려면 영어로 생각해야 한다"는 아이디어가 근본적인 한계가 아니라 대부분 훈련 문제임을 보여줍니다. AI 를 적절히 훈련시킨 다음 영어 모델에서 "가장 똑똑한 중간 뇌"를 스왑하면, 모든 언어로 완벽하게 추론하고 사고 과정을 투명하게 유지하며 누구나 접근할 수 있는 AI 를 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →