← 최신 논문
💬 NLP

Do Chinese models speak Chinese languages?

본 연구는 중국의 다양한 언어 지형에도 불구하고 중국의 주요 오픈 가중치 LLM 들이 중국어, 프랑스어, 독일어와 같은 주요 글로벌 언어에서는 탁월한 성능을 보이는 반면 카자흐어와 위구르어와 같은 소수 언어 지원에서는 종종 실패하는 등 서구 모델과 놀라울 정도로 유사한 다국어 성능 프로파일을 보인다는 사실을 밝혀내어, 글로벌 벤치마킹 관행과 공유된 학습 자원이 지역적 우선순위보다 언어 능력의 동질화를 주도하고 있음을 시사한다.

원저자: Andrea W Wen-Yi, Unso Eun Seo Jo, David Mimno

게시일 2026-05-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Andrea W Wen-Yi, Unso Eun Seo Jo, David Mimno

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계를 거대한 글로벌 요리 대회로 상상해 보세요. 각국에서 온 셰프들(모델 개발자들)은 지구상의 모든 언어를 이해하고 구사할 수 있는 궁극적인 '보편적 언어 냄비'를 만들어 내기 위해 경쟁하고 있습니다.

이 논문은 구체적인 질문을 던집니다: 다양한 현지 재료가 가득한 부엌을 가진 중국의 셰프들은 실제로 그 재료들을 요리할까요? 아니면 미국과 유럽의 셰프들과 똑같은 레시피를 따를 뿐일까요?

다음은 간단한 비유를 통해 정리한 연구 결과입니다:

1. 배경: 다양한 부엌 대 글로벌 메뉴

중국은 14 억 명의 만화어 화자와 우이구르어, 티베트어, 카자흐어 등 수백 개의 지역 방언 및 소수민족 언어를 가진 거대한 부엌과 같습니다. 중국 셰프들은 이러한 현지 재료에 쉽게 접근할 수 있으므로 특별한 이점이 있을 것이라고 예상할 수 있습니다.

그러나 함정이 하나 있습니다. 대회를 우승하고 글로벌 명성을 얻기 위해 셰프들은 주로 영어를 구사하며 **영어 기반의 점수표(벤치마크)**를 사용하는 심사위원단에 의해 평가받습니다. 최고의 셰프로 인정받으려면 영어권 심사위원들에게 요리가 훌륭하게 느껴지도록 만들어야 합니다.

2. 실험: 요리 시식하기

연구진은 6 명의 중국 셰프 (Qwen, Yi, DeepSeek 등) 와 4 명의 서양 셰프 (Llama, Mistral 등) 가 만든 요리를 시식했습니다. 프랑스어와 독일어 같은 주요 언어부터 중국 소수민족 언어에 이르기까지 21 개 언어로 테스트했습니다.

그들은 음식을 평가하기 위해 세 가지 방법을 사용했습니다:

  • 번역 테스트: 모델이 영어 문장을 다른 언어로 번역할 때 맛 (의미) 을 잃지 않고 전달할 수 있는가?
  • 독해 테스트: 모델이 외국어로 된 이야기를 읽고 그 내용에 대해 정확하게 질문을 답할 수 있는가?
  • 이름 맞추기 게임: 모델이 텍스트를 보고 "이것은 카자흐어로 쓰여 있다"거나 "이것은 티베트어로 쓰여 있다"고 정확히 말할 수 있는가?

3. 결과: '만화어 예외'

결과는 놀라울 정도로 균일했으며, 하나의 큰 예외가 있었습니다.

  • '복제' 효과: 테스트된 거의 모든 언어 (프랑스어, 독일어, 일본어, 한국어 등) 에서 중국 모델과 서양 모델의 성능은 거의 동일했습니다. 마치 두 그룹의 셰프가 정확히 같은 글로벌 레시피 책을 따르고 있는 것처럼 보였습니다. 논문은 두 그룹 간 93% 의 상관관계를 발견했습니다. 서양 모델이 프랑스어에 능숙하면 중국 모델도 프랑스어에 능숙했고, 서양 모델이 소수 언어에서 어려움을 겪으면 중국 모델도 똑같이 어려움을 겪었습니다.
  • 만화어 초능력: 중국 셰프들이 서양 셰프들을 진정으로 압도한 유일한 경우는 만화어였습니다. 만화어 데이터에 더 많이 접근하고 이에 집중했기 때문에 그들의 '만화어 요리'는 서양 셰프들의 버전보다 훨씬 맛있었습니다.
  • 소수 언어 무지점: 슬픈 부분은 여기입니다. 현지 재료에 접근할 수 있음에도 불구하고, 중국 모델들은 우이구르어나 카자흐어 같은 중국 소수민족 언어를 처리하는 데 서양 모델과 똑같이 나빴습니다. 사실 많은 중국 모델들은 텍스트가 우이구르어나 카자흐어로 쓰여 있다는 것조차 인식하지 못했습니다. 서양 모델들이 그랬던 것처럼, 그들은 이러한 지역 언어들을 존재하지 않는 것처럼 취급했습니다.

4. 왜 이런 일이 발생했을까요?

논문은 두 가지 주요 원인을 제시합니다:

  1. '글로벌 점수표' 압박: 유명세를 얻고 자금을 확보하기 위해 중국 개발자들은 글로벌 벤치마크 우승에 집착합니다. 이러한 벤치마크는 대부분 영어나 주요 유럽 언어로 이루어져 있습니다. 따라서 그들은 중국 내의 고유한 지역 데이터 접근권을 활용해 진정한 다양성을 갖춘 모델을 구축하기보다, 글로벌 점수판에서 좋은 모습을 보이도록 모델을 최적화했습니다.
  2. '만화어 우선' 정책: 중국은 여러 언어를 보호하려는 역사를 가지고 있지만, 최근 정책들은 전 국가를 하나로 통합하는 단일 언어로 만화어를 중점적으로 육성하는 데 초점을 맞추고 있습니다. AI 개발자들은 이 추세를 따르는 듯합니다: 그들은 만화어 ('초강대 언어') 를 우선시하고 나머지는 무시합니다.

결론

이 논문은 중국이 독특한 언어 지형을 가지고 있으며 그 다양성을 반영하는 진정한 모델을 구축할 잠재력이 있음에도 불구하고, 중국 모델들은 '동질화'되었다고 결론 내립니다.

그들은 본질적으로 서양 모델의 카피본이며, 한 가지 작은 업그레이드가 있을 뿐입니다: 만화어를 조금 더 잘 구사한다는 점입니다. 그들은 중국 국경 내에서 사용되는 수백 개의 다른 언어를 구하거나 격상시키기 위해 고유한 지위를 활용하지 않았습니다. 대신, 그들은 모두 같은 글로벌 요리를 요리하며 지역적이고 소수민족적인 맛들을 선반 위에 방치해 두었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →