← 최신 논문
💬 NLP

No Optimal Language Set Exists for Multilingual Instruction Tuning: Insights from a Linguistically-Informed Study

이 논문은 다국어 인스트럭션 튜닝을 위한 언어학적 정보에 기반한 언어 선택 전략을 체계적으로 평가하며, 성능이 특정 작업과 모델에 크게 의존하고 더 많은 언어를 추가하는 것이 종종 다국어의 저주를 유발하기 때문에 보편적인 최적의 언어 집합은 존재하지 않는다는 것을 밝혀냈다.

원저자: Gürkan Soykan, Gözde Gül Şahin

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gürkan Soykan, Gözde Gül Şahin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계를 거대하고 배고픈 도서관이라고 상상해 보세요. 최근 몇 년 동안 과학자들은 이 디지털 두뇌들이 영어와 같은 한 가지 언어뿐만 아니라 수십 개, 심지어 수백 개의 언어로 된 지시를 따르도록 가르치고 있습니다. 이것을 "다국어 지시 튜닝(multilingual instruction tuning)"이라고 부릅니다. 이것은 마치 지구상의 모든 나라에서 온 고객들과 대화해야 하는 신입 사원을 교육하는 것과 같습니다. 목표는 그 직원이 프랑스어로 된 요청을 이해하고, 스와힐리어로 답변하며, 일본어로 된 농담을 혼란 없이 설명할 수 있을 만큼 똑똑하게 만드는 것입니다.

하지만 함정이 있습니다. 도서관에는 한정된 선반 공간(컴퓨팅 파워)과 직원을 교육할 수 있는 한정된 시간이 있습니다. 만약 모든 언어를 하나의 훈련 일정에 억지로 밀어 넣으려 한다면, 직원은 과부하가 걸려 어떤 언어도 제대로 말하지 못하게 될 수도 있습니다. 이것을 "다국어성의 저주(curse of multilinguality)"라고 합니다. 이 때문에 많은 연구자들은 다음과 같은 의문을 품었습니다. "완벽한 언어 그룹을 뽑기 위한 '마법의 레시피'가 존재할까?" 아마도 언어들을 지리적으로 넓게 퍼져 있거나 서로 매우 다르게 들리도록 선택한다면, 전 세계 모든 사람을 위해 완벽하게 작동하는 초스마트 직원을 만들 수 있을지도 모릅니다. 이는 희망적인 아이디어입니다. 완벽한 조합을 찾아내면 가능한 최고의 AI를 얻을 수 있다는 것이죠.

"No Optimal Language Set Exists for Multilingual Instruction Tuning(다국어 지시 튜닝을 위한 최적의 언어 집합은 존재하지 않는다)"라는 제목의 이 논문은 바로 그 희망을 테스트하기 위해 실험실로 들어갑니다. 연구자들인 귀르칸 소이칸(Gürkan Soykan)과 제거데 굴 셰힌(Gözde Gül Şahin)은 실험을 설정하여 자신들이 찾은 "언어학적 정보에 기반한" 전략들을 통해 최적의 레시피를 찾을 수 있는지 확인했습니다. 이 전략들은 마치 서로 다른 방식으로 팀을 구성하는 것과 같습니다. 한 팀은 지도상의 위치(지리)를 기준으로 선택되었고, 다른 팀은 문법적 구조(유형론)를 기준으로, 또 다른 팀은 의미의 유사성이나 컴퓨터가 학습한 방식을 기준으로 선택되었습니다. 그들은 이러한 스마트한 선택 방식들을 단순히 제비뽑기로 이름을 뽑는 것과 같은 "무작위" 선택 방식과 비교했습니다.

결과는 반전이었습니다. 저자들은 모든 상황에서 승리하는 단 하나의 "최고의 팀"은 존재하지 않는다는 것을 발견했습니다. 그것은 모든 문을 여는 하나의 만능 열쇠를 찾는 것과 같지 않았습니다. 대신, 최선의 선택은 당신이 훈련시키고 있는 특정 AI 모델과 당신이 요청하는 특정 작업에 전적으로 달려 있었습니다. 어떤 모델에게는 지리를 기반으로 언어를 선택하는 것이 훌륭하게 작용했지만, 다른 모델에게는 문법을 기반으로 하는 것이 더 나았습니다. 때로는 "스마트한" 선택이 단순히 무작위로 언어를 뽑았을 때보다 결과가 더 나쁜 경우도 있었습니다!

또한 이 연구는 명확한 한계를 발견했습니다. 훈련 조합에 더 많은 언어를 계속 추가할수록 AI의 성능이 영원히 계속 좋아지는 것은 아니었습니다. 약 13개 또는 14개의 언어에 도달하면 성능이 실제로 떨어지기 시작했습니다. 이것은 뷔페를 먹는 것과 같습니다. 처음 몇 접시는 맛있지만, 접시에 음식을 계속 쌓다 보면 결국 너무 배가 불러서 아무것도 즐길 수 없게 되는 것과 같습니다. 이는 "다국어성의 저주"를 확인시켜 주었습니다. 고정된 훈련 시간 내에서 너무 많은 언어를 추가하는 것은 AI가 그 언어들을 모두 잘 배우는 능력을 해칩니다.

나아가 연구자들은 한 AI 모델에 효과적인 방법이 다른 모델에게는 형편없을 수 있다는 점을 발견했습니다. 한 모델을 더 똑똑하게 만든 전략이 다른 모델을 더 멍청하게 만들 수도 있었습니다. 또한, 모델에 따라서는 단 하나의 언어(예: 베트남어)로만 가르치는 것이 여러 언어를 섞어서 가르치는 것만큼이나 좋거나 혹은 더 낫다는 사실도 주목했습니다.

결국, 이 논문은 단 하나의 완벽한 "최적의 언어 집합"을 찾는 것은 막다른 길이라고 제안합니다. 모든 상황에 적용되는 단 하나의 해결책은 없습니다. 가장 좋은 접근 방식은 조금 더 신중한 것입니다. 약 10개에서 15개 정도의 다양한 언어 그룹을 선택하는 것이 보통 안전한 선택이지만, 새로운 모델과 새로운 작업마다 다른 조합을 테스트할 준비가 되어 있어야 합니다. 저자들은 여러 테스트의 점수를 단순히 평균 내는 것이 오해를 불러일으킬 수 있다고 경고합니다. 왜냐하면 그것은 어떤 전략이 특정 작업에는 훌륭하지만 다른 작업에는 끔찍할 수 있다는 사실을 숨기기 때문입니다. 따라서 마법의 레시피를 찾을 수는 없지만, 우리가 언어를 어떻게 선택할지 주의를 기울이고, 언제 더 많은 언어를 추가하는 것을 멈춰야 할지를 아는 것이 더 나은, 더 유용한 다국어 AI를 구축하는 핵심이라는 것을 우리는 알고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →