MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages
이 논문은 고품질 영어 데이터를 번역하여 생성된 36개 유럽 언어에 걸친 4.8조 토큰 규모의 공개 합성 병렬 코퍼스인 MultiSynt/MT를 소개하며, 이는 멀티링구얼 LLM이 네이티브 데이터 베이스라인에 비해 현저히 적은 사전 학습 토큰만으로도 우수한 성능을 달ert할 수 있게 할 뿐만 아니라 현재 벤치마크의 특정 평가 사각지대를 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 매우 똑똑한 로봇에게 36개의 다양한 언어를 말하고 이해하는 법을 가르치려 한다고 상상해 보세요. 문제는 로봇이 가장 좋아하는 선생님(인터넷)이 주로 영어를 사용한다는 점입니다. 영어로 된 책, 기사, 웹사이트는 산더미처럼 쌓여 있지만, 몰타어, 아일랜드어, 또는 아이슬란드어 같은 언어들을 위한 고품질의 텍스트는 아주 작고 먼지 쌓인 더미에 불과합니다.
이 논문의 저자들인 MultiSynt/MT는 이 문제를 해결하기 위해 거대한 "번역 공장"을 건설함으로써 해결책을 찾기로 했습니다.
핵심 아이디어: 번역 공장
사람들이 36개의 다른 언어로 4.8조 개의 새로운 단어를 직접 쓰기를 기다리는 대신(그것은 너무 오래 걸릴 것입니다), 그들은 1,000억 개의 고품질 영어 문서(Nemotron-CC 데이터셋)를 가져와서 초고성능 번역 기계로 돌렸습니다.
이렇게 생각해보세요:
- 소스(Source): 이용 가능한 최고의 영어 글쓰기 도서관.
- 일꾼들: 그들은 단 하나의 번역기만 사용하지 않았습니다. 그들은 다양한 AI 번역가 팀을 사용했습니다(어떤 이들은 전문 언어학자 같고, 다른 이들은 일반적인 목적의 똑똑한 로봇 같습니다). 이 팀은 모든 영어 문장을 36개의 대상 언어로 번역했습니다.
- 결과: 이 36개 언어로 된 4.8조 개의 토큰(단어 및 기호)을 포함하는 새로운 도서관이 탄생했습니다. 많은 유럽 소수 언어의 경우, 이 새로운 도서관은 이전에 존재했던 그 어떤 무료 도서관보다 100배 더 큽니다.
실험: "번역된 것"이 효과가 있을까?
연구팀은 이 거대한 번역 라이브러리를 사용하여 새로운 AI 모델을 훈련시켰고, 이를 "네이티브(native)" 데이터(해당 언어로 인간이 직접 작성한 텍스트)로 훈련된 모델과 비교했습니다.
놀라운 결과:
번역된 데이터로 훈련된 모델이 네이티브 모델보다 더 뛰어난 성능을 보였지만, 이 모델은 72% 적은 훈련 시간과 데이터를 사용하여 그 결과에 도달했습니다.
- 비유: 두 명의 학생이 시험을 치르는 상황을 상상해 보세요. 학생 A(네이티브)는 두꺼운 교과서를 공부했습니다. 학생 B(번역본 학습자)는 압축된 고품질 요약본을 공부했습니다. 학생 B는 더 높은 점수를 받았을 뿐만 아니라, 하는 데 걸린 시간은 절반도 채 되지 않았습니다.
하지만 이 논문은 이것이 모든 것에 대한 마법의 해결책은 아니라고 경고합니다.
함정: 언어의 "불쾌한 골짜기"
번역된 데이터는 일반적인 지식과 논리에는 훌륭하지만, 특정한 약점이 있습니다: 문화와 관용구.
- 은유: 당신이 회화 책을 완벽하게 공부한 관광객이라고 상상해 보세요. 당신은 음식 주문이나 길 찾기(일반적인 과업)는 완벽하게 해낼 수 있습니다. 하지만 만약 누군가 당신에게 현지 농담, 특정 역사적 참조, 또는 현지인들만 사용하는 속어에 대해 묻는다면, 당신은 그것을 틀릴 수도 있습니다. 왜냐냐 하면 그 회화 책은 현지 문화에서 태어난 것이 아니라 영어로부터 번역된 것이기 때문입니다.
- 발견된 사실: 연구팀이 노르웨이의 현지 관용구나 문화적 뉘앙스가 포함된 과업으로 AI를 테스트했을 때, 네이티브 인간의 글쓰기로 훈련된 모델이 여전히 승리했습니다. 번역된 모델은 유창했지만 현지 문화의 "영혼"이 부족했습니다.
테스트의 "사각지대"
논문은 우리가 보통 AI를 테스트하는 방식에서 재미있는 결함을 발견했습니다.
- 문제: 대부분의 테스트는 객관식 질문(표준화된 시험과 같은)입니다. 이러한 테스트는 "빈칸 채우기" 게임과 같습니다. 이들은 문장이 완벽하게 자연스러운지, 아니면 약간 어색하거나 로봇 같은 느낌(이를 "번역투(translationese)"라고 합니다)이 드는지 구분하지 못합니다.
- 발견: 연구진이 다른 종류의 테스트, 즉 AI에게 이야기를 쓰게 하고 다른 AI가 그 글의 흐름과 아름다움을 판단하게 하는 테스트를 사용했을 때, 번역된 모델들이 미묘한 차이가 있다는 것을 발견했습니다. 표준 테스트들은 이러한 품질의 격차를 보지 못하는 "맹점"이 있었지만, "이야기 심사위원"은 이를 명확히 볼 수 있었습니다.
결론
이 논문은 번역된 데이터는 강력한 보완재이지, 완벽한 대체재는 아니다라고 결론짓습니다.
- 소수 언어의 경우: 이것은 구원 투수입니다. 이전에는 존재하지 않았던 방대한 양의 고품질 데이터를 제공합니다.
- 주요 언어의 경우: 빈틈을 채우는 좋은 방법입니다.
- 최선의 전략: 번역된 데이터를 사용하여 강력한 기초를 구축하되, 기계가 스스로 만들어낼 수 없는 문화적 뉘앙스, 농담, 그리고 현지의 풍미를 AI에게 가르치기 위해 네이티브 인간의 데이터를 계속 유지하는 것입니다.
저자들은 이 거대한 "번역 라이브러리"를 무료로 공개하여, 다른 연구자들이 이 번역된 텍스트를 네이티브 텍스트와 어떻게 가장 잘 혼합하여 차세대 다국어 AI를 구축할 수 있을지 실험할 수 있도록 했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.