EuroLLM-22B: Technical Report
이 논문은 기존 모델들에서 유럽 언어들이 과소 대표되는 문제를 해결하기 위해 35개 언어(24개 모든 공식 EU 언어 포함)를 지원하도록 처음부터 학습된 대규모 언어 모델인 EuroLLM-22B를 소개하며, 추론, 지시 이행 및 번역에서 경쟁력 있는 성능을 달성하는 동시에 향후 연구를 지원하기 위해 모든 관련 데이터셋, 모델 및 코드를 공개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
EuroLLM-22B: 유럽의 다국어 사서
인공지능의 세계를 거대한 도서관이라고 상상해 보세요. 오랫동안 이 도서관은 영어로 쓰인 책들이 지배해 왔습니다. 만약 당신이 도서관에 들어가 프랑스어, 독일어, 또는 포르투갈어로 된 이야기를 찾아달라고 요청한다면, 몇 권의 책을 찾을 수는 있겠지만, 그것들은 종종 영어 이야기를 번역한 것이거나 현지 문화를 온전히 이해하지 못하는 저자들이 쓴 것일 때가 많았습니다.
EuroLLM-22B는 이를 해결하기 위해 설계된 새롭고 거대한 프로젝트입니다. 이것은 모든 24개의 유럽연합 공식 언어와 아랍어, 중국어, 일본어와 같은 11개의 주요 언어를 말하고, 이해하고, 추론할 수 있도록 처음부터 특별히 구축된 "대규모 언어 모델"(매우 똑똑한 디지털 사서라고 생각하세요)입니다.
이 팀이 이 디지털 사서를 어떻게 만들었는지 쉬운 용어로 설명해 드립니다.
1. 설계도 (아키텍처)
집을 짓기 전에는 설계도가 필요합니다. 팀은 단순히 기존 설계를 복사해서 붙여넣은 것이 아니라, 방대한 양의 정보를 처리할 수 있도록 설계도를 수정했습니다.
- 규모: 이 모델은 220억 개의 "뉴런"(파라미터)을 가지고 있습니다. 비유를 하자면, 이전 버전(9B)이 똑똑한 고등학생이라면, 이 버전은 매우 큰 기억력을 가진 숙련된 대학교수와 같습니다.
- 긴 기억력: 가장 큰 업그레이드 중 하나는 "컨텍스트 윈도우(문맥 창)"입니다. 소설을 읽는다고 상상해 보세요. 오래된 모델들은 앞부분을 잊어버리기 전에 마지막 몇 페이지만을 기억할 수 있었습니다. EuroLLM-22B는 한 번에 32,000 단어를 머릿속에 담을 수 있습니다. 이 모델은 짧은 이야기 한 편이나 긴 법률 문서를 읽고, 첫 페이지부터 마지막 페이지까지의 세부 사항을 놓치지 않고 기억할 수 있습니다.
2. 학습 식단 (데이터)
좋은 재료 없이는 훌륭한 요리사를 만들 수 없습니다. 팀은 모델을 훈련시키는 동안 모델에게 먹일 "음식"을 매우 까다롭게 골랐습니다.
- 필터링: 그들은 인터넷 전체를 모델에 쏟아붓지 않았습니다. 그들은 텍스트의 품질을 0에서 5까지 점수를 매기는 특별한 필터(EuroFilter)를 사용하여 품질을 평가했습니다. 쓸모없는 데이터(무작위 코드나 저품질 웹 페이지 등)는 버리고, 고품질의 교육 및 문학 콘텐츠만을 남겼습니다.
- 단계: 그들은 학생이 학교를 다니듯 세 단계로 모델을 훈련시켰습니다:
- 초등 과정: 기초를 가르치기 위해 방대한 양의 일반 데이터를 사용했습니다.
- 고등학교 과정: 추론 능력을 정교하게 만들기 위해 더 높은 품질의 데이터를 도입했습니다.
- 대학원 과정: 마지막 단계에서는 수학, 코딩, 번역된 서적을 포함하여 이용 가능한 최고의 데이터를 제공하여 지능을 날카롭게 다듬었습니다.
- 언어의 혼합: 영어에 치중된 다른 모델들과 달리, EuroLLM-22B는 첫날부터 모든 유럽 언어의 균형 잡힌 식단을 제공받아 특정 언어가 다른 언어보다 우위에 서지 않도록 했습니다.
3. 최종 다듬기 (지시어 튜닝)
모델이 사실을 배운 후에는 어떻게 행동해야 하는지 배워야 했습니다. 이것을 "사후 훈련(post-training)"이라고 합니다.
- 교실: 팀은 EuroBlocks라는 새로운 데이터셋을 사용했습니다. 이것을 "비에 대해 시를 써줘"부터 "이 수학 문제를 풀어줘", "이 문장을 번역해줘"에 이르기까지 모든 것을 다루는 방대한 연습 문제와 답변의 모음이라고 상상해 보세요.
- 선생님: 그들은 다른 고급 AI 모델들을 사용하여 이러한 질문들에 대한 고품질의 답변을 생성한 다음, EuroLLM-22B가 지시 사항을 정확하게 따르는 법을 배울 수 있도록 최상의 답변들을 선택했습니다. 또한 최종 출력이 깔끔하고 직접적이도록 "추론 흔적"(내부 독백)을 제거했습니다.
4. 성적표 (결과)
팀은 EuroLLM-22B가 다른 유명한 AI 모델들과 비교했을 때 어떻게 수행하는지 테스트했습니다.
- 경쟁: 그들은 다른 "완전 오픈" 모델(코드와 가중치를 누구나 자유롭게 사용할 수 있는 모델) 및 일부 "오픈 웨이트" 모델(모델을 사용할 수는 있지만 어떻게 만들어졌는지는 볼 수 없는 모델)과 비교했습니다.
- 결과:
- 유럽의 챔피언: 유럽에서 만들어진 완전 오픈 모델들 중에서 EuroLLM-22B가 가장 강력합니다. 이 모델은 훨씬 더 큰 규모(예: 700억 파라미터 모델)의 다른 유럽 모델들보다 뛰어난 성능을 보였습니다.
- 번역: 이 모델은 언어 간 번역에 탁월하며, 종종 자신보다 두 배 더 큰 규모의 모델과 대등한 성능을 보여줍니다.
- 추론: 논리 퍼즐, 수학, 그리고 복잡한 지시 사항을 따르는 데 매우 능숙합니다.
- 효율성: 논문은 EuroLLM-22B가 15조 단어를 사용한 일부 경쟁 모델에 비해 "적당한" 양의 훈련 데이터(4조 단어)만으로도 이러한 결과를 달성했음을 언급하며, 고품질의 데이터가 단순히 방대한 양보다 더 중요하다는 것을 시사했습니다.
5. 세상에 주는 선물
이 논문의 가장 중요한 부분은 팀이 이 도서관을 자신들만 소유하지 않았다는 점입니다. 그들은 모든 것을 대중에게 공개합니다:
- 모델: "베이스(base)" 버전(가공되지 않은 뇌)과 "인스트럭트(instruct)" 버전(도움이 되는 비서) 모두를 공개합니다.
- 데이터: 모델을 훈련하는 데 사용한 실제 데이터셋(EuroWeb 및 EuroBlocks)을 공개하여 다른 연구자들이 배울 수 있도록 합니다.
- 코드: 모델을 구축하고 테스트하는 데 사용한 소프트웨어 도구들도 공개합니다.
요약하자면: EuroLLM-22B는 유럽의 언어들이 AI 혁명에서 뒤처지지 않도록 설계된 강력한 오픈 소스 AI 도구입니다. 이는 신중한 데이터 선택과 품질에 대한 집중이 있다면, 폐쇄적이고 비밀스러운 프로젝트가 아니더라도 여러분의 언어를 유창하게 구사하는 세계적인 수준의 AI를 구축할 수 있음을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.