← 최신 논문
💬 NLP

HPLT 3.0: Very Large-Scale Multilingual Resources for LLMs and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models

이 논문은 약 200 개 언어에 걸친 30 조 토큰 규모의 대규모 오픈 멀티링구얼 데이터셋, 평가 벤치마크, 그리고 이를 기반으로 학습된 다양한 모델을 공개하는 HPLT 3.0 이니셔티브를 소개합니다.

원저자: Stephan Oepen, Nikolay Arefev, Mikko Aulamo, Marta Bañón, Maja Buljan, Laurie Burchell, Lucas Charpentier, Pinzhen Chen, Mariya Fedorova, Ona de Gibert, Barry Haddow, Jan Hajič, Jindřich Helcl, Andrey
게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Stephan Oepen, Nikolay Arefev, Mikko Aulamo, Marta Bañón, Maja Buljan, Laurie Burchell, Lucas Charpentier, Pinzhen Chen, Mariya Fedorova, Ona de Gibert, Barry Haddow, Jan Hajič, Jindřich Helcl, Andrey Kutuzov, Veronika Laippala, Zihao Li, Risto Luukkonen, Bhavitvya Malik, Vladislav Mikhailov, Amanda Myntti, Dayyán O'Brien, Lucie Poláková, Sampo Pyysalo, Gema Ramírez Sánchez, Janine Siewert, Pavel Stepachev, Jörg Tiedemann, Teemu Vahtola, Dušan Variš, Fedor Vitiugin, Tea Vojtěchová, Jaume Zaragoza

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

HPLT 3.0: 전 세계 언어를 위한 거대한 '디지털 도서관' 프로젝트

이 논문은 인공지능 (AI) 이 더 똑똑해지기 위해 필요한 **'거대한 언어 데이터'**를 만드는 프로젝트인 HPLT 3.0에 대한 소개입니다. 마치 AI 가 세상을 배우기 위해 필요한 '교과서'를 200 개 이상의 언어로 준비한 셈이죠.

아래는 이 복잡한 기술 논문을 일반인이 이해하기 쉽게 비유와 예시로 풀어낸 설명입니다.


1. 핵심 아이디어: "AI 의 식탁에 30 조 개의 단어"

지금까지 AI 가 배우는 데이터는 주로 영어 위주였습니다. 하지만 HPLT 3.0 은 약 30 조 개 (30 Trillion) 의 단어를 담고 있는 거대한 데이터셋을 공개했습니다.

  • 비유: 이전까지 AI 가 영어로만 쓴 '두꺼운 사전'만 보고 공부했다면, HPLT 3.0 은 전 세계 거의 모든 언어 (200 개 이상) 로 쓴 **'거대한 도서관'**을 열어준 것입니다. 이 도서관의 크기는 30 조 개의 단어 (토큰) 에 달하며, 그중 절반 가까이가 영어가 아닌 다른 언어로 채워져 있습니다.

2. 어떻게 만들었나요? "인터넷의 쓰레기장에서 보석 찾기"

이 데이터는 인터넷 (웹) 을 돌아다니며 수집된 원본 자료들에서 만들어졌습니다. 하지만 그냥 긁어모은 것만으로는 AI 가 배우기엔 너무 지저분하고 위험합니다.

  • 과정 (정제 공장):
    1. 수집: 인터넷 아카이브와 'Common Crawl'이라는 거대한 웹 데이터 덩어리를 가져옵니다. (약 7.2 페타바이트, 즉 720 만 GB!)
    2. 정제 (Filtering): 이 원본 데이터에는 광고, 성인물, 개인정보, 중복된 글, 기계 번역처럼 어색한 글들이 섞여 있습니다. 연구팀은 이를 걸러내는 **'고급 정제 공장'**을 가동했습니다.
    3. 품질 검사: 글의 길이를 재고, 언어가 맞는지 확인하고, '이 글은 정말 좋은 글인가?'에 점수를 매깁니다.
    4. 결과: 깨끗하고 질 좋은 글들만 선별하여 AI 가 학습할 수 있는 형태로 포장했습니다.

3. 왜 중요한가요? "영어 중심의 편견 깨기"

기존의 유명한 AI 데이터셋 (C4, FineWeb 등) 은 대부분 구글이나 엔비디아 같은 미국 기업들이 만들었고, 영어에 집중되어 있었습니다.

  • 비유: 마치 전 세계 아이들에게 영어로만 된 '세계사 교과서'만 주고 공부를 시키는 것과 같습니다.
  • HPLT 3.0 의 역할: 유럽의 학술 연구진이 주도하여, 영어뿐만 아니라 스와힐리어, 우크라이나어, 바스크어 등 소수 언어까지 골고루 포함된 데이터를 공개했습니다. 이는 AI 가 특정 언어나 문화에 치우치지 않고, 전 세계 모든 사람의 언어를 이해하도록 돕는 '민주화' 작업입니다.

4. 검증: "실제 시험지로 확인하다"

데이터를 만들었다고 해서 끝이 아닙니다. 이 데이터로 만든 AI 가 실제로 잘하는지 시험을 봤습니다.

  • 시험지 (벤치마크): 9 개 유럽 언어로 만든 다양한 문제 (상식, 논리, 독해 등) 를 풀게 했습니다.
  • 결과: HPLT 3.0 데이터로 학습한 AI 는 기존 데이터로 학습한 AI 들보다 더 좋은 성적을 받았습니다. 특히 **글의 품질 (WDS 점수)**이 높은 데이터만 뽑아서 학습시키면 AI 성능이 더 좋아진다는 것도 확인했습니다.

5. 부록: "번역기와 언어 교재까지 선물"

이 프로젝트는 단순히 데이터만 준 것이 아닙니다.

  • 단어장 (모델): 60 개 이상의 언어에 맞춰 훈련된 '언어 이해 모델' (문법 분석, 이름 찾기 등) 을 공개했습니다.
  • 번역기 (병렬 데이터): 영어와 다른 언어를 서로 연결해 주는 10 억 개 이상의 문장 쌍 데이터를 만들었습니다. 이를 통해 AI 가 번역을 더 잘하도록 돕거나, 부족한 언어의 데이터를 인공적으로 만들어내는 데 사용할 수 있습니다.

6. 윤리적 고민: "모든 것이 공개된다는 것"

인터넷에서 데이터를 긁어모을 때 저작권이나 개인정보 문제가 항상 따라다닙니다.

  • 해결책: 연구팀은 이 문제를 투명하게 해결했습니다.
    • 원본 텍스트의 저작권은 주장하지 않습니다 (사용자가 법적 책임을 짐).
    • 하지만 **데이터를 어떻게 정리하고 분류했는지 (메타데이터)**는 모두 공개하여 누구나 검증할 수 있게 했습니다.
    • 개인정보 (이메일, 전화번호 등) 나 성인물은 철저히 걸러냈습니다.

📝 한 줄 요약

"HPLT 3.0 은 전 세계 200 개 언어를 위한 거대한 '디지털 도서관'을 무료로 열어주어, AI 가 영어뿐만 아니라 전 세계 모든 언어와 문화를 공정하고 똑똑하게 배울 수 있도록 돕는 프로젝트입니다."

이 프로젝트는 AI 기술이 특정 대기업이나 언어에 독점되지 않고, 전 인류의 디지털 공공재 (Public Good) 로서 발전하기를 바라는 연구진들의 열정이 담겨 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →