✨ 핵심🔬 기술 요약
이 논문은 **"Common Corpus(커먼 코퍼스)"**라는 거대한 프로젝트에 대한 소개입니다. 쉽게 말해, **"인공지능 (AI) 이 배우기 위해 필요한, 누구나 자유롭게 쓸 수 있는 가장 큰 '공공 도서관'을 만들었다"**는 이야기입니다.
이 복잡한 내용을 일상적인 비유로 풀어보면 다음과 같습니다.
1. 문제 상황: "남의 책 훔쳐 읽는 AI"
지금까지 AI(거대 언어 모델) 를 만들 때는 인터넷에 떠도는 모든 글을 모아서 학습시켰습니다. 하지만 이 방식은 큰 문제가 있었습니다.
비유: 마치 누군가 남의 집 장서나 저작권이 있는 베스트셀러를 몰래 복사해서 AI 에게 읽게 한 것과 같습니다.
결과: 책 출판사나 작가들이 "내 책도 허락 없이 썼다"며 소송을 걸고, AI 개발자들은 "이제부터는 쓸 수 있는 책이 없다"며 당황하게 되었습니다. 인터넷의 많은 자료는 이제 AI 가 접근하는 것이 금지되거나 제한되고 있습니다.
2. 해결책: "공짜로 누구나 빌려 쓸 수 있는 거대한 도서관"
저자들은 이 문제를 해결하기 위해 Common Corpus 를 만들었습니다.
특징: 이 도서관에 있는 책 (데이터) 은 모두 저작권이 만료되었거나, 저자가 "누구나 써도 된다"고 허락한 것들 뿐입니다.
규모: 약 2 조 개 의 단어 (토큰) 가 들어있는데, 이는 AI 가 배울 수 있는 가장 큰 '공공' 자료입니다.
다양성: 영어뿐만 아니라 프랑스어, 독일어, 스페인어 등 다양한 언어와, 고전 문학, 과학 논문, 정부 문서, 컴퓨터 코드 등 다양한 주제가 섞여 있습니다. 마치 전 세계의 모든 언어와 지식을 한곳에 모은 '세계 도서관' 같습니다.
3. 어떻게 만들었나? "정성스러운 정리와 청소"
단순히 인터넷에서 긁어모은 것이 아니라, 매우 꼼꼼하게 정제했습니다.
오류 수정: 오래된 책들은 글자가 깨져 있거나 (OCR 오류), 오타가 많습니다. 저자들은 이를 고쳐주는 전용 AI 도구들을 만들어 "책장을 다듬고 글자를 교정"했습니다.
위험 제거: 과거의 책들에는 인종차별이나 혐오 표현이 들어있을 수 있습니다. 이를 찾아내어 AI 가 배우지 않도록 '청소'했습니다.
개인정보 보호: 책 속에 실수로 들어간 전화번호나 주소 같은 개인정보는 모두 가려서 (익명화) 처리했습니다.
4. 성능은 어떨까? "작은 도서관도 큰 성과를 낸다"
저자들은 이 데이터를 가지고 작은 크기의 AI 모델 두 개를 훈련시켰습니다.
결과: 비록 데이터 양이 거대 상용 모델들보다 적지만, 동일한 크기의 다른 모델들과 비교해도 전혀 뒤지지 않는 훌륭한 성능 을 보여주었습니다.
의미: "저작권 문제 없이, 합법적으로만 모은 데이터로도 훌륭한 AI 를 만들 수 있다"는 것을 증명했습니다.
5. 결론: "열린 과학을 위한 첫걸음"
이 프로젝트는 AI 개발이 "누군가의 허락을 기다리는 것"이 아니라, "공공의 이익을 위해 투명하게 이루어질 수 있다"는 것을 보여줍니다.
비유: 마치 AI 개발자들이 이제부터는 '남의 집 열쇠'를 훔쳐 쓰지 않고, '공공 도서관'의 열쇠를 가지고 자유롭게 책을 읽으며 지식을 쌓을 수 있게 된 것입니다.
한 줄 요약:
"저작권 분쟁의 위험 없이, 전 세계의 다양한 언어와 지식을 합법적으로 모아 만든 **'AI 를 위한 거대한 공공 도서관'**을 만들었으며, 이 도서관의 책들만으로도 훌륭한 AI 를 만들 수 있음을 증명했습니다."
1. 문제 정의 (Problem)
대형 언어 모델 (LLM) 의 발전은 방대한 양의 학습 데이터를 필요로 하지만, 기존 데이터셋은 다음과 같은 심각한 법적 및 윤리적 문제를 안고 있습니다.
저작권 및 법적 불확실성: 기존 웹 크롤링 데이터 (Common Crawl 등) 는 저작권이 있는 콘텐츠가 포함되어 있어, 저작권법 위반 소송 (예: NYT 대 OpenAI) 이 증가하고 있습니다.
데이터 접근성 제한: 저작권 소유자들의 반대와 기술적 차단 (robots.txt 등) 으로 인해 고품질 데이터의 크롤링이 어려워지고 있으며, 이는 오픈 소스 연구와 재현 가능한 연구의 위기를 초래했습니다.
데이터 품질 및 편향: 웹 기반 데이터는 저품질, 유해 콘텐츠 (Toxicity), 개인정보 (PII) 포함 문제가 있으며, 특히 다국어 및 저자원 언어에서의 데이터 품질이 낮습니다.
기존 오픈 데이터셋의 한계: 기존 오픈 데이터셋 (C4, ROOTS 등) 은 대부분 웹 크롤링에 의존하거나 영어 위주이며, 명확한 라이선스 하에 제공되지 않아 '완전한 개방성 (Fully Open)'을 보장하지 못합니다.
2. 방법론 (Methodology)
저자들은 Common Corpus 라는 약 2 조 (2 Trillion) 토큰 규모의 완전히 개방된 (Fully Open) 데이터셋을 구축하기 위해 다음과 같은 체계적인 방법론을 적용했습니다.
A. 데이터 구성 (Data Composition)
Common Corpus 는 저작권이 만료되었거나 명확한 오픈 라이선스 (Creative Commons, Public Domain 등) 를 가진 6 가지 주요 컬렉션으로 구성됩니다.
Open Government: 금융 (SEC, WTO), 법률 (EU 법률, 미국 판례) 및 행정 데이터.
Open Culture: 도서관 (Library of Congress, Gallica 등) 과 문화 유산 기관에서 제공하는 고전 문학, 신문, 단행본 (1884 년 이전 출판물 위주).
Open Science: OpenAlex, arXiv, PubMed 등에서 수집된 과학 논문 및 학술 자료.
Open Code: Stack v1/v2 에서 추출된 600 개 이상의 프로그래밍 언어 코드.
Open Web: Wikipedia, Wikisource, YouTube Commons(CC-BY), StackExchange 등.
Open Semantic: Wikidata 의 전체 데이터를 자연어 문장으로 변환한 데이터.
B. 데이터 정제 및 큐레이션 (Cleaning & Curation)
다국어, 역사적 문서, OCR(광학 문자 인식) 오류가 포함된 데이터를 처리하기 위해 자체 개발한 도구들을 활용했습니다.
Segmentext: OCR 아티팩트와 깨진 레이아웃을 처리하는 텍스트 분할 모델.
OCR Quality Detection: OCRoscope(언어 식별 기반) 와 OCRerrcr(DeBERTa 기반) 를 통해 OCR 오류를 감지하고 품질을 평가.
OCR Correction: OCRonos(Llama 3 기반) 를 사용하여 OCR 오류를 수정하거나 손상된 텍스트를 재구성.
Toxicity Filtering: 역사적 텍스트의 현대적 윤리 기준 부합을 위해 다국어 유해 콘텐츠 분류기 Celadon 을 개발하여 필터링.
PII Removal: Microsoft Presidio 를 활용하여 전화번호, 이메일, IP 주소 등 개인 식별 정보를 식별하고 가짜지만 현실적인 값으로 대체 (삭제 대신).
Deduplication: 메타데이터 및 PDF 기반 중복 제거.
C. 모델 학습 및 평가
모델: Common Corpus 로 학습된 350M 파라미터 (PleIAs 350M) 와 1.2B 파라미터 (PleIAs 1.2B) 의 Llama 아키텍처 기반 모델 학습.
평가: MultiBLiMP(다국어 언어적 최소쌍), XStoryCloze, XCOPA 등 다양한 벤치마크를 통해 성능을 검증.
3. 주요 기여 (Key Contributions)
최대 규모의 윤리적 데이터셋: 약 2 조 토큰 규모로, 저작권 및 개인정보 보호 규정을 완전히 준수하는 가장 큰 오픈 소스 프리트레이닝 데이터셋을 공개했습니다.
다국어 및 도메인 다양성: 영어뿐만 아니라 프랑스어, 독일어, 스페인어 등 고자원 언어부터 라틴어, 그리스어, 슬라브어 등 저자원 언어까지 50 개 이상의 언어를 포함하며, 웹 텍스트뿐만 아니라 법률, 금융, 과학, 코드, 문화유산 등 다양한 도메인을 아우릅니다.
완전한 투명성과 재현성: 데이터의 출처 (Provenance), 라이선스, 처리 과정, 필터링 기준을 상세히 문서화하여 오픈 사이언스 인프라로서의 역할을 수행합니다.
오픈 소스 도구 공개: 데이터 정제를 위해 개발한 Segmentext, OCRoscope, OCRonos, Celadon 등의 도구를 오픈 소스로 공개하여 다른 연구자들이 유사한 데이터셋 구축에 활용할 수 있도록 했습니다.
4. 결과 (Results)
성능 비교: Common Corpus 로 학습된 350M 및 1.2B 모델은 유사 크기의 다른 모델 (Gemma 3, XGLM, BLOOM, OLMo 등) 과 비교해 동등하거나 더 나은 성능을 보였습니다.
다국어 능력: 특히 MultiBLiMP 벤치마크에서 350M 모델이 1B~1.7B 크기의 다른 모델들보다 우수한 성능을 기록하며, 소규모 모델임에도 불구하고 다국어 이해도가 높음을 입증했습니다.
데이터 품질: 정제 과정을 거친 데이터는 코드 데이터의 높은 반복성, 법률 텍스트의 고정된 어휘 등 도메인 특성에 맞는 분포를 보이며, 유해 콘텐츠와 PII 가 효과적으로 제거된 것을 확인했습니다.
5. 의의 및 중요성 (Significance)
법적 리스크 해소: 오픈 소스 LLM 연구가 저작권 소송이나 법적 제재 없이 안전하게 진행될 수 있는 기반을 마련했습니다.
오픈 사이언스 인프라: UNESCO 가 정의한 '공유 연구 인프라'로서, AI 데이터의 독점적 장벽을 허물고 연구자와 개발자들이 공정하게 데이터에 접근할 수 있게 합니다.
미래 지향적 접근: 웹 크롤링에 의존하지 않고, 공공 영역 (Public Domain) 과 명확한 라이선스를 가진 데이터를 체계적으로 수집하고 정제하는 새로운 표준 (Best Practice) 을 제시했습니다.
다국어 및 저자원 언어 지원: 기존 데이터셋이 간과했던 저자원 언어와 역사적 문헌을 포함함으로써, 보다 포용적이고 다양한 언어 환경을 가진 LLM 개발을 가능하게 합니다.
이 논문은 LLM 개발이 법적, 윤리적 규정을 준수하면서도 고품질의 데이터를 기반으로 지속 가능하게 이루어질 수 있음을 증명하는 중요한 이정표로 평가됩니다.
매주 최고의 NLP 논문을 받아보세요.
스탠포드, 케임브리지, 프랑스 과학 아카데미 연구자들이 신뢰합니다.
받은편지함에서 구독을 확인해주세요.
문제가 발생했습니다. 다시 시도하시겠어요?
스팸 없음, 언제든 구독 취소 가능.
주간 다이제스트 — 가장 새로운 연구를 쉽게 설명. 구독 ×