← 최신 논문
💬 NLP

Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training

이 논문은 저작권 및 데이터 보안 규정을 준수하는 약 2 조 개의 토큰으로 구성된 다국어 오픈 소스 사전 학습 데이터셋 'Common Corpus'를 소개하고, 이를 기반으로 학습된 모델이 동급 모델들과 유사한 성능을 보임으로써 오픈 과학 연구에 중요한 기여를 했음을 주장합니다.

원저자: Pierre-Carl Langlais, Pavel Chizhov, Catherine Arnett, Carlos Rosas Hinostroza, Mattia Nee, Eliot Krzystof Jones, Irène Girard, David Mach, Anastasia Stasenko, Ivan P. Yamshchikov

게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Pierre-Carl Langlais, Pavel Chizhov, Catherine Arnett, Carlos Rosas Hinostroza, Mattia Nee, Eliot Krzystof Jones, Irène Girard, David Mach, Anastasia Stasenko, Ivan P. Yamshchikov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"Common Corpus(커먼 코퍼스)"**라는 거대한 프로젝트에 대한 소개입니다. 쉽게 말해, **"인공지능 (AI) 이 배우기 위해 필요한, 누구나 자유롭게 쓸 수 있는 가장 큰 '공공 도서관'을 만들었다"**는 이야기입니다.

이 복잡한 내용을 일상적인 비유로 풀어보면 다음과 같습니다.

1. 문제 상황: "남의 책 훔쳐 읽는 AI"

지금까지 AI(거대 언어 모델) 를 만들 때는 인터넷에 떠도는 모든 글을 모아서 학습시켰습니다. 하지만 이 방식은 큰 문제가 있었습니다.

  • 비유: 마치 누군가 남의 집 장서나 저작권이 있는 베스트셀러를 몰래 복사해서 AI 에게 읽게 한 것과 같습니다.
  • 결과: 책 출판사나 작가들이 "내 책도 허락 없이 썼다"며 소송을 걸고, AI 개발자들은 "이제부터는 쓸 수 있는 책이 없다"며 당황하게 되었습니다. 인터넷의 많은 자료는 이제 AI 가 접근하는 것이 금지되거나 제한되고 있습니다.

2. 해결책: "공짜로 누구나 빌려 쓸 수 있는 거대한 도서관"

저자들은 이 문제를 해결하기 위해 Common Corpus를 만들었습니다.

  • 특징: 이 도서관에 있는 책 (데이터) 은 모두 저작권이 만료되었거나, 저자가 "누구나 써도 된다"고 허락한 것들뿐입니다.
  • 규모:2 조 개의 단어 (토큰) 가 들어있는데, 이는 AI 가 배울 수 있는 가장 큰 '공공' 자료입니다.
  • 다양성: 영어뿐만 아니라 프랑스어, 독일어, 스페인어 등 다양한 언어와, 고전 문학, 과학 논문, 정부 문서, 컴퓨터 코드 등 다양한 주제가 섞여 있습니다. 마치 전 세계의 모든 언어와 지식을 한곳에 모은 '세계 도서관' 같습니다.

3. 어떻게 만들었나? "정성스러운 정리와 청소"

단순히 인터넷에서 긁어모은 것이 아니라, 매우 꼼꼼하게 정제했습니다.

  • 오류 수정: 오래된 책들은 글자가 깨져 있거나 (OCR 오류), 오타가 많습니다. 저자들은 이를 고쳐주는 전용 AI 도구들을 만들어 "책장을 다듬고 글자를 교정"했습니다.
  • 위험 제거: 과거의 책들에는 인종차별이나 혐오 표현이 들어있을 수 있습니다. 이를 찾아내어 AI 가 배우지 않도록 '청소'했습니다.
  • 개인정보 보호: 책 속에 실수로 들어간 전화번호나 주소 같은 개인정보는 모두 가려서 (익명화) 처리했습니다.

4. 성능은 어떨까? "작은 도서관도 큰 성과를 낸다"

저자들은 이 데이터를 가지고 작은 크기의 AI 모델 두 개를 훈련시켰습니다.

  • 결과: 비록 데이터 양이 거대 상용 모델들보다 적지만, 동일한 크기의 다른 모델들과 비교해도 전혀 뒤지지 않는 훌륭한 성능을 보여주었습니다.
  • 의미: "저작권 문제 없이, 합법적으로만 모은 데이터로도 훌륭한 AI 를 만들 수 있다"는 것을 증명했습니다.

5. 결론: "열린 과학을 위한 첫걸음"

이 프로젝트는 AI 개발이 "누군가의 허락을 기다리는 것"이 아니라, "공공의 이익을 위해 투명하게 이루어질 수 있다"는 것을 보여줍니다.

  • 비유: 마치 AI 개발자들이 이제부터는 '남의 집 열쇠'를 훔쳐 쓰지 않고, '공공 도서관'의 열쇠를 가지고 자유롭게 책을 읽으며 지식을 쌓을 수 있게 된 것입니다.

한 줄 요약:

"저작권 분쟁의 위험 없이, 전 세계의 다양한 언어와 지식을 합법적으로 모아 만든 **'AI 를 위한 거대한 공공 도서관'**을 만들었으며, 이 도서관의 책들만으로도 훌륭한 AI 를 만들 수 있음을 증명했습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →