SomaliWeb v1: A Quality-Filtered Somali Web Corpus with a Matched Tokenizer and a Public Language-Identification Benchmark
본 논문은 약 3억 300 만 토큰 규모의 공개된 품질 필터링 소말리아어 말뭉치인 SomaliWeb v1 과 이에 대응하는 BPE-16K 토크나이저, 그리고 기존 다국어 소말리아어 데이터 분포에서 상당한 품질 결함을 드러내는 최초의 공개 언어 식별 벤치마크를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 수백 가지 다른 언어로 된 책들이 들어 있는 거대하고 혼란스러운 도서관이라고 상상해 보세요. 오랫동안 이 도서관의 "소말리아어" 섹션은 엉망이었습니다. 명확한 표지가 있는 전용 방이 아니라, 소말리아어 책들은 거대한 혼합 언어 선반에 무작위로 흩어져 있었고, 종종 쓰레기, 찢어진 페이지, 또는 중복된 사본들과 섞여 있었습니다.
SomaliWeb v1은 누군가가 그 혼란스러운 도서관에 들어가 소말리아어만을 위한 전용 방을 짓고 제대로 정리한 첫 번째 사례입니다. 저자들이 이를 어떻게 했는지 간단히 설명해 드리겠습니다:
1. 문제: "노이즈"가 가득한 도서관
이 프로젝트 이전에는 컴퓨터에게 소말리아어를 가르치고 싶다면 인터넷에서 혼합 언어 텍스트가 담긴 거대한 가방을 하나 집어와야 했습니다.
- 혼합: 소말리아어가 포함되어 있었지만, 영어, 프랑스어 등 다른 언어들과 섞여 있었습니다.
- 노이즈: 심지어 이러한 가방들의 "정제된" 버전조차 오류로 가득 차 있었습니다. 저자들은 한 인기 있는 가방 (HPLT v2 라고 함) 에 다음과 같은 문제들이 있음을 발견했습니다:
- 17% 중복: 같은 책을 17 번 인쇄하여 스테이플러로 묶어놓은 것과 같습니다.
- 56% "모지바케 (Mojibake)": 컴퓨터가 문자를 잘못 읽어서 텍스트가 의미 없는 글자처럼 보이는 경우 (예:
é대신Ãé) 입니다. 잉크가 번져서 무의미한 글자로 변한 책과 같습니다. - 거의 중복된 사본: 몇 단어를 바꾼 것 외에는 90% 가 동일한 책들입니다.
2. 해결책: 여섯 단계의 "체"
저자들은 원시 인터넷 텍스트를 좋은 것만 남도록 걸러내는 여섯 단계의 기계 (파이프라인) 를 구축했습니다. 금을 채취하는 과정을 생각해보시면 됩니다:
- 1 단계: 중복 감지기. 그들은 모든 문서를 스캔하여 정확한 복사본들을 폐기했습니다. 결과: 더미의 약 14% 를 제거했습니다.
- 2 단계: 수리 작업소. 그들은 "무의미한" 텍스트를 수리하는 도구를 사용했고, 너무 짧은 것들 (50 단어 미만) 은 폐기했습니다. 결과: 남은 텍스트의 절반을 수리했고, 짧고 쓸모 없는 조각들을 제거했습니다.
- 3 단계: 언어 경찰. 그들은 텍스트가 실제로 소말리아어인지 확인하는 테스트를 실행했습니다. 문서가 대부분 영어라면 퇴출시켰습니다. 결과: 아주 적은 양의 "영어 누출"이 제거되었습니다.
- 4 단계: "거의 복제본" 사냥꾼. 그들은 MinHash 라는 스마트한 수학 트릭을 사용하여 서로 80% 가 동일한 문서를 찾아내고 가장 좋은 버전만 남겼습니다. 결과: 더미의 또 다른 10% 를 제거했습니다.
- 5 단계: 품질 검사. 그들은 텍스트를 "금표준 (소말리아어 위키피디아)"과 비교하여 단어와 패턴이 유창하고 자연스러운 소말리아어처럼 보이는지 확인했습니다. 문서가 이상하거나 깨져 보이면 폐기했습니다. 결과: 품질이 가장 낮은 텍스트의 하위 15% 를 제거했습니다.
- 6 단계: 최종 마무리. 그들은 남은 문서를 섞어 "학습" 세트와 "테스트" 세트로 나누고, 맞춤형 **토크나이저 (tokenizer)**를 생성했습니다.
3. 새로운 도구: 맞춤형 사전
컴퓨터가 텍스트를 읽을 때, 단어를 "토큰"이라고 불리는 더 작은 조각들로 나눕니다.
- 옛 방식: GPT-4 의 것과 같은 범용 사전을 사용하면 소말리아어 단어가 작고 비효율적인 조각들로 잘렸습니다. 큰 피자를 작은 숟가락으로 먹으려는 것과 같습니다. 식사를 끝내려면 숟가락질 (토큰) 을 매우 많이 해야 합니다.
- 새 방식: 저자들은 소말리아어 전용으로 맞춤형 사전을 구축했습니다.
- 결과: 그들의 사전은 40% 더 효율적입니다. 같은 양의 텍스트를 읽는 데 필요한 "숟가락질"이 40% 적습니다. 이는 나중에 이 데이터를 사용하는 모든 사람에게 비용과 컴퓨팅 파워를 절약해 줍니다.
4. 벤치마크: 언어 탐지기를 위한 "운전 면허 시험"
저자들은 또한 어떤 컴퓨터 프로그램이 소말리아어 텍스트를 식별하는 데 가장 뛰어난지 확인하기 위한 테스트를 만들었습니다. 그들은 세 가지 인기 도구를 테스트했습니다:
- 놀라운 승자: 가장 오래된 도구인
langdetect가 소말리아어를 찾아내는 데 가장 잘 수행했습니다. - 패자: 더 새롭고 복잡한 도구 (
fastText) 는 처참하게 실패했으며, 종종 소말리아어를 완전히 다른 언어로 오인했습니다. - 교훈: 도구가 새롭다고 해서 특정 언어에 더 좋은 것은 아닙니다.
공개된 내용 요약
저자들은 단순히 논문을 쓴 것이 아니라, 대중을 위해 세 가지 실제 도구를 공개했습니다:
- 코퍼스 (Corpus): **819,000 개의 소말리아어 문서 (약 3 억 300 만 단어)**로 구성된 깨끗하고 고품질의 컬렉션.
- 토크나이저: 범용 사전보다 소말리아어를 훨씬 더 효율적으로 읽는 맞춤형 "사전".
- 벤치마크: 실제로 소말리아어에 작동하는 언어 탐지기를 보여주는 공개 테스트 성적표.
그들이 하지 않은 일 (논문에 따르면):
그들은 아직 이 데이터로 새로운 AI 챗봇이나 언어 모델을 훈련시키지 않았습니다. 그들은 오직 재료(깨끗한 데이터와 도구) 만을 만들고 그 재료들이 고품질임을 증명했을 뿐입니다. "요리"(모델 훈련과 얼마나 똑똑해지는지 테스트) 는 차기 버전 (v2) 을 위해 남겨두었습니다.
간단히 말해: SomaliWeb v1 은 인터넷에서 엉망이고 깨진 소말리아어 텍스트를 가져와 정리하고 조직화한 뒤, 연구자들에게 맞춤형 도구 세트를 제공하여 연구자들이 직접 모든 정리를 하지 않고도 소말리아어 사용자를 위한 더 나은 AI 를 구축할 수 있게 한 첫 번째 사례입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.