Wiki Dumps to Training Corpora: South Slavic Case
본 논문은 여러 위키 프로젝트를 체계적으로 추출하고 저품질의 반복적인 문서를 제거하기 위해 n-gram 기반 필터링을 적용하여 일곱 가지 남슬라브어권 언어에 대한 고품질이고 언어적으로 풍부한 학습 코퍼스를 생성하기 위한 언어 중립적 방법론을 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 도서관을 상상해 보세요. 그곳에는 로봇이 세르비아어, 크로아티아어, 불가리아어 등 일곱 가지 남슬라브어 언어를 말하고 이해하도록 가르치기 위한 이야기, 시, 뉴스 기사들이 담겨 있습니다. 당신은 무료이고 텍스트로 가득 차 있다는 이유로 위키백과와 그 자매 사이트 (위키소스나 위키뉴스 등) 를 원천 자료로 사용하기로 결정합니다.
하지만 이러한 웹사이트에서 원시 파일을 그대로 가져온다고 해서 이야기의 도서관을 얻는 것은 아닙니다. 대신 다음과 같은 혼란스러운 창고를 얻게 됩니다.
- 건설 잔해: 웹사이트의 외관을 어떻게 보여줄지 알려주는 '청사진'이지만 이야기의 일부는 아닌 숨겨진 컴퓨터 코드, 서식 지시문, 그리고 템플릿.
- 깨진 유리: 깨진 링크와 빈 섹션.
- 공장식 복제본: 인간이 쓴 것이 아니라 데이터베이스에서 자동으로 생성되었기 때문에 거의 동일하게 보이는 수천 개의 기사.
이 논문은 그 messy 한 창고를 정리하고 순결한 도서관으로 바꾸는 방법에 대한 가이드입니다. 저자 미하일로 스키리치는 이 과정을 대청소와 품질 필터라는 두 가지 주요 단계로 나눕니다.
1 단계: 대청소 (텍스트 추출)
원시 위키백과 데이터를 아직 공사 중인 집이라고 생각하세요. 여기저기에 비계, 페인트 통, 그리고 청사진이 널려 있습니다. 아직은 그 안에서 살 수 없습니다.
저자는 집을 거주 가능한 맨 벽까지 해체하기 위해 특수한 '건설 작업대' (컴퓨터 프로그램) 를 구축했습니다.
- 비계 제거: 프로그램은 위키백과의 비밀 언어를 이해하는 도구인
mwparserfromhell을 사용하여 모든 컴퓨터 코드, 템플릿, 서식 태그를 뜯어냅니다. - 노이즈 제거: '카테고리' 목록 (파일 캐비닛의 태그와 같은 것) 을 삭제하고, 이미지 설명을 제거하며, 각주처럼 보이지만 주요 이야기의 일부가 아닌 '참고문헌' 섹션을 제거합니다.
- 표 정리: 위키백과는 종종 데이터를 조직화하기 위해 표를 사용합니다. 이 프로그램은 복잡한 격자를 로봇이 격자 선에 혼란을 느끼지 않도록 단순하고 읽기 쉬운 문장으로 변환합니다.
- 결과: 이 단계가 끝나면 깨끗한 일반 텍스트 더미를 얻게 됩니다. 더 이상 웹사이트가 아니라 오직 단어들일 뿐입니다.
2 단계: 품질 필터 (복제본 제거)
이제 깨끗한 텍스트를 얻었지만, 새로운 문제가 발생합니다. 일부 기사는 '좀비' 텍스트입니다. 인간이 쓴 것처럼 보이지만 실제로는 컴퓨터가 자동 생성한 기사들입니다. 이들은 반복적이고 지루하며, 약간씩 다른 방식으로 같은 말을 반복합니다.
이러한 '좀비' 기사를 로봇에게 주면 로봇은 기계적이고 반복적인 루프 속에서 말하도록 배우게 됩니다. 이를 해결하기 위해 저자는 탐정 전략을 사용합니다.
- 이웃별 그룹화: 프로그램은 기사의 주제별로 그룹을 묶습니다 (예: '역사'에 관한 모든 기사는 한 방에, '스포츠'에 관한 모든 기사는 다른 방에). 사과와 사과만 비교할 때 중복을 찾기 쉽습니다.
- '지문' 스캔: 프로그램은 모든 기사를 수학적 '지문' (벡터) 으로 변환합니다. 기사의 처음 몇 단어를 살펴 템플릿의 패턴과 일치하는지 확인합니다.
- 유사성 테스트: MinHashing이라는 수학 트릭을 사용하여 이러한 지문들을 서로 비교합니다. 두 권의 책이 같은 순서로 너무 많은 동일한 문장을 공유한다면, 그들은 아마도 복제본일 것입니다.
- 컷오프: 프로그램은 '유사성 점수'를 계산합니다. 만약 기사가 다른 기사들과 너무 유사하다 (특정 임계값 이상) 면 도서관에서 퇴출됩니다. 마치 클럽의 도어맨이 "당신은 줄에 선 모든 사람과 똑같이 생겼어. 들어갈 수 없어"라고 말하는 것과 같습니다.
결과
이 논문은 일곱 가지 남슬라브어 언어에 대해 이 방법을 테스트했습니다. 결과는 극적이었습니다.
- 세르비아어: 정리할 가장 큰 혼란을 겪었습니다. 필터링 전에는 50 만 개 이상의 기사가 있었습니다. '도어맨'이 업무를 마친 후, 거의 절반이 중복이거나 자동 생성된 것이어서 제거되었습니다. 단어 수는 거의 60% 감소했습니다.
- 불가리아어와 슬로베니아어: 이들은 이미 꽤 깨끗했으므로 기사가 덜 제거되었습니다.
- 보상: 최종 결과는 더 작지만 훨씬 고품질의 도서관입니다. 이러한 새로운 도서관의 단어들은 데이터베이스가 텍스트를 생성하는 방식이 아니라 실제 인간이 말하는 방식과 일치합니다.
왜 이것이 중요한가
저자는 로봇이 언어를 잘 배우려면 컴퓨터가 생성한 채우기 텍스트가 아닌 실제 인간의 글을 읽어야 한다고 주장합니다. 이 두 단계 과정 (코드 정리, 그다음 복제본 필터링) 을 수행함으로써 이 논문은 남슬라브어 언어의 AI 모델을 훈련시키기 위한 신뢰할 수 있고 고품질의 책 세트를 제공합니다.
간단히 말해: 이 논문은 위키백과의 messy 하고 코드로 가득 찬 덤프를 가져와 컴퓨터 쓰레기를 깨끗이 닦아낸 다음, '복사 - 붙여넣기' 기사는 버려, 로봇이 배울 준비가 된 순수한 인간 언어의 컬렉션만 남기는 방법을 가르쳐 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.