Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics
이 논문은 소규모 샘플로 BPE 토크나이저를 학습시킴으로써 웹 규모의 중국어 코퍼스 내 오염을 효율적으로 식별하는 경량 토큰 수준 감사 파이프라인인 Sampled-BPE를 소개하며, 이를 통해 공개 데이터셋 전반에 걸쳐 광범위하고 변화하는 오염 현상을 밝히는 동시에 추가 분석을 위한 계층적 데이터셋을 제공한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 모든 책, 블로그, 그리고 깨진 웹페이지가 하나의 텍스트 페이지가 되는 거대하고 끝없는 도서관이라고 상상해 보세요. 수년 동안 과학자들은 컴퓨터에게 이 도서관을 읽고 이해하는 법을 가르쳐서, 여러분이 대화할 수 있는 것과 같은 초지능형 AI 비서인 '대규모 언어 모델(LLM)'을 구축하려고 노력해 왔습니다. 하지만 문제는 인터넷이 단순히 깨끗한 도서관이 아니라, 스팸, 사기, 부적절한 콘텐츠로 가득 찬 무질서하고 혼란스러운 시장이기도 하다는 점입니다. AI가 이 지저갈한 도서량을 통해 학습하게 되면, 온라인 도박에 대해 글을 쓰거나 이상하고 불쾌한 문구를 생성하는 것과 같은 나쁜 습관을 우연히 배우게 될 수 있습니다. 이를 '코퍼스 오염(corpus pollution)'이라고 부릅니다. 이를 해결하기 위해 연구자들은 도서관을 감사(audit)해야 하지만, 도서관이 너무나 방대하여(수조 개의 페이지!) 모든 페이지를 읽는 것은 인간의 수명보다 더 오래 걸릴 것입니다. 그들은 모든 페이지를 일일이 확인하지 않고도 나쁜 사과들을 찾아낼 수 있는 방법을 찾아야 합니다.
이것이 바로 "SAMPLED-BPE 토큰 통계를 통한 중국어 웹 규모 코퍼스 감사(Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics)"라는 논문이 다루는 문제입니다. 칭화대학교와 다른 기관의 연구진으로 구성된 저자들은 중국어 인터넷 전체의 나쁜 콘텐츠를 스캔하는 것이 너무 느리고 비용이 많이 든다는 사실을 깨달았습니다. 그래서 그들은 SAMPLED-BPE라는 영리한 지름길을 발명했습니다. 이것은 마치 해양 생물학자가 거대한 바다가 얼마나 오염되었는지 알고 싶어 하는 것과 같습니다. 바닷물을 한 방울씩 모두 떠내는 대신, 서로 다른 지점에서 몇 개의 작은 샘플을 채취하여 분석하고, 이를 통해 전체 바다의 오염 수준을 추정하는 것입니다. 이 경우, '바다'는 중국 웹이며, '오염'은 AI 모델에 박혀버리는 유해하거나 스팸성인 단어(토큰)들입니다.
연구팀의 방법은 놀라울 정도로 간단하면서도 강력합니다. 그들은 거대한 중국어 텍스트 데이터의 아주 작은 조각(전체의 0.25%만큼도 안 되는 양)을 가져와서, 오직 그 조각만을 대상으로 특별한 '토크나이저'(텍스트를 작은 덩어리인 토큰으로 나누는 도구)를 학습시킨 다음, 어떤 토큰이 가장 자주 나타나는지 살펴봅니다. 만약 특정 텍록 덩어리가 이 작은 샘플에서 끊임없이 나타난다면, 그것은 전체 데이터셋에서도 흔한 패턴일 가능성이 높습니다. 그런 다음 그들은 스마트한 AI 비서를 사용하여 웹 검색을 통해 그 빈번한 덩어리들이 실제로 무엇을 의미하는지 확인합니다. 만약 어떤 덩어리가 도박 사이트나 음란한 문구로 밝혀지면, 이를 차단 대상으로 표시합니다.
그들의 연구 결과는 다소 충격적입니다. 그들은 11개의 서로 다른 오픈 소스 중국어 텍스트 컬렉션과 2021년부터 2026년까지의 6개 중국 웹 스냅샷을 감사했습니다. 그들은 오염이 어디에나 존재하지만, 고르게 퍼져 있지는 않다는 것을 발견했습니다. 어떤 데이터셋은 비교적 깨끗한 반면, 어떤 것들은 나쁜 콘텐츠에 완전히 잠겨 있었습니다. 예를 들어, OSCAR라고 불리는 데이터셋은 83% 이상이 오염된 것으로 밝혀졌으며, 그 대부분은 성인용 콘텐츠였습니다. 또 다른 데이터셋인 mC4는 온라인 도박 용어로 심하게 오염되어 있었습니다. 더욱 흥표로운 점은, 그들이 "중국 Common Crawl"(웹의 거대한 원시 데이터 덤프)이 매우 오염되어 있으며, 오염의 유형이 시간에 따라 변한다는 것을 발견했다는 것입니다. 2026년 스냅샷에서는 콘텐츠의 거의 69%가 성인용 자료였던 반면, 도박 관련 콘텐츠는 2021년 이후 크게 감소했습니다. 이는 웹상의 나쁜 것들이 움직이는 표적임을 시사합니다. 즉, 한 종류의 스팸이 차단되면 다른 종류가 다시 나타납니다.
이 논문은 단순히 '나쁜 단어'의 고정된 목록을 만들어 필터링할 수 있다는 생각에 반론을 제기합니다. 오염은 매우 빠르게 변하고, 종종 교묘한 약어나 결합된 단어(예: 두 개의 정상적인 단어를 섞어 도박 용어를 만드는 방식)를 사용하기 때문에, 고정된 목록은 금방 쓸모없게 됩니다. 대신, 저자들은 그들이 했던 것처럼 웹을 정기적으로 감사해야 한다고 제안합니다. 다른 사람들이 이 작업을 수행할 수 있도록, 그들은 짧고 나쁜 단어들이 어떻게 더 길고 복잡한 나쁜 문구로 성장하는지를 보여주는 '트리(tree)' 구조로 정리된 63만 개 이상의 기록이 담긴 방대한 새 데이터셋을 공개했습니다.
요약하자면, 이 논문은 바다가 더럽다는 것을 알기 위해 바닷물 전체를 읽을 필요는 없으며, 스마트하고 작은 샘플만으로도 충분히 명확한 그림을 얻을 수 있다는 것을 증명합니다. 그들은 현재 중국 웹이 AI 학습을 위해 매우 오염된 곳이며, 오염이 빠르게 변화하고 진화하고 있음을 보여주었습니다. 그들의 새로운 도구인 SAMPLED-BPE는 이 거대한 데이터셋을 몇 달이 아닌 몇 시간 만에 확인할 수 있게 해주며, 연구자들이 인터넷의 엄청난 크기에 압도되지 않고도 AI 모델을 깨끗하게 유지할 수 있는 방법을 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.