← 최신 논문
🤖 AI

Counting Documents Is Not Counting Text: Unit Bias in Web-PDF Corpus Statistics

이 논문은 웹-PDF 코퍼스 통계가 토큰당이 아닌 문서당 지표를 보고함으로써 상당한 "단위 편향(unit bias)"을 겪고 있음을 밝히며, 이는 소수의 대규모 문서가 텍스트의 대부분을 포함하고 있다는 사실과 현재의 절단 정책으로 인해 코퍼스 전체 콘텐츠의 절반 이상이 손실된다는 사실을 은폐한다.

원저자: Luca Foppiano

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Luca Foppiano

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷이라는 거대하고 혼란스러운 도서관 속에서, 인공지능에게 생각하는 법을 가르치기 위해 필수적인 새로운 종류의 책이 등장했습니다. 이것들은 우리가 마우스로 브라우징하는 웹 페이지가 아니라, 보고서, 학술 논문, 공식 양식을 공유하는 표준 형식인 PDF라는 형식의 디지털 문서들입니다. 수년 동안 이러한 지능형 시스템을 구축해 온 연구자들은 모든 디지털 파일을 단일하고 동일한 단위로 취급해 왔습니다. 만약 어떤 데이터셋에 백만 개의 문서가 있다면, 그들은 한 파일이 단 한 페이지짜리 전단지이든 오백 페이지짜리 백과사전이든 상관없이, 그 데이터가 백만 개의 동일한 정보 단위를 담고 있다고 가정했습니다. 이러한 가정은 세계에서 가장 진보된 컴퓨터 모델을 훈련하는 데 사용되는 데이터의 크기와 품질을 측정하는 방식을 형성해 왔습니다. 하지만 자세히 들여다보면, 파일의 개수를 세는 것은 단어의 개수를 세는 서투른 방법이며, 이 두 단위 사이의 차이가 우리가 데이터에 대해 알고 있었던 모든 것을 변화시킨다는 사실이 드러납니다.

커먼 크롤 재단(Common Crawl Foundation)의 루카 포피아노(Luca Foppiano)가 수행한 최근 연구는 연구자들이 이러한 방대한 텍스트 컬렉션을 설명하는 표준적인 방식에 의문을 제기합니다. 연구팀은 2021년의 특정 인터넷 스냅샷, 즉 약 800만 개의 웹 PDF를 포함하는 데이터셋을 조사했습니다. 이 데이터의 원래 제작자들은 데이터의 크기를 문서의 수로 보고했지만, 포피아노와 그의 동료들은 파일 내부의 실제 텍스트 양으로 이를 측정하기로 했습니다. 그들은 놀라운 불균형을 발견했습니다. 문서들은 전혀 서로 대체될 수 없는 것들이었습니다. 매우 긴 문서들, 즉 아주 적은 비율의 파일들이 전체 단어의 대다수를 포함하고 있었습니다. 실제로, 단 3% 남짓한 문서들이 전체 텍스트의 절반을 보유하고 있었던 반면, 나머지 97%가 나머지 절반을 나누어 가졌습니다. 이는 컬렉션을 파일 수로 본다면 짧은 메모와 양식들의 도서관처럼 보이지만, 단어 수로 본다면 거대하고 방대한 양의 책들이 지배하는 도서관이라는 것을 의미합니다.

이러한 길이의 왜곡은 데이터가 처리되는 방식과 그 과정에서 무엇이 손실되는지에 심각한 영향을 미칩니다. 이 파일들을 제공한 인터넷 아카이브에는 저장 공간을 절약하기 위한 규칙이 있습니다. 바로 일정 크기보다 큰 파일은 잘라낸다는 것입니다. 오랫동안 그 제한은 1메가바이트였습니다. 연구는 이 규칙이 컬렉션 내 문서의 거의 4분의 1에 영향을 미쳤음을 보여주며, 이는 관리 가능한 수준처럼 들립니다. 그러나 가장 긴 문서들이 잘려 나갔기 때문에, 이 잘려 나간 파일들은 전체 텍스트의 거의 3분의 2를 포함하고 있었습니다. 연구진이 이 잘려 나간 파일들의 누락된 부분을 재구성하려고 시도했을 때, 그 피해는 종종 영구적이라는 사실을 발견했습니다. 깨진 파일을 읽기 위해 두 가지 다른 표준 도구를 사용했을 때, 한 도구는 누락된 단어의 약 11%만을 복구할 수 있었고, 다른 도구는 겨우 1%만을 복구했습니다. 이 손상된 파일들의 대다수에 대해, 도구들은 텍스트를 전혀 추출할 수 없었으며, 이는 컴퓨터 모델의 지식에 상당한 공백을 남겼습니다.

연구진은 또한 저장 제한이 상향되었을 때 어떤 일이 발생하는지도 살펴보았습니다. 2025년에 제한이 5메가바이트로 상향되면서 이러한 조정이 일어났습니다. 이러한 조정은 잘려 나가는 파일의 수를 줄였지만, 텍스트 손실 문제를 해결하지는 못했습니다. 제한이 높아졌음에도 불구하고, 컬렉션 내 전체 단어의 거의 30%가 여전히 잘려 나갈 것이었습니다. 이 연구는 단순히 크기 제한을 높이는 것만으로는 가장 가치 있는 콘텐츠를 구하기에 충분하지 않다는 것을 입증합니다. 왜냐하면 가장 큰 문서들은 너무 거대해서 5메가바이트의 조각조차 그 시작 부분을 포착하기에는 너무 작기 때문입니다. 연구진은 이러한 데이터 컬렉션을 언급하는 방식이 오해의 소지가 있다고 결론지었습니다. 통계를 문서의 수로만 보고하는 것은 몇몇 거대한 파일이 거의 모든 정보를 보유하고 있다는 현실을 숨깁니다. 인공지능 시스템이 무엇을 배우고 있는지 진정으로 이해하려면, 우리는 단지 파일 수가 아니라 단어 수를 세어야 하며, 현재의 인터넷 저장 및 필터링 방식이 우리에게 필요한 텍스트의 대부분을 버리고 있다는 사실을 인식해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →