← 최신 논문
📊 statistics

MajinBook: An open catalogue of digitally mediated world literature

본 논문은 EU 및 US 체계 하에서 연구의 법적 허용성을 논의하고 전통적인 말뭉치 편향을 해소하면서 539,000 권 이상의 디지털 매개 영어 서적에 대한 고정밀 기계 판독 가능 말뭉치를 구축하기 위해 그림자 도서관의 메타데이터와 Goodreads 데이터를 연결하는 오픈 카탈로그인 MajinBook 을 소개한다.

원저자: Antoine Mazières, Thierry Poibeau

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Antoine Mazières, Thierry Poibeau

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 MajinBook 논문에 대한 설명으로, 개념을 명확히 하기 위해 일상적인 언어와 비유를 사용하여 번역한 것입니다.

큰 그림: 더 나은 도서관 지도 구축하기

사람들이 어떻게 책을 읽고, 어떤 이야기들이 세계에 중요한지 연구하고 싶다고 상상해 보세요. 이를 위해서는 방대한 책 지도가 필요합니다.

오랫동안 연구자들은 HathiTrust를 사용해 왔습니다. 이는 대학들이 건립한 거대한 공식 도서관과 같습니다. 수백만 권의 책이 있지만, 두 가지 큰 문제가 있습니다.

  1. 잠겨 있습니다: 많은 책이 저작권 보호를 받고 있어 전체 텍스트를 읽을 수 없습니다. 대신 안전하고 제한된 창구를 통해만 볼 수 있습니다.
  2. 정리가 안 되어 있습니다: 많은 책이 물리적인 종이에서 단순히 스캔되었습니다. 컴퓨터가 종종 글자를 잘못 읽습니다 (예: 'o'를 '0'으로 혼동). 이로 인해 고급 컴퓨터 분석에 텍스트를 사용하기 어렵습니다.

이 논문의 저자들은 더 나은 지도를 원했습니다. 그들은 "섀도우 라이브러리"(Library Genesis 및 Z-Library 등) 로 눈을 돌렸습니다. 이는 수백만 권의 책이 자유롭게 공유되는 거대한 지하 디지털 바자르와 같습니다. 공식 도서관보다 훨씬 더 많은 책을 보유하고 있지만, 혼란스럽습니다. "선반"은 정리되어 있지 않고, 라벨은 종종 잘못되었거나 누락되어 있으며, 어떤 책이 어떤 책인지 구분하기 어렵습니다.

MajinBook은 이 혼란을 정리한 프로젝트입니다. 이는 정리되지 않은 "섀도우 라이브러리" 파일들을 책 애호가들의 소셜 네트워크인 Goodreads의 정리된 데이터와 연결하여 539,000 권 이상의 영어 책(그리고 프랑스어, 독일어, 스페인어로 된 수백만 권의 다른 책) 의 고품질 정리된 목록을 만들었습니다.


재료: 어떻게 만들었는가

1. "디지털 전용" 규칙 (체)

섀도우 라이브러리에는 다양한 형식의 책이 있습니다. 일부는 PDF(종이 페이지의 디지털 스캔) 이고, 일부는 EPUB(깨끗한 웹페이지와 같은 네이티브 디지털 파일) 입니다.

저자들은 모든 PDF 를 폐기하기로 결정했습니다.

  • 비유: 수프의 맛을 연구하려고 한다고 상상해 보세요. PDF 는 수프의 사진을 찍고 그 그림을 맛보는 것과 같습니다. 흐릿하고 일관성이 없습니다. EPUB 은 그릇에 담긴 실제 수프와 같습니다. 모든 재료를 명확하게 맛볼 수 있습니다.
  • 결과: "깨끗한" 디지털 파일 (EPUB) 만 유지함으로써 아직 디지털화되지 않은 매우 오래된 책들은 잃었지만, 훨씬 더 깨끗하고 컴퓨터가 읽기 쉬우며 놀랍도록 다양한 언어를 가진 데이터 세트를 얻었습니다.

2. "작품 대 판" 문제

책의 세계에서는 작품(《오디세이》와 같은 이야기 자체) 과 (1990 년 번역본이나 2020 년 오디오북과 같은 특정 버전) 사이에 차이가 있습니다.

  • 문제: 섀도우 라이브러리에는《오디세이》에 대한 50 개의 서로 다른 파일이 있을 수 있습니다. 이를 모두 50 권의 서로 다른 책으로 계산하면 데이터가 왜곡됩니다.
  • 해결책: 저자들은 Goodreads를 "뼈대"나 "파일 시스템"으로 사용했습니다. Goodreads 는 이미 모든 50 가지 버전이 동일한 "작품"에 속한다는 것을 알고 있습니다. 그들은 이 지식을 활용하여 정리되지 않은 섀도우 라이브러리 파일들을 그룹화하고, 올바른 이야기와 원래 출판 날짜에 연결했습니다.

3. 매칭 게임 (건초더미 속의 바늘 찾기)

정리되지 않은 섀도우 라이브러리 파일을 Goodreads 의 올바른 항목에 어떻게 연결합니까?

  • 전략: 그들은 종종 변하는 표지 아트나 페이지 수를 정확히 매칭하려고 시도하지 않았습니다. 대신 식별자(ISBN 번호 등) 와 제목을 확인했습니다.
  • 모호한 논리 (Fuzzy Logic): 때때로 섀도우 라이브러리에서 제목이 약간 철자가 틀립니다 (예: "Harry Pottter"). 저자들은 "Hey, 그건 아마《해리 포터》일 거야"라고 깨닫기 위해 "모호한 매칭 (fuzzy matching)"이라는 컴퓨터 트릭을 사용했습니다.
  • 안전 점검: 그들은 이 방법을 테스트하기 위해 인간이 200 개의 무작위 매칭을 확인하게 했습니다. 컴퓨터가 "신뢰도 점수"가 80 이상을 주면 거의 항상 정확하다는 것을 발견했습니다. 그들은 카탈로그의 정확도를 극도로 높이기 위해 최종 규칙을 그 80 점 임계값으로 설정했습니다.

결과: 무엇을 발견했는가

  • 거대하고 깨끗한 컬렉션: 컴퓨터가 분석할 준비가 된 539,000 권의 영어 책 목록을 만들었습니다.
  • 시간 편향 (하지만 유용한 편향): 그들은 "네이티브 디지털" 파일만 유지했기 때문에, 그들의 컬렉션에는 1800 년대의 책이 적고 2000 년대의 책이 더 많습니다.
    • 논문의 견해: 저자들은 이것이 모든 문학의 완벽한 역사는 아니라고 인정합니다. 대신 이는 21 세기 디지털 문화의 완벽한 역사입니다. 이는 디지털 시대에 현재 어떤 책이 인기 있는지 보여줍니다.
  • 더 많은 언어: 놀랍게도 디지털 파일을 필터링함으로써, 그들은 실제로 더 다양한 언어의 혼합을 얻었습니다. "PDF" 더미는 대부분 영어였지만, "EPUB" 더미에는 프랑스어, 독일어, 스페인어 및 기타 언어가 상당량 포함되어 있었습니다.

법적 "세부 사항"

이 논문은 까다로운 질문을 다룹니다: 연구 목적으로 이러한 섀도우 라이브러리를 사용하는 것이 합법적인가?

  • 주장: 저자들은 책을 판매하거나 이야기를 배포하지 않는다고 주장합니다. 그들은 단지 사실 목록(제목, 저자, 날짜) 만 출판합니다.
  • 비유: 이는 사서가 카드 카탈로그를 만드는 것과 같습니다. 카드 카탈로그에는 이야기가 포함되어 있지 않습니다. 단지 이야기가 어디에 있고 누가 썼는지 알려줄 뿐입니다. 저자들은 연구 목적으로 이 "카드 카탈로그"를 만드는 것이 미국과 EU 모두에서 "텍스트 및 데이터 마이닝"을 위한 법적 예외에 해당한다고 주장합니다.

요약

MajinBook은 혼란스럽고 거대하며 종종 정리되지 않은 "섀도우 라이브러리"의 세계를 Goodreads의 사회적 지혜를 사용하여 정리하는 도구입니다. 그 결과로 나온 것은 초정리되고 컴퓨터 친화적인 책 목록으로, 연구자들이 디지털 시대의 문화, 문학 및 독서 습관을 연구하는 데 도움을 주며, 저작권의 복잡한 법적 지형을 항해할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →