MajinBook: An open catalogue of digitally mediated world literature
Este artigo apresenta o MajinBook, um catálogo aberto que vincula metadados de bibliotecas sombra a dados do Goodreads para criar um corpus de alta precisão e legível por máquina, contendo mais de 539.000 livros em inglês mediados digitalmente, ao mesmo tempo que aborda vieses tradicionais de corpus e discute a permissibilidade legal do projeto para pesquisa nos quadros da UE e dos EUA.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A Visão Geral: Construindo um Mapa de Biblioteca Melhor
Imagine que você quer estudar como as pessoas leem e quais histórias importam para o mundo. Para fazer isso, você precisa de um mapa massivo de livros.
Por muito tempo, os pesquisadores usaram o HathiTrust, que é como uma biblioteca gigante e oficial construída por universidades. Ela tem milhões de livros, mas tem dois grandes problemas:
- Está trancada: Muitos livros estão sob direitos autorais, então você não pode ler o texto completo; só pode vê-los através de uma janela segura e restrita.
- Está bagunçada: Muitos livros foram apenas digitalizados a partir de papel físico. O computador frequentemente lê as letras erradas (como confundir um 'o' com um '0'), tornando o texto difícil de usar para análises computacionais avançadas.
Os autores deste artigo queriam um mapa melhor. Eles se voltaram para as "Bibliotecas Sombra" (como Library Genesis e Z-Library). Pense nelas como bazares digitais subterrâneos massivos onde milhões de livros são compartilhados gratuitamente. Elas têm muito mais livros do que a biblioteca oficial, mas são caóticas. As "prateleiras" estão desorganizadas, os rótulos estão frequentemente errados ou faltando, e é difícil dizer qual livro é qual.
MajinBook é o projeto que limpou esse caos. Ele criou um catálogo de alta qualidade e organizado de mais de 539.000 livros em inglês (além de milhões de outros em francês, alemão e espanhol) conectando os arquivos bagunçados da "biblioteca sombra" aos dados organizados do Goodreads (a rede social para amantes de livros).
Os Ingredientes: Como Eles Construíram Isso
1. A Regra "Apenas Digital" (A Peneira)
As bibliotecas sombra têm livros em muitos formatos. Alguns são PDFs (digitalizações de páginas de papel) e outros são EPUBs (arquivos digitais nativos, como uma página da web limpa).
Os autores decidiram descartar todos os PDFs.
- A Analogia: Imagine que você está tentando estudar o sabor de uma sopa. Os PDFs são como tirar uma foto da sopa e tentar provar a imagem. Está borrado e inconsistente. Os EPUBs são como a sopa real em uma tigela; você pode provar cada ingrediente claramente.
- O Resultado: Ao manter apenas os arquivos digitais "limpos" (EPUBs), eles perderam alguns livros muito antigos (porque ainda não haviam sido digitalizados), mas ganharam um conjunto de dados muito mais limpo, mais fácil para computadores lerem e surpreendentemente diverso em idiomas.
2. O Problema "Obra vs. Edição"
No mundo dos livros, há uma diferença entre uma Obra (a história em si, como A Odisseia) e uma Edição (uma versão específica, como a tradução de 1990 ou o audiolivro de 2020).
- O Problema: As bibliotecas sombra podem ter 50 arquivos diferentes para A Odisseia. Se você contar todos eles como 50 livros diferentes, seus dados ficam distorcidos.
- A Solução: Os autores usaram o Goodreads como uma "espinha dorsal" ou um "sistema de arquivamento". O Goodreads já sabe que todas as 50 versões pertencem à mesma "Obra". Eles usaram esse conhecimento para agrupar os arquivos bagunçados da biblioteca sombra, vinculando-os à história correta e à sua data de publicação original.
3. O Jogo de Correspondência (Encontrando a Agulha no Palheiro)
Como conectar um arquivo bagunçado de uma biblioteca sombra à entrada correta no Goodreads?
- A Estratégia: Eles não tentaram corresponder a arte da capa exata ou a contagem de páginas (que frequentemente mudam). Em vez disso, olharam para identificadores (como números ISBN) e títulos.
- A Lógica Difusa: Às vezes, um título está levemente mal escrito na biblioteca sombra (por exemplo, "Harry Pottter"). Os autores usaram um truque de computador chamado "correspondência difusa" para perceber: "Ei, isso provavelmente é Harry Potter".
- A Verificação de Segurança: Eles testaram esse método fazendo com que humanos verificassem 200 correspondências aleatórias. Descobriram que, se o computador desse uma "pontuação de confiança" de 80 ou mais, estava quase sempre correto. Eles definiram sua regra final nesse limiar de 80 pontos para garantir que seu catálogo seja altamente preciso.
Os Resultados: O Que Eles Encontraram?
- Uma Coleção Massiva e Limpa: Eles criaram uma lista de 539.000 livros em inglês que estão prontos para serem analisados por computadores.
- Um Viés Temporal (Mas Útil): Como eles mantiveram apenas arquivos "digitais nativos", sua coleção tem menos livros dos anos 1800 e mais dos anos 2000.
- A Visão do Artigo: Os autores admitem que isso não é uma história perfeita de toda a literatura. Em vez disso, é uma história perfeita da cultura digital do século XXI. Mostra-nos quais livros são populares agora na era digital.
- Mais Idiomas: Surpreendentemente, ao filtrar por arquivos digitais, eles na verdade obtiveram uma mistura mais diversificada de idiomas. A pilha de "PDFs" era majoritariamente em inglês, mas a pilha de "EPUBs" incluía uma quantidade saudável de francês, alemão, espanhol e outros.
A "Letra Miúda" Legal
O artigo aborda uma questão complicada: É legal usar essas bibliotecas sombra para pesquisa?
- O Argumento: Os autores argumentam que eles não estão vendendo os livros ou distribuindo as histórias. Eles estão apenas publicando uma lista de fatos (títulos, autores, datas).
- A Analogia: É como um bibliotecário fazendo um catálogo de fichas. O catálogo de fichas não contém a história; apenas diz onde a história está e quem a escreveu. Os autores afirmam que criar esse "catálogo de fichas" para fins de pesquisa se enquadra nas exceções legais para "Mineração de Texto e Dados" tanto nos EUA quanto na UE.
Resumo
MajinBook é uma ferramenta que pega o mundo caótico, massivo e frequentemente bagunçado das "bibliotecas sombra" e o organiza usando a sabedoria social do Goodreads. O resultado é uma lista superlimpa e amigável para computadores de livros que ajuda pesquisadores a estudar cultura, literatura e hábitos de leitura na era digital, tudo enquanto navega pela complexa paisagem legal dos direitos autorais.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.