MajinBook: An open catalogue of digitally mediated world literature
Questo articolo presenta MajinBook, un catalogo aperto che collega i metadati delle biblioteche ombra ai dati di Goodreads per creare un corpus ad alta precisione e leggibile da macchina di oltre 539.000 libri in lingua inglese mediati digitalmente, affrontando al contempo i pregiudizi tradizionali dei corpus e discutendo la liceità giuridica del progetto per la ricerca nell'ambito dei quadri normativo dell'UE e degli USA.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Il Quadro Generale: Costruire una Mappa Bibliotecaria Migliore
Immagina di voler studiare come le persone leggono e quali storie contano per il mondo. Per farlo, hai bisogno di una mappa massiccia di libri.
Per molto tempo, i ricercatori hanno utilizzato HathiTrust, che è come una gigantesca biblioteca ufficiale costruita dalle università. Ha milioni di libri, ma presenta due grandi problemi:
- È bloccata: Molti libri sono protetti da copyright, quindi non puoi leggere il testo completo; puoi solo guardarli attraverso una finestra sicura e ristretta.
- È disordinata: Molti libri sono stati semplicemente scansionati da carta fisica. Il computer spesso legge male le lettere (come confondere una 'o' con uno '0'), rendendo il testo difficile da utilizzare per analisi informatiche avanzate.
Gli autori di questo paper volevano una mappa migliore. Si sono rivolti alle "Biblioteche Ombra" (come Library Genesis e Z-Library). Immagina queste come enormi bazar digitali sotterranei dove milioni di libri vengono condivisi liberamente. Hanno molti più libri della biblioteca ufficiale, ma sono caotici. Gli "scaffali" sono disorganizzati, le etichette sono spesso sbagliate o mancanti, ed è difficile capire quale libro sia quale.
MajinBook è il progetto che ha ripulito questo caos. Ha creato un catalogo di alta qualità e organizzato di oltre 539.000 libri in inglese (più milioni di altri in francese, tedesco e spagnolo) collegando i file disordinati delle "biblioteche ombra" ai dati organizzati di Goodreads (la rete sociale per gli amanti dei libri).
Gli Ingredienti: Come l'hanno Costruito
1. La Regola "Solo Digitale" (Il Setaccio)
Le biblioteche ombra hanno libri in molti formati. Alcuni sono PDF (scansioni digitali di pagine di carta), altri sono EPUB (file digitali nativi, come una pagina web pulita).
Gli autori hanno deciso di scartare tutti i PDF.
- L'Analogia: Immagina di voler studiare il sapore di una zuppa. I PDF sono come fare una foto della zuppa e provare a gustare la foto. È sfocato e inconsistente. Gli EPUB sono come la zuppa vera in una ciotola; puoi assaggiare chiaramente ogni ingrediente.
- Il Risultato: Mantenendo solo i file digitali "puliti" (EPUB), hanno perso alcuni libri molto vecchi (perché non erano ancora stati digitalizzati), ma hanno guadagnato un dataset molto più pulito, più facile da leggere per i computer e sorprendentemente diversificato per lingue.
2. Il Problema "Opera vs. Edizione"
Nel mondo dei libri, c'è una differenza tra un'Opera (la storia stessa, come L'Odissea) e un'Edizione (una versione specifica, come la traduzione del 1990 o l'audiolibro del 2020).
- Il Problema: Le biblioteche ombra potrebbero avere 50 file diversi per L'Odissea. Se li conti tutti come 50 libri diversi, i tuoi dati sono distorti.
- La Soluzione: Gli autori hanno usato Goodreads come "scheletro" o "sistema di archiviazione". Goodreads sa già che tutte le 50 versioni appartengono alla stessa "Opera". Hanno usato questa conoscenza per raggruppare i file disordinati delle biblioteche ombra, collegandoli alla storia corretta e alla sua data di pubblicazione originale.
3. Il Gioco di Abbinamento (Trovare l'ago nel pagliaio)
Come si collega un file disordinato di una biblioteca ombra alla voce corretta su Goodreads?
- La Strategia: Non hanno provato a far corrispondere l'esatta copertina o il numero di pagine (che spesso cambiano). Invece, hanno guardato gli identificatori (come i numeri ISBN) e i titoli.
- La Logica Fuzzy: A volte un titolo è leggermente sbagliato nella biblioteca ombra (ad esempio, "Harry Pottter"). Gli autori hanno usato un trucco informatico chiamato "fuzzy matching" per capire: "Ehi, quello è probabilmente Harry Potter".
- Il Controllo di Sicurezza: Hanno testato questo metodo facendo controllare 200 abbinamenti casuali da umani. Hanno scoperto che se il computer dava un "punteggio di confidenza" di 80 o superiore, era quasi sempre corretto. Hanno impostato la loro regola finale su quella soglia di 80 punti per garantire che il loro catalogo fosse altamente accurato.
I Risultati: Cosa Hanno Scoperto
- Una Raccolta Massiccia e Pulita: Hanno creato un elenco di 539.000 libri in inglese pronti per essere analizzati dai computer.
- Un Bias Temporale (Ma Utile): Poiché hanno mantenuto solo file "digitali nativi", la loro raccolta ha meno libri degli anni 1800 e più degli anni 2000.
- La Posizione del Paper: Gli autori ammettono che questa non è una storia perfetta di tutta la letteratura. Invece, è una storia perfetta della cultura digitale del XXI secolo. Ci mostra quali libri sono popolari ora, nell'era digitale.
- Più Lingue: Sorprendentemente, filtrando per file digitali, hanno ottenuto una miscela di lingue più diversificata. Il mucchio dei "PDF" era per lo più in inglese, ma il mucchio degli "EPUB" includeva una quantità significativa di francese, tedesco, spagnolo e altri.
La "Piccola Stampa" Legale
Il paper affronta una domanda delicata: È legale usare queste biblioteche ombra per la ricerca?
- L'Argomento: Gli autori sostengono che non stanno vendendo i libri o distribuendo le storie. Stanno pubblicando solo un elenco di fatti (titoli, autori, date).
- L'Analogia: È come un bibliotecario che crea un catalogo a schede. Il catalogo a schede non contiene la storia; ti dice solo dove si trova la storia e chi l'ha scritta. Gli autori affermano che creare questo "catalogo a schede" a scopo di ricerca rientra nelle eccezioni legali per il "Text and Data Mining" sia negli USA che nell'UE.
Riassunto
MajinBook è uno strumento che prende il mondo caotico, massiccio e spesso disordinato delle "biblioteche ombra" e lo organizza utilizzando la saggezza sociale di Goodreads. Il risultato è un elenco di libri super-pulito e compatibile con i computer che aiuta i ricercatori a studiare la cultura, la letteratura e le abitudini di lettura nell'era digitale, navigando al contempo il complesso panorama legale del copyright.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.