Wiki Dumps to Training Corpora: South Slavic Case
Questo articolo presenta una metodologia indipendente dalla lingua per trasformare i dump grezzi di Wikimedia in corpora di addestramento di alta qualità e ricchi dal punto di vista linguistico per sette lingue slave del sud, estraendo sistematicamente il testo da più progetti wiki e impiegando un filtraggio basato sugli n-grammi per rimuovere articoli di bassa qualità e ripetitivi.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di voler costruire una biblioteca immensa di storie, poesie e articoli di giornale per insegnare a un robot a parlare e comprendere sette diverse lingue slave meridionali (come il serbo, il croato, il bulgaro e altre). Decidi di utilizzare Wikipedia e i suoi siti gemelli (come Wikisource o Wikinews) come materiale sorgente perché sono gratuiti e ricchi di testo.
Tuttavia, se ti limiti a scaricare i file grezzi da questi siti web, non stai ottenendo una biblioteca di storie. Stai ottenendo un magazzino caotico pieno di:
- Detriti da costruzione: Codici informatici nascosti, istruzioni di formattazione e "progetti" che dicono al sito web come apparire ma non fanno parte della storia.
- Vetro rotto: Collegamenti interrotti e sezioni vuote.
- Cloni prodotti in serie: Migliaia di articoli che sembrano quasi identici perché sono stati generati automaticamente da database invece che scritti da esseri umani.
Questo documento è una guida su come pulire quel magazzino disordinato e trasformarlo in una biblioteca immacolata. L'autore, Mihailo Škorić, suddivide il processo in due fasi principali: La Grande Pulizia e Il Filtro di Qualità.
Fase 1: La Grande Pulizia (Estrazione del Testo)
Pensa ai dati grezzi di Wikipedia come a una casa ancora in costruzione. Ha ponteggi, lattine di vernice e progetti ovunque. Non ci si può ancora vivere.
L'autore ha creato una "squadra di costruzione" specializzata (un programma informatico) per spogliare la casa fino alle sue pareti nude e abitabili.
- Rimuovere i Ponteggi: Il programma utilizza uno strumento chiamato
mwparserfromhell(un nome fantasioso per uno strumento che comprende il linguaggio segreto di Wikipedia) per strappare via tutto il codice informatico, i modelli e i tag di formattazione. - Eliminare il Rumore: Cancella le liste di "Categorie" (come le etichette su un archivio), rimuove le descrizioni delle immagini ed elimina le sezioni "Riferimenti" che sembrano note a piè di pagina ma non fanno parte della storia principale.
- Appiattire le Tabelle: Wikipedia usa spesso tabelle per organizzare i dati. Il programma trasforma queste griglie complesse in semplici frasi leggibili, in modo che il robot non si confonda con le linee della griglia.
- Il Risultato: Dopo questa fase, hai un mucchio di testo semplice e pulito. Non è più un sito web; sono solo parole.
Fase 2: Il Filtro di Qualità (Rimozione dei Cloni)
Ora che hai del testo pulito, sorge un nuovo problema. Alcuni articoli sono testi "zombie". Sono articoli che sembrano scritti da un umano, ma sono stati effettivamente generati automaticamente da un computer. Sono ripetitivi, noiosi e dicono la stessa cosa in modi leggermente diversi.
Se alimenti questi articoli "zombie" nel tuo robot, imparerà a parlare in un ciclo ripetitivo e robotico. Per risolvere questo problema, l'autore utilizza una Strategia da Detective:
- Raggruppamento per Quartiere: Il programma raggruppa gli articoli per argomento (ad esempio, tutti gli articoli sulla "Storia" vanno in una stanza, tutti quelli sullo "Sport" in un'altra). È più facile trovare duplicati se si confrontano solo mele con mele.
- La Scansione dell'"Impronta Digitale": Il programma trasforma ogni articolo in una "impronta digitale" matematica (un vettore). Esamina le prime parole dell'articolo per vedere se corrisponde al modello di un modello.
- Il Test di Somiglianza: Confronta queste impronte digitali tra loro utilizzando un trucco matematico chiamato MinHashing. Immagina di avere due libri. Se condividono troppe frasi identiche nello stesso ordine, sono probabilmente cloni.
- Il Limite: Il programma calcola un "punteggio di somiglianza". Se un articolo è troppo simile agli altri (superando una certa soglia), viene espulso dalla biblioteca. È come un buttafuori in un club che dice: "Sembri esattamente come tutti gli altri in fila; non entri".
I Risultati
Il documento ha testato questo metodo su sette lingue slave meridionali. I risultati sono stati drammatici:
- Serbo: Aveva il disordine più grande da pulire. Prima del filtraggio, aveva oltre 500.000 articoli. Dopo che il "buttafuori" ha fatto il suo lavoro, quasi la metà è stata rimossa perché erano duplicati o generati automaticamente. Il conteggio delle parole è diminuito di quasi il 60%.
- Bulgaro e Sloveno: Questi erano già piuttosto puliti, quindi hanno perso meno articoli.
- Il Guadagno: Il risultato finale è una biblioteca più piccola, ma di qualità molto superiore. Le parole in queste nuove biblioteche corrispondono a come parlano realmente gli esseri umani, piuttosto che a come un database genera testo.
Perché Questo È Importante
L'autore sostiene che affinché un robot impari bene una lingua, deve leggere veri scritti umani, non riempitivi generati da computer. Eseguendo questo processo in due fasi (pulendo il codice, poi filtrando i cloni), il documento fornisce un insieme affidabile e di alta qualità di libri per l'addestramento di modelli di intelligenza artificiale nelle lingue slave meridionali.
In sintesi: Il documento ci insegna come prendere un mucchio disordinato e pieno di codice di Wikipedia, pulirlo dai rifiuti informatici e poi scartare gli articoli "copia-incolla", lasciando dietro di sé una collezione pura di linguaggio umano pronta per essere appresa da un robot.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.