Wiki Dumps to Training Corpora: South Slavic Case
Este artículo presenta una metodología agnóstica al idioma para transformar volcados brutos de Wikimedia en corpus de entrenamiento de alta calidad y ricos lingüísticamente para siete lenguas eslavas del sur, mediante la extracción sistemática de texto de múltiples proyectos wiki y el empleo de filtrado basado en n-gramas para eliminar artículos de baja calidad y repetitivos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que quieres construir una biblioteca masiva de historias, poemas y artículos de noticias para enseñar a un robot a hablar y comprender siete idiomas eslavos del sur diferentes (como el serbio, el croata, el búlgaro y otros). Decides utilizar Wikipedia y sus sitios hermanos (como Wikisource o Wikinews) como material fuente porque son gratuitos y están llenos de texto.
Sin embargo, si simplemente tomas los archivos crudos de estos sitios web, no estás obteniendo una biblioteca de historias. Estás obteniendo un almacén caótico lleno de:
- Escombros de construcción: Códigos informáticos ocultos, instrucciones de formato y "planos" que le dicen al sitio web cómo verse pero que no forman parte de la historia.
- Vidrios rotos: Enlaces rotos y secciones vacías.
- Clones fabricados en serie: Miles de artículos que parecen casi idénticos porque fueron generados automáticamente a partir de bases de datos en lugar de ser escritos por humanos.
Este artículo es una guía sobre cómo limpiar ese almacén desordenado y convertirlo en una biblioteca impecable. El autor, Mihailo Škorić, divide el proceso en dos fases principales: La Gran Limpieza y El Filtro de Calidad.
Fase 1: La Gran Limpieza (Extracción de texto)
Piensa en los datos crudos de Wikipedia como una casa que aún está en construcción. Tiene andamios, latas de pintura y planos por todas partes. Aún no puedes vivir en ella.
El autor construyó un "equipo de construcción" especializado (un programa informático) para despojar la casa hasta sus muros desnudos y habitables.
- Desmontar los andamios: El programa utiliza una herramienta llamada
mwparserfromhell(un nombre sofisticado para una herramienta que entiende el lenguaje secreto de Wikipedia) para arrancar todo el código informático, las plantillas y las etiquetas de formato. - Eliminar el ruido: Elimina las listas de "Categorías" (como etiquetas en un archivador), quita las descripciones de imágenes y elimina las secciones de "Referencias" que parecen notas al pie pero que no forman parte de la historia principal.
- Aplanar las tablas: Wikipedia a menudo utiliza tablas para organizar datos. El programa convierte estas cuadrículas complejas en oraciones simples y legibles para que el robot no se confunda con las líneas de la cuadrícula.
- El resultado: Después de esta fase, tienes un montón de texto plano y limpio. Ya no es un sitio web; son solo palabras.
Fase 2: El Filtro de Calidad (Eliminación de los clones)
Ahora que tienes texto limpio, hay un nuevo problema. Algunos de los artículos son textos "zombis". Estos son artículos que parecen escritos por un humano, pero que en realidad fueron generados automáticamente por una computadora. Son repetitivos, aburridos y dicen lo mismo una y otra vez de formas ligeramente diferentes.
Si alimentas a tu robot con estos artículos "zombis", aprenderá a hablar en un bucle robótico y repetitivo. Para solucionar esto, el autor utiliza una Estrategia de Detective:
- Agrupación por vecindario: El programa agrupa los artículos por su tema (por ejemplo, todos los artículos sobre "Historia" van en una habitación, todos los de "Deportes" en otra). Es más fácil encontrar duplicados si solo comparas manzanas con manzanas.
- El escaneo de "huella dactilar": El programa convierte cada artículo en una "huella dactilar" matemática (un vector). Examina las primeras palabras del artículo para ver si coincide con el patrón de una plantilla.
- La prueba de similitud: Compara estas huellas dactilares entre sí utilizando un truco matemático llamado MinHashing. Imagina que tienes dos libros. Si comparten demasiadas oraciones idénticas en el mismo orden, es probable que sean clones.
- El corte: El programa calcula una "puntuación de similitud". Si un artículo es demasiado similar a otros (por encima de un cierto umbral), es expulsado de la biblioteca. Es como un portero en un club que dice: "Te ves exactamente igual que todos los demás en la fila; no vas a entrar".
Los Resultados
El artículo probó este método en siete idiomas eslavos del sur. Los resultados fueron dramáticos:
- Serbio: Tenía el mayor desorden que limpiar. Antes de la filtración, tenía más de 500.000 artículos. Después de que el "portero" hiciera su trabajo, casi la mitad fueron eliminados porque eran duplicados o generados automáticamente. La cantidad de palabras disminuyó en casi un 60%.
- Búlgaro y esloveno: Estos ya estaban bastante limpios, por lo que perdieron menos artículos.
- La recompensa: El resultado final es una biblioteca más pequeña, pero de mucha mayor calidad. Las palabras en estas nuevas bibliotecas coinciden con cómo hablan realmente los humanos, en lugar de cómo una base de datos genera texto.
Por qué esto es importante
El autor argumenta que, para que un robot aprenda bien un idioma, necesita leer verdadera escritura humana, no relleno generado por computadora. Al realizar este proceso de dos pasos (limpiar el código y luego filtrar los clones), el artículo proporciona un conjunto confiable y de alta calidad de libros para entrenar modelos de IA en idiomas eslavos del sur.
En resumen: El artículo nos enseña cómo tomar un vertedero desordenado y lleno de código de Wikipedia, limpiarlo de basura informática y luego tirar los artículos de "copiar y pegar", dejando atrás una colección pura de lenguaje humano lista para que un robot aprenda de ella.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.