← Últimos artículos
💬 NLP

Sri Lanka Document Datasets: A Large-Scale, Multilingual Resource for Law, News, and Policy

Este artículo presenta una colección de conjuntos de datos abiertos, multilingües y a gran escala que comprende más de 278.000 documentos en cingalés, tamil e inglés, que cubren el derecho, las noticias y las políticas de Sri Lanka para apoyar la investigación en lingüística computacional y estudios sociopolíticos.

Autores originales: Nuwan I. Senaratna

Publicado 2026-07-03
📖 4 min de lectura☕ Lectura para el café

Autores originales: Nuwan I. Senaratna

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagine los registros públicos de Sri Lanka —leyes, noticias, decisiones judiciales e informes gubernamentales— como una biblioteca masiva y caótica dispersa en cientos de edificios diferentes. Algunos libros están encerrados en vitrinas de cristal (PDF), otros son solo garabatos en papeles sueltos (sitios web), y muchos están escritos en tres idiomas diferentes: cingalés, tamil e inglés. Para un ciudadano común, un periodista o un investigador, intentar encontrar un dato específico en este desorden es como buscar una aguja en un pajar que no deja de moverse.

Este documento presenta un proyecto llamado Sri Lanka Document Datasets, que actúa como un bibliotecario súper organizado y un camión de mudanzas digital combinados. Esto es lo que han construido:

1. La Gran Colección (El "Almacén Digital")

El equipo ha reunido 278.621 documentos (unos 80,7 GB de datos) en un paquete único, ordenado y legible por máquinas. Piense en esto como la construcción de un solo y gigante almacén donde cada pieza de información importante de Sri Lanka está clasificada, etiquetada y lista para ser utilizada.

La colección incluye:

  • La "Biblioteca de Leyes": Debates parlamentarios (Hansards), fallos de la Corte Suprema y comunicados de prensa policiales.
  • El "Libro de Reglas": Leyes reales (Actas), proyectos de ley (Bills) y avisos gubernamentales urgentes (Gazettes).
  • El "Puesto de Noticias": Miles de artículos de noticias y actualizaciones gubernamentales.
  • El "Informe de Clima y Economía": Estadísticas de turismo, precios del pescado, alertas de inundaciones e informes bancarios.

Todo esto está disponible en tres idiomas, lo que lo convierte en un verdadero tesoro multilingüe.

2. La Máquina Mágica (El "Pipeline de Recolección")

¿Cómo consiguieron todos estos datos? No contrataron a un equipo de personas para copiar y pegar documentos manualmente. En su lugar, construyeron un sistema de robot automatizado.

  • El Explorador: Este robot visita los sitios web oficiales del gobierno todos los días. Es educado; consulta los carteles de "Prohibido el Paso" (robots.txt) y espera su turno para no colapsar los sitios web.
  • El Clasificador: Cuando el robot encuentra un nuevo documento, no solo lo agarra; verifica si ya está allí. Si es nuevo, lo descarga, lo lee y lo limpia.
  • El Traductor y Limpiador: El sistema toma PDFs desordenados (que son como imágenes de texto) y los convierte en texto limpio y buscable. Corrige líneas rotas y organiza los datos en un formato estándar (JSON) para que las computadoras puedan entenderlos fácilmente.
  • La Actualización Diaria: Este robot se ejecuta automáticamente, varias veces al día. Si se aprueba una nueva ley o se emite una nueva alerta de inundación, el sistema la detecta y la añade a la colección de inmediato.

3. La Política de Puertas Abiertas (Licencias y Acceso)

Normalmente, los grandes conjuntos de datos están bloqueados tras muros de pago o requieren permisos especiales para su uso. Este proyecto es diferente. Es como un parque público en lugar de un club privado.

  • Entrada Gratuita: Cualquier persona puede descargar los datos de forma gratuita.
  • Libre para Modificar: Usted puede tomar los datos, corregir errores o construir sus propias herramientas sobre ellos, siempre y cuando dé crédito a los creadores originales.
  • Siempre Disponible: Los datos están replicados en dos plataformas populares (GitHub y Hugging Face), asegurando que incluso si un sitio falla, la biblioteca siga abierta.

4. ¿Qué sigue? (Planes Futuros)

El documento describe tres objetivos principales para el futuro:

  1. Expandir la Biblioteca: Añadir más tipos de documentos de otros departamentos gubernamentales y archivos históricos.
  2. Pulir el Lenguaje: Mejorar cómo el sistema lee oraciones complejas en cingalés y tamil, asegurando que el "robot" comprenda perfectamente los matices de los idiomas.
  3. Leer lo Manuscrito/Escaneado: Actualmente, el sistema tiene dificultades con documentos borrosos o escaneados. Planean enseñar al robot a usar "ojos" (tecnología OCR) para leer texto de imágenes de baja calidad, convirtiendo incluso los papeles más desordenados en texto digital limpio.

¿Por qué es esto importante?

El documento argumenta que, al convertir registros fragmentados y difíciles de leer en una base de datos limpia, abierta y buscable, están otorgando un superpoder a investigadores, periodistas y ciudadanos. Esto les permite rastrear cómo cambian las leyes, monitorear las decisiones gubernamentales y estudiar la historia del país sin perderse en el papeleo. Se trata de hacer que el "registro digital" de Sri Lanka sea accesible para todos, no solo para aquellos que tienen el tiempo o las herramientas para excavar en los archivos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →