← Últimos artigos
💬 NLP

Sri Lanka Document Datasets: A Large-Scale, Multilingual Resource for Law, News, and Policy

Este artigo apresenta uma coleção de conjuntos de dados abertos, multilingues e de grande escala, composta por mais de 278.000 documentos em cingalês, tâmil e inglês, abrangendo o direito, notícias e políticas do Sri Lanka para apoiar a investigação em linguística computacional e estudos sociopolíticos.

Autores originais: Nuwan I. Senaratna

Publicado 2026-07-03
📖 4 min de leitura☕ Leitura rápida

Autores originais: Nuwan I. Senaratna

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine os registos públicos do Sri Lanka — leis, notícias, decisões judiciais e relatórios governamentais — como uma biblioteca massiva e caótica espalhada por centenas de edifícios diferentes. Alguns livros estão trancados em vitrines de vidro (PDFs), outros são apenas rabiscos em papéis soltos (websites), e muitos estão escritos em três línguas diferentes: cingalês, tâmil e inglês. Para um cidadão comum, um jornalista ou um investigador, tentar encontrar um facto específico neste caos é como procurar uma agulha num palheiro que não para de se mover.

Este artigo apresenta um projeto chamado Sri Lanka Document Datasets, que atua como um bibliotecário superorganizado e um camião de mudança digital combinados. Eis o que eles construíram:

1. A Grande Coleção (O "Armazém Digital")

A equipa reuniu 278.621 documentos (cerca de 80,7 GB de dados) num pacote único, organizado e legível por máquinas. Pense nisto como a construção de um único e gigante armazém onde cada peça de informação importante do Sri Lanka está classificada, etiquetada e pronta a ser utilizada.

A coleção inclui:

  • A "Biblioteca de Leis": Debates parlamentares (Hansards), decisões do Supremo Tribunal e comunicados de imprensa da polícia.
  • O "Livro de Regras": Leis reais (Atos), projetos de lei (Bills) e avisos governamentais urgentes (Gazetas).
  • A "Banca de Jornais": Milhares de artigos de notícias e atualizações governamentais.
  • O "Relatório de Clima e Economia": Estatísticas de turismo, preços de peixe, alertas de inundação e relatórios bancários.

Tudo isto está disponível em três línguas, tornando-o um verdadeiro tesouro multilingue.

2. A Máquina Mágica (O "Pipeline de Recolha")

Como conseguiram todos estes dados? Não contrataram uma equipa de pessoas para copiar e colar documentos manualmente. Em vez disso, construíram um sistema de robôs automatizado.

  • O Explorador: Este robô visita sites oficiais do governo todos os dias. É educado; verifica as placas de "Proibida a Entrada" (robots.txt) e espera pela sua vez para não sobrecarregar os websites.
  • O Classificador: Quando o robô encontra um novo documento, não se limita a agarrá-lo; verifica se já lá está. Se for novo, faz o download, lê-o e limpa-o.
  • O Tradutor e Limpador: O sistema pega em PDFs desordenados (que são como imagens de texto) e transforma-os em texto limpo e pesquisável. Corrige linhas partidas e organiza os dados num formato padrão (JSON) para que os computadores possam compreendê-los facilmente.
  • A Atualização Diária: Este robô corre automaticamente, várias vezes ao dia. Se uma nova lei for aprovada ou um novo alerta de inundação for emitido, o sistema deteta-o e adiciona-o à coleção imediatamente.

3. A Política de Portas Abertas (Licenciamento e Acesso)

Normalmente, grandes conjuntos de dados estão trancados atrás de barreiras de pagamento ou requerem permissões especiais para serem usados. Este projeto é diferente. É como um parque público em vez de um clube privado.

  • Entrada Gratuita: Qualquer pessoa pode descarregar os dados gratuitamente.
  • Liberdade para Alterar: Pode utilizar os dados, corrigir erros ou construir as suas próprias ferramentas com base neles, desde que dê o crédito aos criadores originais.
  • Sempre Disponível: Os dados estão espelhados em duas plataformas populares (GitHub e Hugging Face), garantindo que, mesmo que um site fique offline, a biblioteca continue aberta.

4. O Que Vem a Seguir? (Planos Futuros)

O artigo delineia três objetivos principais para o futuro:

  1. Expandir a Biblioteca: Adicionar mais tipos de documentos de outros departamentos governamentais e arquivos históricos.
  2. Polir a Linguagem: Melhorar a forma como o sistema lê frases complexas em cingalês e tâmil, garantindo que o "robô" compreenda perfeitamente as nuances das línguas.
  3. Ler o Conteúdo Manuscrito/Digitalizado: Atualmente, o sistema tem dificuldades com documentos desfocados ou digitalizados. Eles planeiam ensinar o robô a usar "olhos" (tecnologia OCR) para ler texto de imagens de baixa qualidade, transformando até os papéis antigos mais desordenados em texto digital limpo.

Por Que É Que Isto Importa?

O artigo argumenta que, ao transformar registos fragmentados e de difícil leitura num banco de dados limpo, aberto e pesquisável, estão a dar um superpoder a investigadores, jornalistas e cidadãos. Permite-lhes acompanhar como as leis mudam, monitorizar decisões governamentais e estudar a história do país sem se perderem na papelada. Trata-se de tornar o "registo digital" do Sri Lanka acessível a todos, e não apenas àqueles que têm tempo ou ferramentas para escavar nos arquivos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →