← Derniers articles
💬 NLP

Sri Lanka Document Datasets: A Large-Scale, Multilingual Resource for Law, News, and Policy

Cet article présente une collection de données ouvertes, multilingues et à grande échelle comprenant plus de 278 000 documents en cinghalais, en tamoul et en anglais, couvrant le droit, les actualités et les politiques du Sri Lanka afin de soutenir la recherche en linguistique computationnelle et en études sociopolitiques.

Auteurs originaux : Nuwan I. Senaratna

Publié 2026-07-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nuwan I. Senaratna

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez les archives publiques du Sri Lanka — lois, actualités, décisions de justice et rapports gouvernementaux — comme une immense bibliothèque chaotique éparpillée dans des centaines de bâtiments différents. Certains livres sont enfermés dans des vitrines en verre (PDF), d'autres ne sont que des gribouillis sur des feuilles volantes (sites web), et beaucoup sont écrits en trois langues différentes : le cinghalais, le tamoul et l'anglais. Pour un citoyen ordinaire, un journaliste ou un chercheur, tenter de trouver un fait spécifique dans ce désordre revient à chercher une aiguille dans une botte de foin qui ne cesse de bouger.

Ce document présente un projet appelé Sri Lanka Document Datasets, qui agit comme un bibliothécaire super organisé et un camion de déménagement numérique combinés. Voici ce qu'ils ont construit :

1. La Grande Collection (L'« Entrepôt Numérique »)

L'équipe a rassemblé 278 621 documents (environ 80,7 Go de données) dans un paquet unique, propre et lisible par machine. Considérez cela comme la construction d'un seul et immense entrepôt où chaque fragment d'information importante du Sri Lanka est trié, étiqueté et prêt à être utilisé.

La collection comprend :

  • La « Bibliothèque Juridique » : Débats parlementaires (Hansards), décisions de la Cour suprême et communiqués de presse de la police.
  • Le « Livre de Règles » : Les lois réelles (Actes), les projets de loi (Bills) et les avis gouvernementaux urgents (Gazettes).
  • Le « Kiosque à Journaux » : Des milliers d'articles de presse et de mises à jour gouvernementales.
  • Le « Rapport Météo & Économie » : Statistiques touristiques, prix du poisson, alertes d'inondation et rapports bancaires.

Tout cela est disponible en trois langues, ce qui en fait un véritable trésor multilingue.

2. La Machine Magique (Le « Pipeline de Collecte »)

Comment ont-ils obtenu toutes ces données ? Ils n'ont pas engagé une équipe de personnes pour copier-coller manuellement les documents. À la place, ils ont construit un système de robot automatisé.

  • L'Éclaireur : Ce robot visite chaque jour les sites web officiels du gouvernement. Il est poli ; il vérifie les panneaux « Défense de circuler » (robots.txt) et attend son tour pour ne pas faire planter les sites.
  • Le Trieur : Lorsqu'un robot trouve un nouveau document, il ne se contente pas de le saisir ; il vérifie s'il est déjà présent. S'il est nouveau, il le télécharge, le lit et le nettoie.
  • Le Traducteur & Nettoyeur : Le système prend les PDF désordonnés (qui sont comme des images de texte) et les transforme en un texte propre et interrogeable. Il corrige les lignes brisées et organise les données dans un format standard (JSON) afin que les ordinateurs puissent facilement les comprendre.
  • La Mise à Jour Quotidienne : Ce robot fonctionne automatiquement, plusieurs fois par jour. Si une nouvelle loi est adoptée ou qu'une nouvelle alerte d'inondation est émise, le système la capture et l'ajoute immédiatement à la collection.

3. La Politique de Portes Ouvertes (Licences et Accès)

Habituellement, les grands ensembles de données sont verrouillés derrière des barrières de paiement ou nécessitent une autorisation spéciale. Ce projet est différent. C'est comme un parc public plutôt qu'un club privé.

  • Entrée Gratuite : Tout le monde peut télécharger les données gratuitement.
  • Liberté de Modification : Vous pouvez prendre les données, corriger les erreurs ou construire vos propres outils par-dessus, tant que vous citez les créateurs originaux.
  • Toujours Disponible : Les données sont dupliquées sur deux plateformes populaires (GitHub et Hugging Face), garantissant que même si un site tombe en panne, la bibliothèque reste ouverte.

4. Et Après ? (Plans Futurs)

Le document expose trois objectifs principaux pour l'avenir :

  1. Élargir la Bibliothèque : Ajouter d'autres types de documents provenant d'autres départements gouvernementaux et des archives historiques.
  2. Polir la Langue : Améliorer la façon dont le système lit les phrases complexes en cinghalais et en tamoul, pour s'assurer que le « robot » comprenne parfaitement les nuances de ces langues.
  3. Lire le Manuscrit/Scanné : Actuellement, le système éprouve des difficultés avec les documents flous ou scannés. Ils prévoient d'apprendre au robot à utiliser des « yeux » (technologie OCR) pour lire le texte à partir d'images de faible qualité, transformant même les vieux papiers les plus désordonnés en texte numérique propre.

Pourquoi est-ce important ?

Le document soutient qu'en transformant des archives fragmentées et difficiles à lire en une base de données propre, ouverte et interrogeable, ils donnent un super-pouvoir aux chercheurs, aux journalistes et aux citoyens. Cela leur permet de suivre l'évolution des lois, de surveiller les décisions gouvernementales et d'étudier l'histoire du pays sans se perdre dans la paperasse. Il s'agit de rendre le « registre numérique » du Sri Lanka accessible à tous, et non seulement à ceux qui ont le temps ou les outils pour fouiller dans les archives.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →