← Nieuwste papers
💬 NLP

Sri Lanka Document Datasets: A Large-Scale, Multilingual Resource for Law, News, and Policy

Dit artikel introduceert een grootschalige, meertalige open datasetcollectie bestaande uit meer dan 278.000 documenten in het Singalees, Tamil en Engels, die de Sri Lankaanse wetgeving, nieuws en beleid beslaat om onderzoek in de computationele taalkunde en sociaal-politieke studies te ondersteunen.

Oorspronkelijke auteurs: Nuwan I. Senaratna

Gepubliceerd 2026-07-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Nuwan I. Senaratna

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je de publieke registers van Sri Lanka voor – wetten, nieuws, rechtelijke beslissingen en overheidsrapporten – als een enorme, chaotische bibliotheek die verspreid is over honderden verschillende gebouwen. Sommige boeken zitten achter glazen kasten (PDF's), andere zijn slechts gekrabbeld op losse vellen papier (websites), en veel zijn geschreven in drie verschillende talen: Singalees, Tamil en Engels. Voor een gewone burger, een journalist of een onderzoeker is het zoeken naar een specifieke feit in deze chaos alsof je zoekt naar een naald in een hooiberg die constant van plek verandert.

Dit artikel introduceert een project genaamd de Sri Lanka Document Datasets, dat fungeert als een supergeorganiseerde bibliothecaris en een digitale verhuiswagen gecombineerd. Dit is wat zij hebben gebouwd:

1. De Grote Collectie (De "Digitale Magazijn")

Het team heeft 278.621 documenten (ongeveer 80,7 GB aan data) verzameld in één netjes, machineleesbaar pakket. Zie dit als het bouwen van één enkel, gigantisch magazijn waar elk stuk belangrijke informatie uit Sri Lanka is gesorteerd, gelabeld en klaar is om gebruikt te worden.

De collectie bevat:

  • De "Wetbibliotheek": Parlementaire debatten (Hansards), uitspraken van het Hooggerechtshof en persberichten van de politie.
  • Het "Regelboek": Daadwerkelijke wetten (Acts), wetsontwerpen (Bills) en dringende overheidsmededelingen (Gazettes).
  • De "Nieuwsstand": Duizenden nieuwsartikelen en overheidsupdates.
  • Het "Weer- & Economierapport": Toerisme statistieken, visprijzen, overstromingswaarschuwingen en bankrapporten.

Dit alles is beschikbaar in drie talen, wat het een echte meertalige schatkist maakt.

2. De Magische Machine (De "Collectie Pipeline")

Hoe hebben ze deze data verkregen? Ze hebben geen team mensen ingehuurd om handmatig documenten te kopiëren en te plakken. In plaats daarvan hebben ze een geautomatiseerd robotsysteem gebouwd.

  • De Verkenner: Deze robot bezoekt dagelijks officiële overheidswebsites. Hij is beleefd; hij controleert de "Verboden toegang"-borden (robots.txt) en wacht op zijn beurt zodat hij de websites niet laat crashen.
  • De Sorteerder: Wanneer de robot een nieuw document vindt, pakt hij het niet zomaar; hij controleert of het er al is. Als het nieuw is, downloadt hij het, leest het en ruimt het op.
  • De Vertaler & Schoonmaker: Het systeem neemt rommelige PDF's (die als afbeeldingen van tekst zijn) en verandert ze in schone, doorzoekbare tekst. Het herstelt afgebroken regels en organiseert de data in een standaardformaat (JSON), zodat computers het gemakkelijk kunnen begrijpen.
  • De Dagelijkse Update: Deze robot draait automatisch, meerdere keren per dag. Als er een nieuwe wet wordt aangenomen of een nieuwe overstromingswaarschuwing wordt uitgegeven, vangt het systeem dit direct op en voegt het toe aan de collectie.

3. Het Beleid van Open Deuren (Licenties en Toegang)

Normaal gesproken zijn grote datasets vergrendeld achter betaalmuren of vereisen ze speciale toestemming om te gebruiken. Dit project is anders. Het is als een openbaar park in plaats van een privéclub.

  • Gratis Toegang: Iedereen kan de data gratis downloaden.
  • Gratis Aanpasbaar: Je kunt de data meenemen, fouten herstellen of je eigen tools erop bouwen, zolang je maar de oorspronkelijke makers de eer geeft.
  • Altijd Beschikbaar: De data wordt gespiegeld op twee populaire platforms (GitHub en Hugging Face), wat ervoor zorgt dat zelfs als één site plat ligt, de bibliotheek nog steeds open is.

4. Wat Nu? (Toekomstplannen)

Het artikel schetst drie hoofddoelen voor de toekomst:

  1. De Bibliotheek Uitbreiden: Meer soorten documenten toevoegen van andere overheidsdepartementen en historische archieven.
  2. De Taal Polijsten: Verbeteren hoe het systeem complexe zinnen in het Singalees en Tamil leest, om ervoor te zorgen dat de "robot" de nuances van de talen perfect begrijpt.
  3. Het Handgeschreven/Gescande Materiaal Lezen: Momenteel heeft het systeem moeite met wazige of gescande documenten. Ze zijn van plan de robot "ogen" te leren geven (OCR-technologie) om tekst uit kwalitatief minder goede afbeeldingen te lezen, waardoor zelfs de slordigste oude papieren worden omgezet in heldere digitale tekst.

Waarom Is Dit Belangrijk?

Het artikel betoogt dat door gefragmenteerde, moeilijk leesbare records te veranderen in een schone, open en doorzoekbare database, zij een superkracht geven aan onderzoekers, journalisten en burgers. Het stelt hen in staat om te volgen hoe wetten veranderen, overheidsbeslissingen te monitoren en de geschiedenis van het land te bestuderen zonder verdwaald te raken in het papierwerk. Het gaat erom de "digitale registratie" van Sri Lanka toegankelijk te maken voor iedereen, niet alleen voor degenen die de tijd of de middelen hebben om door de archieven te graven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →