Sri Lanka Document Datasets: A Large-Scale, Multilingual Resource for Law, News, and Policy
Dieses Papier stellt eine groß angelegte, mehrsprachige offene Datensammlung mit über 278.000 Dokumenten in Sinhala, Tamil und Englisch vor, die das sri-lankische Recht, Nachrichten und politische Richtlinien abdeckt, um die Forschung in der Computerlinguistik und den soziopolitischen Studien zu unterstützen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich die öffentlichen Aufzeichnungen Sri Lankas – Gesetze, Nachrichten, Gerichtsurteile und Regierungsberichte – wie eine riesige, chaotische Bibliothek vor, die über hunderte verschiedene Gebäude verstreut ist. Einige Bücher sind in Glasvitrinen eingeschlossen (PDFs), andere sind nur auf losem Papier hingekritzelt (Websites), und viele sind in drei verschiedenen Sprachen geschrieben: Singhalesisch, Tamil und Englisch. Für einen normalen Bürger, einen Journalisten oder einen Forscher ist der Versuch, einen spezifischen Fakt in diesem Chaos zu finden, wie die Suche nach einer Nadel im Heuhaufen, der sich ständig bewegt.
Dieses Paper stellt ein Projekt namens Sri Lanka Document Datasets vor, das wie ein super organisierter Bibliothekar und ein digitaler Umzugswagen zugleich fungiert. Hier ist das, was sie gebaut haben:
1. Die große Sammlung (Das „digitale Lagerhaus“)
Das Team hat 278.621 Dokumente (etwa 80,7 GB an Daten) in ein ordentliches, maschinenlesbares Paket zusammengeführt. Stellen Sie sich das wie den Bau eines einzigen, riesigen Lagerhauses vor, in dem jedes wichtige Stück Information aus Sri Lanka sortiert, etikettiert und einsatzbereit ist.
Die Sammlung umfasst:
- Die „Gesetzbibliothek“: Parlamentsdebatten (Hansards), Urteile des Obersten Gerichtshofs und Pressemitteilungen der Polizei.
- Das „Regelwerk“: Tatsächliche Gesetze (Acts), Gesetzesentwürfe (Bills) und dringende Regierungsbekanntmachungen (Gazettes).
- Der „Nachrichtenstand“: Tausende von Nachrichtenartikeln und Regierungsaktualisierungen.
- Der „Wetter- & Wirtschaftsbericht“: Tourismusstatistiken, Fischpreise, Hochwasserwarnungen und Bankberichte.
All dies ist in drei Sprachen verfügbar, was es zu einer echten multilingualen Schatzkammer macht.
2. Die magische Maschine (Die „Sammlungs-Pipeline“)
Wie haben sie all diese Daten bekommen? Sie haben nicht ein Team von Menschen engagiert, um Dokumente manuell per Copy-and-Paste zu kopieren. Stattdessen haben sie ein automatisiertes Robotersystem gebaut.
- Der Scout: Dieser Roboter besucht jeden Tag offizielle Regierungswebsites. Er ist höflich; er prüft die „Nicht betreten“-Schilder (robots.txt) und wartet, bis er an der Reihe ist, damit er die Websites nicht überlastet.
- Der Sortierer: Wenn der Roboter ein neues Dokument findet, greift er es nicht einfach nur heraus; er prüft, ob es bereits vorhanden ist. Wenn es neu ist, lädt er es herunter, liest es und bereinigt es.
- Der Übersetzer & Reiniger: Das System nimmt unordentliche PDFs (die wie Bilder von Text sind) und verwandelt sie in sauberen, durchsuchbaren Text. Es repariert fehlerhafte Zeilen und organisiert die Daten in ein Standardformat (JSON), damit Computer sie leicht verstehen können.
- Das tägliche Update: Dieser Roboter läuft automatisch mehrmals täglich. Wenn ein neues Gesetz verabschiedet oder eine neue Hochwasserwarnung herausgegeben wird, erfasst das System dies und fügt es der Sammlung sofort hinzu.
3. Die Politik der offenen Tür (Lizenzierung und Zugang)
Normalerweise sind große Datensätze hinter Paywalls gesperrt oder erfordern eine spezielle Genehmigung zur Nutzung. Dieses Projekt ist anders. Es ist wie ein öffentlicher Park statt eines privaten Clubs.
- Freier Eintritt: Jeder kann die Daten kostenlos herunterladen.
- Freie Veränderbarkeit: Sie können die Daten nehmen, Fehler korrigieren oder eigene Werkzeuge darauf aufbauen, solange Sie den ursprünglichen Erstellern die Anerkennung zollen.
- Immer verfügbar: Die Daten sind auf zwei populären Plattformen (GitHub und Hugging Face) gespiegelt, was sicherstellt, dass die Bibliothek auch dann noch offen ist, wenn eine der Seiten offline geht.
4. Was kommt als Nächstes? (Zukünftige Pläne)
Das Paper skizziert drei Hauptziele für die Zukunft:
- Die Bibliothek erweitern: Mehr Arten von Dokumenten aus anderen Regierungsabteilungen und historischen Archiven hinzufügen.
- Die Sprache verfeinern: Verbessern, wie das System komplexe Sätze in Singhalesisch und Tamil liest, um sicherzustellen, dass der „Roboter“ die Nuancen der Sprachen perfekt versteht.
- Das Handschriftliche/Gescannte lesen: Derzeit hat das System Schwierigkeiten mit unscharfen oder gescannten Dokumenten. Sie planen, den Roboter mit „Augen“ (OCR-Technologie) auszustatten, um Text aus minderwertigen Bildern zu lesen und selbst die unordentlichsten alten Papiere in sauberen digitalen Text zu verwandeln.
Warum ist das wichtig?
Das Paper argumentiert, dass sie durch die Umwandlung fragmentierter, schwer lesbarer Aufzeichnungen in eine saubere, offene und durchsuchbare Datenbank den Forschern, Journalisten und Bürgern eine Superkraft verleihen. Es ermöglicht ihnen, zu verfolgen, wie sich Gesetze ändern, Regierungsentscheidungen zu überwachen und die Geschichte des Landes zu studieren, ohne sich in der Zettelwirtschaft zu verlieren. Es geht darum, das „digitale Gedächtnis“ von Sri Lanka für alle zugänglich zu machen, nicht nur für diejenigen, die die Zeit oder die Werkzeuge haben, in den Archiven zu graben.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.