← Neueste Arbeiten
💬 NLP

A Reproducible Universal Dependencies-Style Pipeline for Katharevousa Greek Parliamentary Text

Diese Arbeit stellt eine reproduzierbare, Open-Access-Pipeline zur Erstellung einer Universal-Dependencies-konformen Parsing-Ressource für katharevousa-griechische Parlamentsdokumente aus der frühen Nachjunta-Zeit vor und zeigt, dass ein benutzerdefiniertes XLM-R-Modell bei der syntaktischen Analyse deutlich besser abschneidet als kommerziell verfügbare Parser, während es gleichzeitig eine überprüfbare Methodik zur Verarbeitung historischer OCR-Daten bereitstellt.

Ursprüngliche Autoren: George Mikros, Fotios Fitsilis

Veröffentlicht 2026-05-25
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: George Mikros, Fotios Fitsilis

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine riesige, staubige Bibliothek alter griechischer Regierungsunterlagen aus den 1970er Jahren vor. Dies sind keine gewöhnlichen Dokumente; sie sind in einem sehr spezifischen, formellen Griechisch verfasst, das Katharevousa genannt wird. Betrachten Sie Katharevousa als eine „linguistische Zeitkapsel": Es ist weder die antike Sprache der Philosophen noch das lockere Griechisch, das die Menschen heute sprechen. Es ist eine steife, offizielle Mischung aus beidem, die von Politikern und Anwälten verwendet wurde.

Das Problem? Moderne Computerprogramme, die Sprache verstehen (NLP), sind wie Schüler, die nur modernes Griechisch oder antikes Griechisch gelernt haben. Wenn sie versuchen, diese Parlamentsprotokolle aus den 1970er Jahren zu lesen, geraten sie in Verwirrung. Sie stolpern über die seltsame Mischung aus alter Grammatik und neuen Wörtern und können die Sätze nicht entschlüsseln.

Dieser Artikel handelt vom Aufbau eines spezialisierten Übersetzers für diese spezifischen Dokumente und, noch wichtiger, davon, allen genau zu zeigen, wie er gebaut wurde, damit andere die Arbeit überprüfen können.

Hier ist die Aufschlüsselung ihrer Reise:

1. Der chaotische Ausgangspunkt (Das OCR-Problem)

Die Dokumente begannen als physisches Papier, wurden von Maschinen (OCR) gescannt und in digitalen Text umgewandelt. Aber Scanner sind wie müde Augen; sie machen Fehler. Sie könnten einen Buchstaben auslassen, ein Wort halbieren oder durch alte Zeichensetzung verwirrt werden.

  • Die Lösung: Die Autoren nahmen nicht einfach den Rohscan. Sie bauten ein „Reinigungsteam" (eine Pipeline von Skripten), um den Text wiederherzustellen, zerbrochene Wörter zu reparieren und die Sätze zu organisieren. Es ist wie die Restaurierung eines beschädigten Gemäldes, bevor man versucht, die Pinselstriche zu analysieren.

2. Der „Goldstandard" (Die Referenzmenge)

Um einen Computer zu unterrichten, benötigen Sie ein Lehrbuch mit den richtigen Antworten. Die Autoren erstellten einen „eingefrorenen" Satz von 1.697 Sätzen, die sorgfältig annotiert (markiert) wurden, um die korrekte grammatische Struktur zu zeigen.

  • Die Analogie: Stellen Sie sich einen Lehrer vor, der einen Test korrigiert. Sie erstellten einen „Lösungsschlüssel" (die Referenzmenge), der in einem Tresor verschlossen ist. Niemand kann ihn später ändern. Dies stellt sicher, dass, wenn sie verschiedene Computermodelle testen, alle gegen exakt denselben Standard bewertet werden.
  • Die Wendung: Sie nutzten KI (Large Language Models), um beim Schreiben der Antworten zu helfen, aber sie führten diese KI-Antworten durch eine strenge „Qualitätskontrollmaschine", um sicherzustellen, dass sie die Regeln einhielten. Wenn die KI faul wurde oder einen Fehler machte, fing das System dies auf.

3. Das Rennen (Testen der Modelle)

Die Autoren stellten mehrere verschiedene „Teilnehmer" auf, um zu sehen, wer diese kniffligen Sätze am besten parsen (die Grammatik verstehen) konnte:

  • Die Standard-Läufer: Dies sind vorgefertigte Tools, die für modernes Griechisch oder antikes Griechisch entwickelt wurden.
    • Ergebnis: Sie hatten Mühe. Das Tool für modernes Griechisch war wie ein Tourist, der versucht, einen rechtlichen Vertrag in einem fremden Dialekt zu lesen; es bekam etwa 42 % der komplexen Grammatik richtig. Das Tool für antikes Griechisch schnitt noch schlechter ab, da diese Dokumente nicht wirklich alt sind; es sind moderne Dokumente mit altmodischem Flair.
  • Die individuellen Läufer: Die Autoren trainierten ihre eigenen Modelle von Grund auf neu mit dem von ihnen erstellten „Lösungsschlüssel".
    • Das merkmalsbasierte Modell: Dies ist wie ein Detektiv, der nach spezifischen Hinweisen sucht (Wortmuster, bestimmte Wortarten). Es war überraschend gut darin, zu identifizieren, welche Art von Wort ein Wort war (wie „Substantiv" oder „Verb").
    • Das Transformer-Modell (XLM-R): Dies ist ein schweres KI-Modell, das den gesamten Satz auf einmal liest, um den Kontext zu verstehen. Dies war der Gewinner. Es verstand, wie die Wörter miteinander verbunden waren, besser als jeder andere.

4. Die Ergebnisse

Das benutzerdefinierte XLM-R-Modell gewann nicht nur; es schlug das beste vorgefertigte Tool mit einem signifikanten Vorsprung (Verbesserung des Scores um etwa 10 Prozentpunkte).

  • Die Erkenntnis: Man kann für diese spezifische Aufgabe nicht einfach ein generisches Tool vom Regal nehmen. Man benötigt ein Modell, das speziell auf diesen „Dialekt" der Amtssprache trainiert wurde. Das „Detektiv"-Modell (merkmalsbasiert) war jedoch immer noch sehr wettbewerbsfähig und bewies, dass einfache, klare Regeln auch im Zeitalter der ausgefallenen KI noch wichtig sind.

5. Der eigentliche Beitrag: „Open Source"

Der wichtigste Teil dieses Artikels ist nicht nur der Score; es ist die Transparenz.

  • Die Analogie: Normalerweise könnte ein Wissenschaftler sagen: „Ich habe einen Roboter gebaut, der das Rennen gewinnt, und hier ist der Pokal." Aber sie könnten die Baupläne verstecken.
  • Dieser Artikel: Die Autoren sagten: „Hier ist der Pokal, aber hier sind auch die Baupläne, die Tools, die wir verwendet haben, die chaotischen Notizen darüber, was schiefgelaufen ist, der exakte Code und der verschlossene Lösungsschlüssel."
  • Sie veröffentlichten alles als Open-Source-Projekt namens kathnlp. Das bedeutet, dass jeder es herunterladen, dieselben Tests durchführen und genau sehen kann, wie sie zu den Ergebnissen kamen. Sie schlossen sogar eine Anleitung ein, wie man das Ganze von Grund auf neu aufbaut.

Zusammenfassung

Die Autoren nahmen ein schwieriges, chaotisches, historisches Sprachproblem (griechische Parlamente-Texte aus den 1970er Jahren), reinigten es, erstellten einen strengen „Lösungsschlüssel" und bauten einen benutzerdefinierten KI-Übersetzer, der deutlich besser funktioniert als bestehende Tools. Am wichtigsten ist, dass sie das gesamte Rezept, die Zutaten und die Kochanweisungen der Öffentlichkeit übergeben, damit jeder dasselbe Gericht zubereiten und den Geschmack überprüfen kann.

Was sie NICHT taten:

  • Sie behaupteten nicht, dass dies alle Probleme historischer Texte löst.
  • Sie wandten dies nicht auf medizinische oder rechtliche Beratung an (der Text sind historische Aufzeichnungen, keine aktuellen Gesetze).
  • Sie sagten nicht, dass dies die endgültige, perfekte Lösung ist; sie geben zu, dass der Datensatz klein ist und in Zukunft einer weiteren menschlichen Überprüfung bedarf.

Der Artikel ist ein Bauplan dafür, wie man ein „schwer lesbares" historisches Archiv in ein brauchbares Werkzeug für Computer verwandelt, während man den Prozess völlig offenlegt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →