Automatic Annotation of Ancient Greek Vowel Length
Dieses Paper stellt den ersten allgemeingültigen, regelbasierten Makronierer für Altgriechisch vor, der die Vokallänge in den dichronen Buchstaben unter Verwendung des morphologischen Kontextes automatisch annotiert, und zeigt auf, dass sein Output effektiv einen zeichenbasierten Transformer trainiert, um eine hohe Genauigkeit sowohl in Versen als auch in Prosa zu erreichen und gleichzeitig nachgelagerte prosodische Aufgaben zu verbessern.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie sind ein Detektiv, der versucht, ein Rätsel zu lösen, das in einem Code geschrieben wurde, der vor zweitausend Jahren verloren ging. Dieser Code ist Altgriechisch, eine Sprache, die einst Philosophie, Drama und die eigentlichen Grundlagen der westlichen Wissenschaft hervorbrachte. Aber hier ist der Clou: Die antiken Schreiber, die diese Texte verfassten, verwendeten kein vollständiges Alphabet für alle Laute – sie hatten eine „kurze“ und eine „lange“ Version von drei spezifischen Buchstaben – Alpha, Iota und Ypsilon – aber sie schrieben diese auf dem Papier nicht unterschiedlich. Es ist, als ob das Englische zwei Versionen des Buchstabens „a“ hätte (eine kurze wie in „cat“, eine lange wie in „father“), wir aber für beide einfach nur „a“ schreiben würden. Um die Poesie, die Grammatik und die Bedeutung zu verstehen, müssen Sie herausfinden, welche Version des „a“ beabsichtigt war. Dies ist nicht nur ein Buchstabierwettbewerb; im Altgriechischen kann man durch einen Fehler in der Länge ein Wort von einem Verb in ein Nomen verwandeln oder eine Frage in einen Befehl. Seit Jahrzehnten sind Computer, die versuchen, diese Texte zu lesen, daran hängen geblieben, weil sie den Unterschied nicht erkennen können. Ohne die Länge zu kennen, ist der Computer wie ein Musiker, der versucht, ein Lied zu spielen, ohne zu wissen, welche Noten lang oder kurz gehalten werden sollen.
Hier beginnt die Geschichte von „Automatic Annotation of Ancient Greek Vowel Length“. Die Autoren, Albin Thörn Cleland und Eric Cullhed, widmen sich einem Problem, das als „Makronisierung“ bezeichnet wird. Denken Sie an die Makronisierung als das Hinzufügen kleiner musikalischer Zeichen (wie eines kleinen Querstrichs oder eines kleinen Hütchens) über die Buchstaben, um dem Computer zu sagen: „Halte diesen Klang“ oder „Sprich ihn schnell aus“. Die Herausforderung ist gewaltig: Es gibt Millionen von Wortformen, und die Regel, welches Zeichen lang oder kurz ist, hängt von einer schwindelerregenden Mischung aus Faktoren ab – was das Wort bedeutet, wie es aufgebaut ist, dem Dialekt, der Zeitperiode und sogar dem Rhythmus des Gedichts, in dem es steht. Es ist ein „Long-Tail-Problem“, was bedeutet, dass es so viele seltene, seltsame Fälle gibt, dass eine einfache Liste von Regeln sie alle nicht abdecken kann. Die Forscher wollten wissen: Können wir ein Computerprogramm entwickeln, das dies automatisch erledigt? Und wenn wir das tun, hilft es Computern tatsächlich, Griechisch besser zu verstehen?
Das Werkzeugkasten des Detektivs: Regeln und Rekursion
Das Team begann mit dem Aufbau eines „regelbasierten Makronisierers“. Stellen Sie sich dies als einen sehr strengen, sehr belesenen Bibliothekar vor, der tausende von Grammatikbüchern und Wörterbüchern auswendig kennt. Dieser Bibliothekar folgt einer spezifischen Anweisung: „Wenn das Wort so aussieht und so endet, muss der Vokal lang sein.“ Wenn der Bibliothekar sich nicht zu 100 % sicher ist, lässt er den Buchstaben leer, anstatt zu raten.
Sie fütterten diesen Bibliothekar mit einer riesigen Bibliothek altgriechischer Texte, die 40 Millionen Wörter enthielten. Der Bibliothekar war überraschend gut und konnte die Länge für etwa 69 % der kniffligen Buchstaben bestimmen. Aber der Bibliothekar hatte eine Schwäche: Er war zu vorsichtig. Wenn ein Wort selten war oder nicht in sein perfektes Regelwerk passte, gab er einfach auf und ließ es leer. Er konnte nicht „raten“, wie es ein Mensch tun würde, indem er Kontextinformationen nutzt, um die Lücken zu füllen.
Der Schüler, der lernt zu raten
Um die Zögerlichkeit des Bibliothekars zu beheben, versuchten die Autoren etwas Cleveres. Sie nahmen die Arbeit des Bibliothekars – die 69 % der Wörter, bei denen der Bibliothekar sich sicher war – und nutzten sie als „Lehrbuch“, um einen neuen Schüler auszubilden: eine kleine künstliche Intelligenz, einen „Character-level Transformer“.
Betrachten Sie den KI-Schüler als einen brillanten Lehrling, der dem Bibliothekar bei der Arbeit zusieht. Der Lehrling lernt von den korrekten Antworten des Bibliothekars, ist aber auch darauf trainiert, sich die Buchstaben selbst, einen nach dem anderen, anzusehen, um Muster zu entdecken, die der Bibliothekar übersehen hat. Der entscheidende Trick dabei war, dass der Lehrling angewiesen wurde, die Teile zu ignorieren, bei denen der Bibliothekar unsicher war. Dies verhinderte, dass der Lehrling die Zweifel des Bibliothekars lernte; stattdin lernte der Lehrling zu generalisieren, die Form eines Wortes zu betrachten und zu sagen: „Ich wette, dieses hier ist lang“, selbst wenn der Bibliothekar keine Regel dafür hatte.
Die Ergebnisse waren beeindruckend. Während der strenge Bibliothekar etwa 70 % der Buchstaben abdeckte, deckte der KI-Lehrling fast 99,7 % ab. Wichtiger noch: Der Lehrling rät nicht einfach wild drauf los; er lieferte bei den schwierigsten Fällen häufiger die richtige Antwort als der Bibliothekar. Bei einem Test auf einem Goldstandard-Benchmark manuell geprüfter Texte erreichte die KI eine Genauigkeit von über 92 %, was bewies, dass sie das „Gefühl“ der Sprache jenseits des bloßen Befolgens starrer Regeln erlernen konnte.
Warum es wichtig ist: Das Scannen des Rhythmus
Die Forscher hörten nicht damit auf, Buchstaben nur zu kennzeichnen; sie wollten sehen, ob diese neue Fähigkeit Computern tatsächlich bei anderen Aufgaben hilft. Sie testeten dies beim „Scansion“, also der Kunst, den Rhythmus eines Gedichts zu bestimmen. In der altgriechischen Poesie hängt der Rhythmus vollständig davon ab, ob eine Silbe „schwer“ (lang) oder „leicht“ (kurz) ist.
Sie nahmen ein Computerprogramm, das darauf ausgelegt ist, Poesie zu lesen, und gaben ihm zwei Versionen desselben Textes: eine mit den neuen Vokallängen-Markierungen und eine ohne. Das Ergebnis? Das Programm, das den „makronisierten“ Text erhielt, war etwa 5,8 % besser darin, den korrekten Rhythmus zu bestimmen. Dies ist ein bedeutender Sprung in der Welt der Informatik. Es zeigt, dass das Lehren der verborgenen Musikalität der Sprache einem Computer hilft, die Struktur der Poesie viel besser zu verstehen.
Das Kleingedruckte
Natürlich ist dies kein Zauberstab, der alles löst. Die Autoren sind sich der Einschränkungen sehr bewusst. Ihr System ist derzeit auf das „Attische“ Griechisch abgestimmt, den Dialekt von Athen. Wenn man es mit Poesie aus anderen Regionen oder späteren Zeitperioden füttert, könnte es die Längen falsch bestimmen, weil es die „attischen Regeln“ auf nicht-attische Wörter anwendet. Es ist, als würde ein Leitfaden für einen New Yorker Akzent versuchen, jemandem beizubringen, wie man mit einem Südstaaten-Dialekt spricht; es mag für einige Wörter funktionieren, aber bei anderen wird es scheitern.
Außerdem hat der KI-Schüler aus dem Lehrbuch des Bibliothekars gelernt. Wenn der Bibliothekar einen Fehler in den Regeln gemacht hat, hat der Schüler diesen Fehler ebenfalls gelernt. Das System ist nur so gut wie die Regeln und Daten, auf denen es aufgebaut wurde. Die Autoren haben jedoch ihre Werkzeuge, ihre Daten und ihren Benchmark für alle zugänglich gemacht. Das bedeutet, dass andere Forscher nun diesen „Lehrling“ nehmen, ihn mit besseren Lehrbüchern trainieren und vielleicht eines Tages den Code für jeden Dialekt und jede Ära des Altgriechischen knacken können, um eine stille, mehrdeutige Schrift wieder in eine voll hörbare, rhythmische Sprache zu verwandeln.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.