← Neueste Arbeiten
💻 computer science

ViHistScriptBench: Benchmarking Vietnamese Historical Script and Document–Type Classification in Low–Resource Settings

Dieses Paper führt ViHistScriptBench ein, einen leichtgewichtigen Benchmark und eine Evaluierungspipeline, die darauf ausgelegt ist, die Klassifizierung vietnamesischer historischer Schriften und Dokumenttypen durch Bereitstellung eines kuratierten Korpus, definierter Aufgaben und Baseline-Modelle voranzutreiben, um den Herausforderungen durch begrenzte Datenmengen und komplexe Kalligrafie zu begegnen.

Ursprüngliche Autoren: Nguyễn Tuệ An

Veröffentlicht 2026-07-02
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Nguyễn Tuệ An

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie besitzen eine riesige, staubige Bibliothek voller alter vietnamesischer Bücher. Einige sind in alten chinesischen Schriftzeichen geschrieben, manche in einer einzigartigen vietnamesischen Schrift, die wie Chinesisch aussieht, aber vietnamesisch klingt, und einige sind frühe Versuche, Vietnamesisch mit dem heute verwendeten lateinischen Alphabet zu schreiben.

Das Problem ist, dass diese Bücher schwer zu lesen sind. Die Tinte ist verblasst, das Papier ist zerrissen und die Schreibstile sind völlig unterschiedlich. Wenn Sie diese Bücher durchsuchen oder in digitalen Text umwandeln wollen, benötigen Sie ein Computerprogramm (genannt OCR), um sie zu lesen. Aber die meisten Computerprogramme von heute sind wie Studenten, die nur modernes Englisch gelernt haben; sie sind völlig verwirrt, wenn sie diese alten, unordentlichen Schriften sehen.

Dieses Paper stellt ein neues Werkzeug namens ViHistScriptBench vor. Denken Sie an es als eine Prüfung, die speziell darauf ausgelegt ist, Computer darauf zu trainieren, diese alten vietnamesischen Bücher zu lesen.

Hier ist die Aufschlüsselung des Papers, unter Verwendung einfacher Analogien:

1. Das „Fitnessstudio“ für Computer (Der Datensatz)

Um einen Computer darauf zu trainieren, diese Schriften zu erkennen, braucht man viele Beispiele. Die Autoren haben 500 Seiten aus öffentlichen digitalen Archiven (wie der Nationalbibliothek Vietnams) zusammengestellt.

  • Die Sammlung: Sie wählten Seiten aus, die verschiedene „Varianten“ des Schreibens zeigen: reines Chinesisch (Hán), reines Vietnamesisch in Logogrammen (Nôm), eine Mischung aus beidem und frühes latein-basiertes Vietnamesisch (Quốc Ngữ).
  • Die Beschriftungen: Sie haben die Seiten nicht einfach nur in einen Haufen geworfen. Sie haben Experten engagiert, um jede Seite zu beschriften und dem Computer zu sagen: „Dies ist ein handgeschriebenes Manuskript“, „Dies ist ein Holzschnitt“ oder „Diese Seite mischt zwei Schriften“. Es ist wie ein Lehrer, der einen Stapel Arbeiten korrigiert und Notizen auf die Rückseite schreibt.

2. Die drei Herausforderungen (Die Aufgaben)

Das Paper setzt drei spezifische Spiele für den Computer auf:

  • Spiel 1: Der Skript-Detektiv. Der Computer betrachtet eine ganze Seite und muss raten: „Ist das Chinesisch, Vietnamesisch, eine Mischung oder frühes Latein?“ Es ist, als würde man eine Speisekarte betrachten und raten, ob sie auf Französisch, Italienisch oder einer Mischung aus beidem ist.
  • Spiel 2: Der Material-Inspektor. Der Computer muss raten, wie die Seite hergestellt wurde. Wurde sie mit einem Pinsel von Hand geschrieben? Wurde sie in Holz geschnitzt und gestempelt? Oder ist es ein modernes gedrucktes Buch? Dies hilft dem Computer zu verstehen, wie er mit der „Textur“ der Seite umgehen muss.
  • Spiel 3: Der Mix-Aufspürer. Manche Seiten haben eine Hauptgeschichte in einer Schrift und winzige Notizen am Rand in einer anderen. Der Computer muss erkennen, ob eine Seite „gemischt“ oder „rein“ ist.

3. Die Teilnehmer (Die Modelle)

Die Autoren testeten verschiedene Arten von „Studenten“ (KI-Modelle), um zu sehen, wer am besten lernt:

  • Die Klassiker (CNNs): Dies sind wie traditionelle Studenten, die gut darin sind, kleine Details zu erkennen (wie die Form eines einzelnen Buchstabens), aber manchmal das große Ganze übersehen.
  • Die Modernen (Vision Transformer): Dies sind wie Studenten, die die ganze Seite auf einmal betrachten und verstehen, wie die Spalten des Textes zusammenhängen.
  • Die „Zero-Shot“-Lerner (CLIP): Dies sind wie Studenten, die dieses spezifische Fachgebiet nicht studiert haben, aber sehr gut darin sind, basierend auf allgemeinem Wissen zu raten. Sie versuchen, die Schrift allein durch das Lesen einer Beschreibung wie „eine Seite mit chinesischen Schriftzeichen“ zu erraten.

4. Die Ergebnisse und die Schwierigkeiten

Das Paper berichtet, dass die modernen Modelle (Vision Transformer) am besten abschnitten und eine Genauigkeit von etwa 90 % erreichten. Das ist eine genügende Note, aber nicht perfekt.

Wo sind sie gescheitert?
Das Paper hebt spezifische „Fallen“ hervor, die die Computer verwirrt haben:

  • Die Zwilling-Falle: Hán und Nôm sehen sich sehr ähnlich. Es ist, als versuchte man, den Unterschied zwischen einem Zwillingsbruder und einer Zwillingsschwester auf einem unscharfen Foto zu erkennen. Die Computer haben sie oft verwechselt.
  • Die Rausch-Falle: Alte Bücher haben Flecken, Wurmlöcher und verblasste Tinte. Die Computer haben manchmal einen Kaffeefleck mit einem Teil eines Buchstabens verwechselt.
  • Die Richtungs-Falle: Diese alten Bücher werden vertikal (von oben nach unten) geschrieben. Computer, die an horizontalen englischen Text gewöhnt sind, gerieten manchmal durch das Layout durcheinander.
  • Die Akzent-Falle: Das Vietnamesische verwendet viele kleine Zeichen (Diakritika), um den Klang eines Buchstabens zu ändern. Wenn die Tinte verschmiert war, konnte der Computer nicht unterscheiden, ob ein Zeichen ein Tonakzent oder nur ein Schmutzfleck war.

5. Warum das wichtig ist

Die Autoren versprechen nicht, dass wir die gesamte vietnamesische Geschichte heute sofort übersetzen können. Stattdessen sagen sie: „Hier ist ein fairer Test und ein Startpunkt.“

Vor diesem Projekt versuchten Forscher, Rennen ohne Laufbahn oder Stoppuhr zu laufen. Jetzt haben mit ViHistScriptBench alle die gleichen 500 Seiten und dieselben Regeln. Dies ermöglicht es Wissenschaftlern, ihre Werkzeuge fair zu vergleichen, genau zu sehen, wo sie scheitern, und bessere „Studenten“ zu bauen, um Vietnams geschriebene Geschichte zu bewahren und zu erschließen.

Kurz gesagt: Sie haben einen Übungstest gebaut, um Computern beizubringen, unordentliche, alte vietnamesische Bücher zu lesen, und zeigen uns genau, wo die Computer noch verwirrt sind, damit wir sie besser lehren können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →