← Neueste Arbeiten
💬 NLP

Wiki Dumps to Training Corpora: South Slavic Case

Dieser Artikel stellt eine sprachunabhängige Methodik vor, um Rohdaten aus Wikimedia-Dumps durch systematische Extraktion von Texten aus mehreren Wiki-Projekten und den Einsatz einer auf N-Grammen basierenden Filterung zur Entfernung qualitativ minderwertiger, repetitiver Artikel in hochwertige, sprachlich reichhaltige Trainingskorpora für sieben südslawische Sprachen zu transformieren.

Ursprüngliche Autoren: Mihailo Škorić

Veröffentlicht 2026-04-29
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Mihailo Škorić

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie möchten eine massive Bibliothek aus Geschichten, Gedichten und Nachrichtenartikeln aufbauen, um einem Roboter beizubringen, sieben verschiedene südslawische Sprachen zu sprechen und zu verstehen (wie Serbisch, Kroatisch, Bulgarisch und andere). Sie entscheiden sich, Wikipedia und seine Schwesterseiten (wie Wikisource oder Wikinews) als Ihre Quellmaterialien zu nutzen, da sie kostenlos sind und voller Text stecken.

Wenn Sie jedoch einfach die Rohdateien von diesen Websites herunterladen, erhalten Sie keine Bibliothek von Geschichten. Sie erhalten ein chaotisches Lagerhaus, gefüllt mit:

  • Bauschutt: Versteckte Computercodes, Formatierungsanweisungen und „Baupläne", die der Website sagen, wie sie aussehen soll, aber nicht Teil der Geschichte sind.
  • Zerbrochenes Glas: Defekte Links und leere Abschnitte.
  • Fabrikgefertigte Klone: Tausende von Artikeln, die sich fast identisch sehen, weil sie automatisch aus Datenbanken generiert wurden, anstatt von Menschen geschrieben zu sein.

Dieser Artikel ist ein Leitfaden, wie man dieses unordentliche Lagerhaus aufräumt und in eine makellose Bibliothek verwandelt. Der Autor, Mihailo Škorić, zerlegt den Prozess in zwei Hauptphasen: Die große Aufräumaktion und Der Qualitätsfilter.

Phase 1: Die große Aufräumaktion (Textextraktion)

Stellen Sie sich die rohen Wikipedia-Daten als ein Haus vor, das sich noch im Bau befindet. Überall stehen Gerüste, Farbdosen und Baupläne. Man kann noch nicht darin wohnen.

Der Autor hat eine spezialisierte „Baumannschaft" (ein Computerprogramm) entwickelt, um das Haus auf seine nackten, bewohnbaren Wände zurückzuführen.

  • Entfernung des Gerüsts: Das Programm nutzt ein Werkzeug namens mwparserfromhell (ein klangvoller Name für ein Werkzeug, das die geheime Sprache von Wikipedia versteht), um allen Computercodes, Vorlagen und Formatierungstags herauszureißen.
  • Beseitigung des Lärms: Es löscht die „Kategorie"-Listen (wie Etiketten auf einem Aktenschrank), entfernt Bildbeschreibungen und streicht die „Quellen"-Abschnitte, die wie Fußnoten aussehen, aber nicht Teil der Hauptgeschichte sind.
  • Flachstellen der Tabellen: Wikipedia verwendet oft Tabellen, um Daten zu organisieren. Das Programm verwandelt diese komplexen Gitter in einfache, lesbare Sätze, damit der Roboter nicht durch die Gitterlinien verwirrt wird.
  • Das Ergebnis: Nach dieser Phase haben Sie einen Haufen sauberen, reinen Textes. Es ist keine Website mehr; es sind nur noch Wörter.

Phase 2: Der Qualitätsfilter (Entfernung der Klone)

Jetzt, wo Sie sauberen Text haben, gibt es ein neues Problem. Einige der Artikel sind „Zombie"-Texte. Das sind Artikel, die so aussehen, als wären sie von einem Menschen geschrieben, aber tatsächlich von einem Computer automatisch generiert wurden. Sie sind repetitiv, langweilig und sagen immer wieder dasselbe in leicht unterschiedlicher Weise.

Wenn Sie diesen Roboter diese „Zombie"-Artikel lesen lassen, wird er lernen, in einer roboterhaften, repetitiven Schleife zu sprechen. Um dies zu beheben, verwendet der Autor eine Detektiv-Strategie:

  1. Gruppierung nach Nachbarschaft: Das Programm gruppiert Artikel nach ihrem Thema (z. B. gehen alle Artikel über „Geschichte" in einen Raum, alle über „Sport" in einen anderen). Es ist einfacher, Duplikate zu finden, wenn man nur Äpfel mit Äpfeln vergleicht.
  2. Der „Fingerabdruck"-Scan: Das Programm verwandelt jeden Artikel in einen mathematischen „Fingerabdruck" (einen Vektor). Es betrachtet die ersten paar Wörter des Artikels, um zu sehen, ob sie dem Muster einer Vorlage entsprechen.
  3. Der Ähnlichkeitstest: Es vergleicht diese Fingerabdrücke miteinander unter Verwendung eines mathematischen Tricks namens MinHashing. Stellen Sie sich vor, Sie haben zwei Bücher. Wenn sie zu viele identische Sätze in derselben Reihenfolge teilen, sind sie wahrscheinlich Klone.
  4. Die Grenze: Das Programm berechnet einen „Ähnlichkeitswert". Wenn ein Artikel zu ähnlich zu anderen ist (über einem bestimmten Schwellenwert), wird er aus der Bibliothek geworfen. Es ist wie ein Türsteher in einem Club, der sagt: „Sie sehen genau wie alle anderen in der Schlange aus; Sie kommen nicht herein."

Die Ergebnisse

Der Artikel testete diese Methode an sieben südslawischen Sprachen. Die Ergebnisse waren dramatisch:

  • Serbisch: Hatte das größte Durcheinander zu reinigen. Vor dem Filtern hatte es über 500.000 Artikel. Nachdem der „Türsteher" seine Arbeit erledigt hatte, wurden fast die Hälfte entfernt, weil sie Duplikate oder automatisch generiert waren. Die Wortzahl sank um fast 60 %.
  • Bulgarisch und Slowenisch: Diese waren bereits ziemlich sauber, sodass sie weniger Artikel verloren.
  • Der Gewinn: Das Endergebnis ist eine kleinere, aber qualitativ hochwertigere Bibliothek. Die Wörter in diesen neuen Bibliotheken entsprechen dem, wie echte Menschen tatsächlich sprechen, und nicht dem, wie eine Datenbank Text generiert.

Warum dies wichtig ist

Der Autor argumentiert, dass ein Roboter, um eine Sprache gut zu lernen, echte menschliche Schriften lesen muss, nicht computergenerierten Fülltext. Durch diesen zweistufigen Prozess (Bereinigung des Codes, dann Filtern der Klone) bietet der Artikel einen zuverlässigen, hochwertigen Satz von Büchern zum Training von KI-Modellen in südslawischen Sprachen.

Kurz gesagt: Der Artikel lehrt uns, wie man einen chaotischen, codegefüllten Müllhaufen von Wikipedia nimmt, ihn von Computerschrott reinigt und dann die „Kopier-Einfüge"-Artikel verwirft, um eine reine Sammlung menschlicher Sprache zurückzulassen, bereit, von einem Roboter gelernt zu werden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →