← Neueste Arbeiten
💬 NLP

Transferring Natural Language Datasets Between Languages Using Large Language Models for Modern Decision Support and Sci-Tech Analytical Systems

Dieses Paper schlägt eine Pipeline für den Transfer annotierter Datensätze zwischen Sprachen unter Verwendung von Large Language Models vor und demonstriert dessen Wirksamkeit durch die Übersetzung des englischen DEFT-Korpus ins Russische, um eine Ressource für das Mining seltener Terminus-Definitionen zu schaffen, die wissenschaftliche Trendanalysen und Entscheidungsfindung unterstützt.

Ursprüngliche Autoren: Dmitrii Popov, Egor Terentev, Danil Serenko, Ilya Sochenkov, Igor Buyanov

Veröffentlicht 2026-07-08
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Dmitrii Popov, Egor Terentev, Danil Serenko, Ilya Sochenkov, Igor Buyanov

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten eine riesige, unglaublich detaillierte Bibliothek englischer Bücher, in der jedes wichtige Wort (wie „Photosynthese“ oder „Inflation“) hervorgehoben ist und die Definition direkt daneben steht. Diese Bibliothek wäre eine Goldgrube für Computer, die versuchen zu lernen, wie man Wissenschaft und Technologie versteht. Dieses Problem ist jedoch: Diese Bibliothek existiert nur auf Englisch.

Das Problem? Es gibt kein Äquivalent dazu auf Russisch. Eine solche Bibliothek von Grund auf neu aufzubauen, wäre so, als würde man ein Team von Tausenden von Menschen engagieren, die jedes Buch lesen, die Wörter finden und die Definitionen per Hand aufschreiben. Das würde ewig dauern und ein Vermögen kosten.

Die große Idee: Die Abkürzung durch den „intelligenten Übersetzer“
Die Autoren dieser Arbeit fragten sich: Können wir eine superintelligente KI (ein Large Language Model oder LLM) als Übersetzer einsetzen, der nicht nur die Wörter übersetzt, sondern auch die Hervorhebungen und Definitionen mitnimmt?

Stellen Sie sich das so vor: Stellen Sie sich vor, Sie haben eine Karte einer Stadt, auf der alle berühmten Wahrzeichen rot eingekreist sind. Sie möchten eine Karte derselben Stadt, aber in einer anderen Sprache. Ein normaler Übersetzer würde einfach die Straßennamen in die neue Sprache schreiben und die roten Kreise an der falschen Stelle schweben lassen. Die Autoren wollten eine KI, die sagen kann: „Okay, ich sehe den roten Kreis um ‚Eiffel Tower‘ im Englischen. Auf Französisch ist das ‚Tour Eiffel‘. Ich werde den roten Kreis so verschieben, dass er nun um ‚Tour Eiffel‘ herum liegt.“

Wie sie es getestet haben
Sie nahmen einen spezifischen englischen Datensatz namens DEFT (der voll von wissenschaftlichen Begriffen und deren Definitionen ist) und versuchten, diesen unter Verwendung verschiedener KI-Modelle (wie ChatGPT, Llama, DeepSeek und Qwen) ins Russische zu „transferieren“.

Sie probierten zwei Hauptansätze aus:

  1. Der „Mathematik“-Ansatz: Sie sagten der KI: „Das Wort beginnt bei Zeichen 10 und endet bei Zeichen 20. Übersetze den Text und nenne mir dann die neuen Zeichennummern für das russische Wort.“
    • Ergebnis: Die KI war verwirrt. Es ist, als würde man jemanden bitten, die Ziegel in einer Mauer zu zählen, während diese Person gleichzeitig die Mauer in einer anderen Farbe wieder aufbaut. Die KI verlor ständig die Orientierung oder gab die falschen Zahlen an.
  2. Der „Wort-finden“-Ansatz: Sie änderten die Anweisungen. Anstatt nach Zahlen zu fragen, sagten sie: „Hier ist der englische Satz mit dem hervorgehobenen Wort. Hier ist die russische Übersetzung. Bitte hebe das russische Wort hervor, das dem englischen Wort entspricht.“
    • Ergebnis: Das funktionierte viel besser! Es war eher so, als würde man die KI bitten, einfach auf das passende Bild zu zeigen, anstatt komplexe Mathematik zu betreiben.

Die Ergebnisse

  • Der beste Übersetzer: Das KI-Modell DeepSeek hat die beste Arbeit geleistet, indem es die „Hervorhebungen“ (die Annotationen) korrekt verschoben hat. Es lieferte in etwa 94 % der Fälle die richtige Antwort.
  • Die Qualität: Der resultierende russische Datensatz ist nicht perfekt. Die Autoren bezeichnen ihn als „Silver Grade“ statt als „Gold Grade“. Er ist nicht zu 100 % genau, aber gut genug, um ein solider Ausgangspunkt zu sein. Es ist wie der Entwurf eines Buches, der zu 90 % fertig ist; man muss nur noch einen menschlichen Editor hinzuziehen, um die verbleibenden 10 % Fehler zu korrigieren, was viel schneller geht, als das ganze Buch von Grund auf neu zu schreiben.
  • Training neuer Modelle: Sie nutzten diesen neu durch KI übersetzten russischen Datensatz, um ein kleineres, einfacheres KI-Modell (ein BERT-Modell) zu trainen. Diese neue russische KI lernte, Definitionen und Begriffe recht gut zu erkennen, was bewies, dass die „Silver“-Daten nützlich genug waren, um einem Computer etwas Neues beizubringen.

Warum das wichtig ist
Die Autoren erklären, dass diese Methode ein Wendepunkt für „ressourcenarme“ Sprachen (Sprachen, die nicht über genügend digitale Daten verfügen) ist. Anstatt Jahre darauf zu warten, einen Datensatz von Null aufzubauen, können Forscher diese „intelligenten Übersetzer“ nutzen, um schnell einen Entwurfsdatensatz zu erstellen. Dies hilft Wissenschaftlern und Entscheidungsträgern in Russland (und potenziell auch anderen Sprachen später), Trends in Wissenschaft und Technologie viel schneller zu analysieren.

Was sie nicht getan haben
Die Arbeit ist sehr spezifisch hinsichtlich ihrer Grenzen:

  • Sie haben nur Englisch-zu-Russisch getestet.
  • Sie haben nicht getestet, ob die KI die Aufgabe besser als ein menschlicher Übersetzer erledigen kann (sie geben zu, dass menschliche Übersetzer immer noch besser sind).
  • Sie haben die KI nicht auf den schwierigsten Teil der ursprünglichen Aufgabe getestet (die Verknüpfung von Begriffen mit Definitionen), und überlassen dies zukünftigen Arbeiten.

Kurz gesagt zeigt die Arbeit, dass KI zwar noch nicht perfekt ist, aber ein mächtiges Werkzeug ist, um Wissen von Englisch nach Russisch zu „kopieren und einzufügen“, wodurch Forscher eine enorme Menge an Zeit und Mühe sparen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →