Retrieval-Augmented Long-Context Translation for Cultural Image Captioning: Gators submission for AmericasNLP 2026 shared task
Die University of Florida Gators gewannen die gemeinsame Aufgabe von AmericasNLP 2026 zur kulturellen Bildunterschrift für indigene Sprachen durch den Einsatz einer zweistufigen Pipeline, die Qwen2.5-VL für spanische Zwischenunterschriften mit retrieval-augmented many-shot prompting unter Verwendung von Gemini 2.5 Flash kombiniert und damit Leistungssteigerungen von über 120 % gegenüber der Baseline über Bribri, Guaraní und Orizaba-Nahuatl hinweg erzielte.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, eine kurze, kulturell perfekte Beschreibung eines Fotos für eine Gemeinschaft zu verfassen, die eine seltene, alte Sprache spricht. Die Herausforderung besteht darin, dass Sie diese Sprache nicht gut beherrschen und nur sehr wenige Bücher oder Wörterbücher zur Verfügung stehen, die Ihnen helfen können.
Dieser Beitrag beschreibt, wie ein Team der University of Florida (die „Gators") dieses Problem für einen Wettbewerb namens AmericasNLP 2026 gelöst hat. Ihr Ziel war es, ein Bild zu nehmen und eine Bildunterschrift in einer von fünf indigenen Sprachen Amerikas (wie Guaraní oder Bribri) zu verfassen.
Hier ist, wie sie es getan haben, aufgeschlüsselt in einfache Schritte und Analogien:
Das Zwei-Schritte-Rezept
Anstatt direkt von „Bild" zu „Seltene Sprache" zu springen, nutzte das Team ein Zwei-Schritte-Staffellauf-Modell:
- Schritt 1: Der Übersetzer (Die Brücke): Zuerst verwendeten sie eine superintelligente KI (genannt Qwen), um das Bild zu betrachten und eine einfache Beschreibung auf Spanisch zu verfassen. Denken Sie an Spanisch als eine „Brückensprache", in der die KI sehr gut ist.
- Schritt 2: Der Kultur-Experte (Der Finisher): Anschließend nahmen sie diese spanische Beschreibung und baten eine andere, noch intelligentere KI (Gemini), sie in die finale indigene Sprache zu übersetzen.
Das Geheimnis: „Zeigen, nicht nur erzählen"
Die wahre Magie lag nicht nur in der Übersetzung, sondern darin, wie sie der KI beibrachten, welchen „Stil" sie verwenden sollte.
Normalerweise, wenn man eine KI bittet zu übersetzen, erhält man möglicherweise einen Satz, der grammatikalisch korrekt ist, aber wie von einem Roboter oder aus einem Lehrbuch klingt. Das Team wollte, dass die Bildunterschriften so klingen, als würde ein Einheimischer natürlich sprechen.
Um dies zu beheben, verwendeten sie eine Technik namens Retrieval-Augmented Generation (abrufgestützte Generierung).
- Die Analogie: Stellen Sie sich vor, Sie schreiben einen Brief an einen Freund in einem fremden Dorf. Anstatt nur zu raten, wie er spricht, holen Sie eine Schachtel mit 100 Briefen hervor, die andere Menschen an dasselbe Dorf geschrieben haben. Sie lesen sie, um ein Gefühl für den Slang, den Ton und die Satzstruktur zu bekommen. Dann schreiben Sie Ihren Brief und imitieren diesen Stil.
- Im Papier: Bevor die KI die spanische Bildunterschrift übersetzte, durchsuchte das System eine riesige Bibliothek bestehender Spanisch-zu-indigene-Sprache-Paare. Es griff die ähnlichsten Beispiele (wie die „100 Briefe") heraus und zeigte sie der KI als Leitfaden. Dies half der KI, das für den Wettbewerb erforderliche „Register" (den spezifischen kulturellen Stil) zu treffen.
Die Ergebnisse: Ein großer Sieg
Das Team nahm dieses System am Wettbewerb teil und gewann.
- Die Punktzahl: Sie verbesserten ihre Punktzahlen im Vergleich zur Standard-Baseline um enorme Margen. Beispielsweise verbesserten sie in der Sprache Bribri die Punktzahl um 164 %. In Guaraní verbesserten sie sie um 131 %.
- Der menschliche Test: Als menschliche Richter die Bildunterschriften betrachteten, wurden die Einreichungen des Teams zweitplatziert unter fünf Finalisten, was bewies, dass die Bildunterschriften natürlich und kulturell angemessen klangen.
Was sie lernten (Die „Aha!"-Momente)
Das Team führte viele Experimente durch, um zu sehen, was funktionierte und was nicht, was zu drei wichtigen Entdeckungen führte:
- Nicht alle Bibliotheken sind gleich: Die „Bibliothek" von Beispielen, die sie verwendeten, wirkte Wunder für Guaraní, da sie eine riesige Sammlung von 53.000 Beispielen hatten (einschließlich einiger computergenerierter „gefälschter" Beispiele, die sich als sehr hilfreich erwiesen). Für Yucatek-Maya hatten sie jedoch fast keine Beispiele. In diesem Fall war das eigene interne Wissen der KI besser als der Versuch, sie zu zwingen, eine winzige, verrauschte Bibliothek zu nutzen.
- Der Boost durch „gefälschte" Daten: Für Guaraní stammten etwa 28 Punkte ihres Erfolgs spezifisch aus der Verwendung dieser computergenerierten Beispiele. Es ist wie ein Übungscoach, der zusätzliche Übungen für Sie erstellt, die Sie studieren können.
- Der Tonfall ist wichtig (besonders für Bribri): Die Sprache Bribri hat komplexe Laute (Töne), die die Bedeutung von Wörtern verändern. Das Team stellte fest, dass eine einfache Übersetzung nicht ausreichte; sie mussten der KI spezielle Anweisungen geben, wie sie mit diesen Lauten und der Wortstellung umgehen sollte. Es war, als würde man der KI sagen: „Denken Sie daran, in dieser Sprache steht das Verb am Ende, und vergessen Sie nicht die musikalischen Noten!"
Der Haken (Einschränkungen)
Das Team gibt zu, dass ihr System noch nicht perfekt ist:
- Die Kettenreaktion: Wenn die erste KI (der spanische Übersetzer) einen Fehler bei der Beschreibung des Bildes macht, wird die zweite KI (der Übersetzer) diesen Fehler perfekt übersetzen. Es gibt keine „Rückgängig"-Taste.
- Die Testpunktzahl-Falle: Sie verwendeten Beispiele aus dem „Übungstest" (Entwicklungsdatensatz), um der KI zu helfen, den Stil zu lernen. Dies funktionierte großartig für die Übungspunktzahlen, ist aber ein wenig wie das Auswendiglernen der genauen Antworten eines Übungsquiz, bevor man die echte Prüfung schreibt. Dies könnte die Punktzahl aufblähen, daher sind sie vorsichtig mit der Interpretation dieser Ergebnisse.
Zusammenfassung
Das Team der University of Florida gewann, indem es eine Pipeline entwickelte, die zuerst ein Bild auf Spanisch beschreibt und dann eine riesige Bibliothek ähnlicher Beispiele nutzt, um einer KI beizubringen, wie sie diese Beschreibung in indigene Sprachen mit dem richtigen kulturellen Flavor übersetzt. Sie bewiesen, dass für ressourcenarme Sprachen Kontext und Stilführer genauso wichtig sind wie die Übersetzung selbst.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.