Retrieval-Augmented Long-Context Translation for Cultural Image Captioning: Gators submission for AmericasNLP 2026 shared task
De University of Florida Gators won de gedeelde taak voor culturele beeldbeschrijving in inheemse talen op AmericasNLP 2026 door een tweestapsproces te gebruiken dat Qwen2.5-VL combineert voor tussenliggende beschrijvingen in het Spaans met retrieval-versterkte many-shot prompting met Gemini 2.5 Flash, waarmee prestatieverbeteringen van meer dan 120% ten opzichte van de baseline werden bereikt voor Bribri, Guaraní en Orizaba Nahuatl.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een korte, cultureel perfecte beschrijving van een foto te schrijven voor een gemeenschap die een zeldzame, oude taal spreekt. De uitdaging is dat je die taal niet goed spreekt en er zeer weinig boeken of woordenboeken beschikbaar zijn om je te helpen.
Dit artikel beschrijft hoe een team van de University of Florida (de "Gators") dit probleem oploste voor een wedstrijd genaamd AmericasNLP 2026. Hun doel was om een foto te nemen en een bijschrift te schrijven in een van de vijf inheemse talen van Amerika (zoals Guaraní of Bribri).
Hier is hoe ze dit deden, opgesplitst in eenvoudige stappen en analogieën:
Het Twee-Stappenrecept
In plaats van rechtstreeks van "Foto" naar "Zeldzame Taal" te springen, gebruikte het team een twee-stappen estafette:
- Stap 1: De Vertaler (De Brug): Eerst gebruikten ze een superslimme AI (genaamd Qwen) om naar de foto te kijken en een eenvoudige beschrijving in Spaans te schrijven. Denk aan Spaans als een "brugtaal" waar de AI zeer goed in is.
- Stap 2: De Culturele Expert (De Finisher): Vervolgens namen ze die Spaanse beschrijving en vroegen ze een andere, nog slimmere AI (Gemini) om deze te vertalen naar de uiteindelijke inheemse taal.
De Geheime Saus: "Toon, Vertel Niet Alleen"
De echte magie zat niet alleen in de vertaling; het zat in hoe ze de AI leerden welke "stijl" ze moest gebruiken.
Normaal gesproken, als je een AI vraagt te vertalen, krijg je misschien een zin die grammaticaal correct is, maar die klinkt als een robot of een schoolboek. Het team wilde dat de bijschriften klinken alsof een lokale persoon natuurlijk spreekt.
Om dit op te lossen, gebruikten ze een techniek genaamd Retrieval-Augmented Generation.
- De Analogie: Stel je voor dat je een brief schrijft aan een vriend in een buitenlands dorp. In plaats van te raden hoe ze spreken, haal je een doos met 100 brieven tevoorschijn die andere mensen naar datzelfde dorp hebben geschreven. Je leest ze om een gevoel te krijgen voor de straattaal, de toon en de zinsbouw. Vervolgens schrijf je je brief en nabootst je die stijl.
- In het Artikel: Voordat de AI de Spaanse bijschrift vertaalde, doorzocht het systeem een enorme bibliotheek van bestaande Spaans-naar-inheemse-taal paren. Het pakte de meest vergelijkbare voorbeelden (zoals de "100 brieven") en toonde ze aan de AI als leidraad. Dit hielp de AI om de "register" (de specifieke culturele stijl) te matchen die door de wedstrijd werd vereist.
De Resultaten: Een Grote Overwinning
Het team nam dit systeem in de wedstrijd en won.
- De Score: Ze verbeterden hun scores met enorme marges in vergelijking met de standaard baseline. Bijvoorbeeld, in de taal Bribri verbeterden ze de score met 164%. In Guaraní verbeterden ze met 131%.
- De Menselijke Test: Toen menselijke beoordelaars de bijschriften bekeken, werden de inzendingen van het team tweede van de vijf finalisten gerangschikt, wat bewees dat de bijschriften natuurlijk en cultureel passend klonken.
Wat Ze Leerden (De "Aha!"-Momenten)
Het team voerde veel experimenten uit om te zien wat wel en wat niet werkte, wat leidde tot drie belangrijke ontdekkingen:
- Niet Alle Bibliotheken Zijn Gelijk: De "bibliotheek" van voorbeelden die ze gebruikten, werkte wonderen voor Guaraní omdat ze een enorme collectie van 53.000 voorbeelden hadden (inclusief enkele door computers gegenereerde "nep" voorbeelden die zeer nuttig bleken). Voor Yucateeks Maya hadden ze echter bijna geen voorbeelden. In dat geval was de eigen interne kennis van de AI beter dan proberen het te dwingen een kleine, ruisende bibliotheek te gebruiken.
- De "Nep" Data Boost: Voor Guaraní kwam ongeveer 28 punten van hun succes specifiek van het gebruik van die door computers gegenereerde voorbeelden. Het is alsof je een practice-coach hebt die extra oefeningen voor je maakt om te bestuderen.
- Toon Is Belangrijk (Vooral voor Bribri): De taal Bribri heeft complexe klanken (tonen) die de betekenis van woorden veranderen. Het team ontdekte dat simpelweg vertalen niet genoeg was; ze moesten de AI speciale instructies geven over hoe ze met deze klanken en woordvolgorde om moest gaan. Het was alsof je de AI vertelt: "Vergeet niet, in deze taal staat het werkwoord aan het einde, en vergeet de muzikale noten niet!"
De Haken (Beperkingen)
Het team geeft toe dat hun systeem nog niet perfect is:
- De Kettingreactie: Als de eerste AI (de Spaanse vertaler) een fout maakt in het beschrijven van de foto, zal de tweede AI (de vertaler) die fout perfect vertalen. Er is geen "ongedaan maken"-knop.
- De Testscoreval: Ze gebruikten voorbeelden uit de "practice test" (ontwikkelset) om de AI te helpen de stijl te leren. Dit werkte geweldig voor de practice-scores, maar het is een beetje alsof je de exacte antwoorden op een practice-quiz bestudeert voordat je het echte examen doet. Dit kan de score opblazen, dus zijn ze voorzichtig met hoe ze die resultaten interpreteren.
Samenvatting
Het team van de University of Florida won door een pijplijn te bouwen die eerst een foto beschrijft in het Spaans en vervolgens een enorme bibliotheek met vergelijkbare voorbeelden gebruikt om een AI te leren die beschrijving te vertalen naar inheemse talen met de juiste culturele smaak. Ze bewezen dat voor talen met weinig middelen context en stijlgidsen net zo belangrijk zijn als de vertaling zelf.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.