BM25-Augmented Many-Shot Translation for Low-Resource North-Eastern Indian Languages
Dit artikel presenteert de WMT26-inzending van de University of Florida Gators, die een retrieval-augmented many-shot vertaalpijplijn gebruikt met BM25 om relevante parallelle voorbeelden op te halen en Gemini 2.5 Flash voor inferentie, waarmee Engelse vertaling voor elf noordoostelijke Indiase talen wordt bereikt zonder enige modelverfijning.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin computers elke taal op aarde kunnen spreken, waarbij ze onmiddellijk een gedicht uit een afgelegen dorp in de Himalaya vertalen naar een tekstbericht in New York. Dit is de droom van machinevertaling, een vakgebied waar computers leren om woorden tussen talen te verwisselen. Jarenlang was de standaardmanier om deze computers te onderwijzen "fine-tuning", wat vergelijkbaar is met het nemen van een slimme student en die dwingen om een specifiek tekstboek uit het hoofd te leren totdat hij het perfect kan opzeggen. Maar wat als de student dat tekstboek niet heeft? Wat als de taal zo zeldzaam is dat slechts een paar mensen het ooit hebben opgeschreven? Dit is de uitdaging van "low-resource" talen. Om dit op te lossen, proberen onderzoekers een andere truc: in plaats van te memoriseren, geven ze de computer een "referentieblad" vlak voordat hij antwoordt. Ze gebruiken een zoektool om vergelijkbare zinnen te vinden die de computer eerder heeft gezien en zeggen: "Kijk, zo zeiden we dit de vorige keer; kopieer die stijl." Dit artikel onderzoekt of deze "retrieval-augmented" methode werkt voor elf zeer zeldzame talen uit Noordrijk-India, talen die bijna geen digitale geschiedenis hebben.
Het team van de University of Florida, dat zichzelf "gators" noemt, heeft een systeem gebouwd om te vertalen tussen het Engels en deze elf noordoostelijke Indiase talen. Ze probeerden niet een nieuw brein vanaf nul op te bouwen. In plaats daarvan gebruikten ze een slim tweestapsproces. Eerst gedroegen ze zich als een bibliothecaris die een tool genaamd BM25 gebruikt. Wanneer er een zin binnenkomt, scant de bibliothecaris snel een enorme bibliotheek van bestaande vertalingen om de meest vergelijkbare voorbeelden te vinden. Ten tweede gaven ze deze voorbeelden aan een superintelligent AI-model genaamd Gemini 2.5 Flash, met de instructie: "Hier zijn enkele voorbeelden van hoe je dit soort zinnen vertaalt; doe het nu zelf." De belangrijkste bevinding is dat deze "retrieval-augmented" benadering, waarbij de AI ter plekke voorbeelden opzoekt, resultaten opleverde die concurrerend waren met, en in veel gevallen zelfs iets beter dan, de gefinetunede modellen die door andere teams in de competitie werden gebruikt.
De onderzoekers testten dit op elf talen, variërend van Assamees, dat een redelijke hoeveelheid data heeft, tot Tagin en Karbi, die zo zeldzaam zijn dat ze bijna geen eerdere vertaalwerkzaamheden hebben gehad. Ze bouwden een "trainingsbank" door officiële data van een competitie genaamd WMT26 te combineren met andere publieke tekstcollecties. Vervolgens voerden ze een massaal experiment uit, waarbij ze verschillende aantallen "referentieblad"-voorbeelden probeerden. Ze vroegen zich af: "Als we de AI 20 voorbeelden laten zien, is dat beter dan 80? Wat als we het 10 voorbeelden uit een oefentoets laten zien in plaats van 40?" Ze testten elke combinatie voor elke taal en richting (Engels naar de lokale taal, en vice versa).
De resultaten waren een mix van succes en interessante verrassingen. Voor de talen met meer data, zoals Assamees en Bodo, presteerde het systeem zeer goed en behaalde het de eerste plaats in de competitie voor specifieke metrieken. Specifiek behaalde hun methode de beste BLEU-score in 9 van de 19 vertaaltaken en de beste ChrF++-score in 11 van de 22 taken. Voor de allerkleinste talen, zoals Tagin, slaagde het systeem er nog steeds in om vertalingen te produceren, hoewel de scores lager waren. Een belangrijke ontdekking was dat het "referentieblad" het beste werkte wanneer de voorbeelden zeer vergelijkbaar waren met de te vertalen zin. Ze ontdekten echter ook dat het simpelweg toevoegen van meer data niet altijd hielp. In één experiment probeerden ze synthetische data (computergegenereerde vertalingen) van een ander type tekst (afbeeldingsbijschriften) toe te voegen, maar dat maakte de vertaling juist slechter. Dit leerde hen dat het hebben van de juiste soort voorbeelden belangrijker is dan het hebben van een enorme stapel verkeerde voorbeelden.
Het team heeft ook een bug uit hun vorige werk opgelost. In een eerder project hadden ze per ongeluk hun zoekbibliotheek gebouwd met de verkeerde taalzijde, wat het systeem in de war bracht. Zodra ze dit herstelden, werd het systeem plotseling veel beter in het vertalen van de lokale talen terug naar het Engels. Ze merkten ook op dat voor sommige talen het tonen van een paar hoogwaardige voorbeelden uit een oefenset nuttiger was dan het tonen van een groot aantal willekeurige voorbeelden uit de hoofdbibliotheek.
Uiteindelijk laat het artikel zien dat je een computer niet altijd een taal vanaf de basis hoeft te leren. Soms is het genoeg om hem een goede zoektool en een paar goede voorbeelden te geven om naar te kijken. Het systeem gokte niet alleen; het mat zijn succes met specifieke scores (zoals ChrF++ en BLEU) en stelde vast dat hun methode in het merendeel van de vertaaltaken tot de allerbeste behoorde. Hoewel het systeem niet perfect is — het raakt soms in de war door politieke onderwerpen of zeer zeldzame woorden — bewijst het dat voor deze moeilijk bereikbare talen een slimme bibliothecaris-benadering een krachtige manier is om de taal kloof te overbruggen. De auteurs suggereren dat deze methode een sterke kandidaat is voor de toekomst van het vertalen van de meest bedreigde talen ter wereld, mits we de juiste voorbeelden kunnen vinden om de AI te tonen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.