Learning from Many Voices: Literary MT Using Multi-Reference Human and Synthetic Data
Dit artikel stelt een op semantische gelijkenis gebaseerd filteringsframework voor om multi-referentie datasets te benutten voor literaire machinevertaling, waarbij wordt aangetoond dat fijnmazig afstemmen op menselijke vertalingen met een gemiddelde tot hoge gelijkenis beter presteert dan zowel data met een lage gelijkenis als synthetische, door LLM's gegenereerde alternatieven.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Taal is een levend wezen, en wanneer een groot literair werk wordt vertaald, verplaatst het zich niet simpelweg van de ene naar de andere taal zoals een pakket dat wordt verzonden. In plaats daarvan transformeert het. Een enkel verhaal kan op vele verschillende manieren worden verteld, waarbij elke versie een iets andere nuance van betekenis, ritme of culturele nuance vangt. In de wereld van machinale vertaling, waar computers proberen te leren hoe ze tekst moeten vertalen, vormt deze variëteit een unieke puzzel. Decennialang hebben onderzoekers deze systemen getraind met behulp van enorme hoeveelheden gegevens, waarbij ze vaak vertrouwden op enkele, perfecte vertalingen of kunstmatig gegenereerde variaties om de computer te leren hoe een correcte zin eruitziet. Literaire werken zijn echter anders dan nieuwsberichten of technische handleidingen; ze zijn rijk aan metaforen, stijl en culturele context, en een enkele "correcte" versie slaagt er vaak niet in de volledige diepgang van het origineel te vatten. De vraag waarmee onderzoekers werden geconfronteerd, was of een computer kon leren de rijkdom van deze meerdere geldige interpretaties te waarderen, of dat de verschillen de computer in verwarring zouden brengen.
Een team van onderzoekers ging op onderzoek uit naar de beste manier om machines te leren met deze complexiteit om te gaan. Ze wenden zich tot een dataset die meerdere menselijke vertalingen van dezelfde literaire paragrafen bevat, voornamelijk van het Frans en Russisch naar het Engels. Dit waren geen willekeurige gissingen, maar expertvertalingen, elk door een verschillende professional die zijn eigen keuzes had gemaakt over hoe de stem van de auteur over te brengen. De onderzoekers wilden weten of ze deze meerdere versies konden gebruiken om een beter vertaalingssysteem te trainen. Hun aanpak hield een zorgvuldig filterproces in. Ze maten hoe semantisch gelijk waren de verschillende menselijke vertalingen aan elkaar. Als twee vertalingen bijna identiek waren, boden ze weinig nieuwe informatie. Als ze te verschillend waren, konden ze wijzen op een misinterpretatie van de brontekst. Het doel was om het "sweet spot" te vinden: vertalingen die getrouw waren aan de oorspronkelijke betekenis, maar die voldoende varieerden in bewoording en structuur om de computer te laten zien op welke vele manieren een verhaal verteld kan worden.
Het team ontdekte dat niet alle data gelijk is. Wanneer zij hun modellen trainden met enkel vertalingen die sterk van elkaar verschilden, waren de resultaten slecht. De computer had moeite om een consistente weg te vinden en produceerde vaak fouten of onhandige formuleringen. Echter, wanneer zij zich concentreerden op de vertalingen die een sterke kernbetekenis deelden maar nog steeds een betekenisvolle variatie vertoonden in de wijze waarop zij werden uitgedrukt, verbeterde de prestatie drastisch. Deze datasets met een "medium tot hoge" gelijkenis leerden de machine zowel nauwkeurig als flexibel te zijn. Sterker nog, het gebruik van deze zorgvuldig gefilterde dataset leverde resultaten op die net zo goed waren als, of zelfs beter dan, het gebruik van de volledige ongefilterde collectie vertalingen, die de ruisachtige, verwarrende voorbeelden bevatte. Dit suggereert dat kwaliteit en het juiste soort diversiteit veel belangrijker zijn dan louter volume bij het aanleren van een machine hoe men met literatuur moet omgaan.
De onderzoekers testten ook een populaire moderne afkorting: het gebruik van kunstmatige intelligentie om extra vertalingen te genereren in plaats van uitsluitend te vertrouwen op menselijke experts. Het idee was dat computers snel duizenden variaties konden creëren om de gaten op te vullen, vooral voor talen waar menselijke vertalingen schaars zijn. Hoewel deze methode goedkoop en handig is, bleek de studie dat het tekortschoot. Modellen die getraind waren op deze synthetische, door de computer gegenereerde vertalingen, presteerden niet zo goed als die getraind op het werk van menselijke experts. De kunstmatige vertalingen misten vaak het subtiele culturele begrip en de stilistische gratie die menselijke professionals bij de taak brengen. Zelfs de meest geavanceerde taalmodellen die werden gebruikt om deze synthetische voorbeelden te generen, konden de diepte van menselijke expertise niet betrouwbaar nabootsen. De menselijke vertalingen bleven de gouden standaard, wat bewees dat voor de genuanceerde kunst van literaire vertaling menselijk oordeel nog steeds onmisbaar is.
Uiteindelijk biedt de studie een duidelijk pad voorwaarts voor het verbeteren van hoe machines grote literatuur vertalen. Het laat zien dat de sleutel niet alleen is om de computer meer data te voeren, maar om de juiste soort data te voeren: vertalingen die de oorspronkelijke betekenis respecteren terwijl ze de natuurlijke variëteit van menselijke expressie omarmen. Door de ruis weg te filteren en ons te richten op de rijke, getrouwe variaties in menselijk werk, kunnen onderzoekers systemen bouwen die nauwkeuriger en gevoeliger zijn voor de schoonheid van de brontekst. Hoewel kunstmatige intelligentie kan helpen bij het genereren van data, kan het de diepe, intuïtieve kennis van een menselijke vertaler nog niet vervangen. De toekomst van literaire machinale vertaling ligt in een partnerschap waarbij technologie het beste van menselijk inzicht benut, zodat verhalen hun volledige betekenis en geest behouden terwijl ze over talen heen resoneren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.