Building Large-Scale English-Romanian Literary Translation Resources with Open Models
Dit artikel introduceert het TinyFabulist Translation Framework (TF2), een verenigde pijplijn die gebruikmaakt van synthetische gegevens en een tweestaps fine-tuningproces om een kosteneffectief, open 12B-parameter model te produceren voor hoogwaardige Engels-naar-Roemeense literaire vertaling, samen met de release van grootschalige datasets en evaluatietools.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin verhalen de valuta van cultuur zijn, maar sommige talen als eilanden zijn met zeer weinig bruggen die hen met de rest van de wereld verbinden. Dit is de uitdaging van machinale vertaling, een tak van kunstmatige intelligentie die probeert computers te leren verschillende talen te spreken. Meestal leren deze computers door miljoenen boeken en nieuwsartikelen geschreven door mensen te lezen. Maar voor veel talen, vooral voor talen die door minder mensen worden gesproken, zijn er simpelweg niet genoeg boeken om de computer te onderwijzen. Het is alsof je probeert te leren hoe je Italiaans eten kookt terwijl je nog nooit een recept hebt gezien of een tomaat hebt geproefd.
Om dit op te lossen, zijn wetenschappers Large Language Models (LLMs) gaan gebruiken. Denk aan deze als superintelligente, digitale chefs die bijna elk gerecht ter wereld hebben geproefd en kunnen raden hoe een nieuw recept zou moeten smaken. Het is echter veel moeilijker om deze chefs te leren hoe ze literatuur moeten bereiden — verhalen met gevoelens, grappen en culturele geheimen — dan een nieuwsbericht te vertalen. En dit doen voor een taal als het Roemeens, dat minder digitale middelen heeft dan het Engels, is als het proberen te bakken van een perfecte taart in een keuken met zeer beperkte ingrediënten en een krap budget. De grote vraag die onderzoekers stellen is: Kunnen we een hoogwaardige bibliotheek van vertaalde verhalen opbouwen zonder een fortuin uit te geven of een supercomputer nodig te hebben?
Het Verhaal van de Kleine Fabulist
In dit artikel introduceert een team onderzoekers uit Roemenië een nieuw project genaamd TF2 (TinyFabulist Translation Framework). Hun doel was om een enorme bibliotheek van vertaalde fabels te creëren — korte, morele verhalen zoals de fabels van Aesopus — van het Engels naar het Roemeens. Ze wilden zien of ze dit konden doen met behulp van "open" modellen (gratis, publieke AI-tools) in plaats van dure, private modellen, en of ze dit konden doen met een minimaal budget.
Het Recept: Een Bibliotheek vanaf de Grond Opbouwen
De onderzoekers wisten dat ze niet simpelweg mensen konden vragen om miljoenen verhalen te vertalen; dat zou te lang duren en te veel kosten. In plaats daarvan bouwden ze een vierstaps assemblageband om de gegevens zelf te creëren:
- De Smaaktest (Fase 1): Eerst testten ze 13 verschillende AI-modellen (sommige gratis, sommige betaald) om te zien welk model het beste was in het vertalen van een paar voorbeeld-fabels. Ze keken niet alleen of de woorden overeenkwamen; ze vroegen de AI om de vertalingen te beoordelen op vijf punten: nauwkeurigheid, vloeiendheid, logica van het verhaal, stijl en culturele aansluiting. De winnaar was een krachtig model genaamd GPT-o3, dat hun "gouden standaard" werd voor het maken van de rest van de bibliotheek.
- De Zilveren Standaard (Fase 2): Met behulp van dat winnende model vertaalden ze 15.000 Engelse fabels naar het Roemeens. Hoewel deze door een robot waren gemaakt, waren ze zo goed dat de onderzoekers ze behandelden als een "zilveren standaard" (bijna net zo goed als goud) om hun eigen aangepaste modellen op te trainen.
- De Gespecialiseerde Training (Fase 3): Dit is het magische deel. Ze namen open-source AI-modellen (specifiek versies van Gemma, variërend van kleine modellen met 1 miljard parameters tot een model met 12 miljard parameters) en gaven ze een speciale "hogeschool". Ze gebruikten een techniek genaamd LoRA (Low-Rank Adaptation), wat vergelijk je met het geven van een specifiek kookboek voor fabels aan een algemene chef, zonder de hele keuken te hoeven herbouwen. Ze trainden deze modellen op de 15.000 vertaalde verhalen.
- De Massaproductie (Fase 4): Ten slotte gebruikten ze hun nieuw getrainde, gespecialiseerde modellen om de resterende 3 miljoen fabels uit de oorspronkelijke Engelse collectie te vertalen. Het resultaat is een enorme nieuwe dataset genaamd DS-TF2-EN-RO-3M, die drie miljoen paren van Engelse en Roense fabels bevat.
De Resultaten: Kleine Modellen, Grote Verrassingen
De onderzoekers legden hun nieuwe, getrainde modellen vervolgens op de proef tegenover de grote, dure, private modellen (zoals GPT-4 en DeepL) en de oorspronkelijke, ongetrainde open modellen.
- De Kloof Dicht: Hun beste open model, TF2-12B (de versie met 12 miljard parameters), presteerde ongelooflijk goed. Het scoorde gemiddeld een 4,83 op 5 op hun kwaliteitsrubriek, terwijl het beste private model (GPT-o3) een 4,92 scoorde. De kloof tussen het gratis, aangepaste model en de dure, propriëtaire reus was minuscuul — minder dan 0,1 punt.
- Het Kostenverschil: Dit is waar het verhaal echt spannend wordt. Het vertalen van alle 3 miljoen fabels met behulp van de dure private API's zou tussen de $1.800 en $32.400 hebben gekost (afhankelijk van welk model je koos). In contrast hiermee deed hun open-source TF2-model precies hetzelfde werk voor ongeveer $350. Dat is een besparing van 97% tot 99%.
- De Kleine Modellen: Zelfs hun kleinste model (1 miljard parameters) sprong na training van een score van 2,02 naar 3,75. Het was niet perfect, maar het ging van "nauwelijks begrijpelijk" naar "vrij goed", wat bewees dat zelfs kleine, goedkope computers kunnen leren om verhalen te vertellen als ze op de juiste manier worden onderwezen.
Wat Ze Vonden (en Wat Ze Niet Vonden)
Het artikel suggereert dat je geen miljardair hoeft te zijn om hoogwaardige instrumenten voor literaire vertaling te bouwen. Door een slim, stapsgewijs proces te gebruiken en zich te concentreren op een specif kind van verhalen (fabels), lieten ze zien dat open modellen kunnen concurreren met de reuzen.
De auteurs zijn echter voorzichtig met een paar opmerkingen:
- Het is nog niet perfect: Hoewel de open modellen dichtbij komen, scoren de private modellen (zoals GPT-o3) nog steeds iets hoger, vooral op het gebied van stijl en culturele nuance. De open modellen zijn een geweldig alternatief, maar ze hebben het probleem van het evenaren van menselijk niveau van vertaalingskwaliteit in elk geval nog niet volledig "opgelost".
- De "Gouden Standaard" is Zilver: De referentietranslaties die ze gebruikten om de modellen te trainen, werden gemaakt door een andere AI, niet door een mens. Dit betekent dat de modellen leren om te klinken als andere AI's, en niet noodzakelijkerwijs als menselijke vertalers. De onderzoekers controleerden dit door een menselijke expert naar een kleine steekproef van de verhalen te laten kijken, en de mens stemde ermee in dat de AI-rangschikkingen over het algemeen correct waren, maar ze geven toe dat een grotere menselijke studie nodig is om 100% zeker te zijn.
- Fabels zijn Speciaal: Fabels zijn kort en hebben een duidelijke structuur. De onderzoekers suggereren dat hoewel deze methode uitstekend werkt voor fabels, het moeilijker kan zijn toe te passen op complexe romans met diepe metaforen of historische dialogen.
De Kernboodschap
Het TF2-project is als het tonen dat je een prachtige bibliotheek kunt bouren met gerecyclede materialen en een beetje vindingrijkheid, in plaats van een kluis vol goud nodig te hebben. Ze bewezen dat je met de juiste trainingsdata en een slimme, kosteneffectieve aanpak, open-source AI kunt gebruiken om literaire inhoud voor talen zoals het Roemeens te vertalen tegen een fractie van de gebruikelijke kosten. Ze hebben al hun code, hun dataset van 3 miljoen verhalen en hun getrainde modellen aan het publiek vrijgegeven, in een uitnodiging aan iedereen om voort te bouwen op hun werk. Het is een stap naar een toekomst waarin AI kan helpen bij het bewaren en delen van verhalen uit elke cultuur, ongeacht hoeveel geld die cultuur te besteden heeft aan technologie.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.