Analysis of Numerical Localisation in LLM Translations
Dit artikel breidt eerder onderzoek naar numerieke vertaling uit door vijf commodity-compatibele grote taalmodellen te evalueren, waarbij wordt vastgesteld dat het direct in de promptcontext implementeren van lokalisatieprincipes statistisch significante verbeteringen in nauwkeurigheid oplevert voor het vertalen van tijden, getallen en datums in vergelijking met directe vertaling of andere strategieën.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een ansichtkaart naar een vriend in een ander land wilt sturen. Je schrijft de datum als "07/04/2024." Voor jou is het 4 juli. Voor je vriend in het VK is het 7 april. Als je een recept, een bankoverschrijving of een wetenschappelijke formule verstuurt, is het fout gaan met de cijfers en datums niet alleen een typefout; het is een ramp. Dit is de wereld van lokalisatie. Terwijl vertaling lijkt op het omwisselen van woorden (het veranderen van "dog" in "Hund"), is lokalisatie als het veranderen van de volledige outfit van de informatie om bij de lokale cultuur te passen. Het is beslissen of je een pak draagt of een smoking, of in dit geval, of je een komma of een punt gebruikt om decimalen te scheiden.
Maak kennis met Large Language Models (LLM's). Denk aan deze als ongelooflijk slimme, supersnelle robots die bijna alles op het internet hebben gelezen. Ze zijn geweldig in het schrijven van verhalen en het vertalen van zinnen, maar ze struikelen soms over de strikte regels van getallen en datums. Ze weten misschien dat "1,000" duizend betekent, maar ze kunnen vergeten dat datzelfde getal in Duitsland als "1.000" wordt geschreven. Dit artikel duikt in een specifiek hoekje van de AI-wetenschap: kunnen deze robotbreinen niet alleen woorden vertalen, maar ook getallen en datums correct "verkleed" voor een nieuw land? Het is een cruciale vraag, want als een AI de lokalisatie verkeerd doet, kan het een veilige medische dosis in een gevaarlijke dosis veranderen of een kleine winst in een enorm verlies.
De Grote Getallenmake-over
In dit onderzoek heeft een onderzoeker genaamd Patrizia Kaye vijf verschillende AI-modellen op de proef gesteld. Dit waren geen enorme, supercomputer-achtige modellen die miljoenen kosten om te draaien; in plaats daarvan koos ze vijf kleinere, "commodity" modellen die kunnen draaien op standaard hardware, zoals een krachtige gaming laptop. Ze wilde zien of deze modellen de lastige taak konden aanpak alsof ze Engelse tekst vertaalden naar het Duits (en vice versa) terwijl ze de getallen, datums en tijden precies volgens de lokale regels kregen.
Om dit te doen, zette ze een klein experiment op. Ze nam 700 zinnen met datums, tijden en getallen uit echte bronnen zoals verslagen van het Europees Parlement en medische documenten. Vervolgens vroeg ze de AI-modellen om deze zinnen te vertalen met behulp van vier verschillende "strategieën" of methoden:
- Directe Vertaling: Gewoon de AI vragen: "Vertaal deze zin."
- In-Context Learning (ICL): De AI een referentie geven in de prompt, zoals zeggen: "Onthoud, in het Duits gebruiken we een punt voor duizendtallen en een komma voor decimalen."
- Chain-of-Thought (CoT): De AI vragen om "hardop na te denken" en zijn stappen uit te leggen voordat hij het antwoord geeft.
- Post-Editing: De AI eerst laten vertalen, en vervolgens een apart computerscript gebruiken om de getallen op te sporen en handmatig te corrigeren.
De Verrassende Winnaar
De resultaten waren een beetje een plotwending. In een eerder onderzoek naar het vertalen van getallen tussen Engels en Chinees, ontdekten onderzoekers dat de "Post-Editing" methode (het achteraf corrigeren van de getallen) de beste was. Maar toen Patrizia dit testte op Engels en Duits, was Post-Editing eigenlijk de slechtste strategie, met vaak een nauwkeurigheid van onder de 30%. Het lijkt erop dat wanneer de AI in de war raakt, het proberen te corrigeren van de getallen achteraf de boel juist een puinhoop maakt.
De "Chain-of-Thought" methode, waarbij de AI zijn redenering uitlegt, hielp ook niet veel. Het leidde de modellen er vaak toe om foutieve antwoorden te geven terwijl ze heel slim probeerden te klinken over hoe ze daar gekomen waren.
De echte kampioen bleek In-Context Learning te zijn. Wanneer de onderzoeker simpelweg een paar duidelijke instructies aan de prompt toevoegde—door de AI precies te vertellen hoe de getallen en datums geformatteerd moeten worden—presteerden de modellen aanzienlijk beter. Voor het best presterende model (Qwen3-4B-Instruct-2507) verhoogde deze simpele "referentie" de nauwkeurigheid naar 91,7% voor getallen in de richting van Engels naar Duits, een lichte verbetering ten opzichte van de 92,2% die door directe vertaling alleen werd bereikt. De studie vond dat deze verbetering niet slechts een gelukkige gok was; statistische tests bevestigden dat het toevoegen van deze regels aan de prompt een echt, meetbaar verschil maakte vergeleken met andere strategieën.
Wat Betreft Grotere Breinen?
Je zou kunnen denken dat een groter AI-model met meer "hersencapaciteit" (parameters) altijd een betere job zal doen. Echter, het paper vond dat grootte niet altijd gelijkstaat aan succes. De geteste modellen varieerden van 2 miljard tot 7 miljard parameters. Verrassend genoeg presteerde het 4-miljard-parameter model in veel gevallen beter dan de 7-miljard-parameter modellen. Dit sugggeert dat voor deze specifieke taak, het hebben van de juiste instructies belangrijker is dan het hebben van het grootste brein.
De studie testte ook of het vertellen van de AI welke versie van Engels of Duits te gebruiken (zoals "Brits Engels" versus "Duits uit Duitsland") hielp. Het hielp een klein beetje, maar niet zoveel als het simpelweg geven van de formateringsregels in de prompt.
De Kern van het Verhaal
Dit artikel suggereert dat als je wilt dat een AI getallen en datums correct afhandelt bij het vertalen, je niet alleen moet vragen om "zijn best te doen." Vertrouw niet op het feit dat de AI zijn eigen fouten later herstelt, en dwing het ook niet om zijn denken uit te leggen. Geef het in plaats daarvan direct aan het begin een duidelijke set regels. Door de lokalisatieprincipes direct in het gesprek te verweven, kun je een verwarde robot veranderen in een precieze vertaler. Hoewel de resultaten specifiek zijn voor de geteste modellen en taalparen, biedt de methode een reproduceerbare manier om AI-vertalingen veiliger en nauwkeuriger te maken voor iedereen die te maken heeft met geld, wetenschap of schema's over de grenzen heen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.