← Nieuwste papers
💬 NLP

Evaluating Prompt Scope and Demonstration Similarity in Local LLM Machine Translation

Dit artikel evalueert hoe de omvang van de prompt en strategieën voor demonstratieselectie de prestaties van lokale instructie-afgestemde LLM's bij machinevertaling over meerdere taalfamilies beïnvloeden, waarbij wordt vastgesteld dat hoewel toegewijde MT-systemen superieur blijven, embedding-gebaseerde few-shot prompting en prompts met een familie-omvang grotere modellen kunnen verbeteren ondanks het introduceren van uitdagingen voor gestructureerde output bij kleinere modellen.

Oorspronkelijke auteurs: Mihael Arcan

Gepubliceerd 2026-07-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mihael Arcan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super-slimme robotvriend hebt die bijna elke taal spreekt. Je vraagt hem om een zin van het Engels naar het Frans te vertalen en hij doet het geweldig. Maar wat gebeurt er als je hem vraagt om diezelfde zin tegelijkertijd in het Frans, Spaans en Italiaans te vertalen? Of wat als je hem een paar voorbeeldzinnen geeft om te laten zien hoe je dingen graag gedaan wilt hebben voordat hij begint? Dit artikel leeft in de wereld van Machinevertaling, wat de wetenschap is van het leren aan computers hoe ze één taal in een andere kunnen veranderen. Een lange tijd testten we deze robots door ze telkens één simpele vraag te stellen: "Vertaal dit." Maar het echte leven is rommeliger. Mensen vragen vaak om meerdere talen tegelijk, of ze geven de robot een "spiekbriefje" met voorbeelden om hem te helpen de gewenste stijl te begrijpen. De grote vraag is: maakt het de robot beter als je tegelijkertijd meer dingen vraagt, of als je hem een spiekbriefje geeft, of raakt hij er juist door in de war? Dit is belangrijk omdat steeds meer mensen deze "robots" (genaamd Large Language Models) op hun eigen computers draaien voor privacy en snelheid, in plaats van gebruik te maken van gigantische cloudservers. We moeten weten of deze lokale robots klaar zijn voor de echte wereld, of dat ze alleen werken als de test super simpel is.

De auteurs van dit artikel besloten deze lokale robots op een zeer specifieke manier op de proef te stellen. Ze vroegen ze niet alleen om één zin in één taal te vertalen; ze behandelden de manier waarop ze de vraag stelden als een variabele. Ze testten drie verschillende "lokale" robots (kleinere modellen die je op je eigen computer kunt draaien) tegenover enkele zeer serieuze, toegewijde vertaalmachines. Ze vroegen de robots om Engels te vertalen in negen verschillende Europese talen, gegroepeerd in twee families: de "Romaanse" familie (zoals Frans, Spaans en Italiaans) en de "Germaanse" familie (zoals Duits, Nederlands en Zweeds).

De onderzoekers probeerden drie verschillende strategieën voor het geven van "spiekbriefjes" (genoemd few-shot prompting). Eerst gaven ze de robot nul voorbeelden. Tweede, ze gaven hem vijf willekeurige voorbeelden. Derde, ze gaven hem vijf voorbeelden die zorgvuldig waren uitgekozen om heel erg op de zin die ze wilden vertalen te lijken, ofwel door te kijken naar de gebruikte woorden, ofwel door een slim computerprogramma te gebruiken om vergelijkbare betekenissen te vinden. Ze testten ook twee verschillende "scopes": vragen om slechts één taal per keer, of vragen om alle vijf de talen in een familie tegelijkertijd te vertalen, waarbij de antwoorden netjes in een JSON-formaat worden verpakt (een specifieke computerbestandsstructuur).

Dit is wat ze vonden, en het is een beetje een gemengd beeld. Ten eerste zijn de ouderwetse, toegewijde vertaalmachines nog steeds de kampioenen. Ze zijn het meest betrouwbaar, vooral bij het vertalen naar Germaanse talen. De lokale robots worden beter en ze kunnen het opnemen tegen de professionals voor sommige Romaanse talen zoals Spaans en Portugees, maar ze verslaan de professionals nog niet echt.

Ten tweede hangt de "spiekbriefje"-strategie volledig af van welke robot je gebruikt. Voor de twee sterkere lokale robots (mistral:latest en qwen2.5:14b) hielp het geven van voorbeelden daadwerkelijk. Ze werden beter in vertalen wanneer ze eerst voorbeelden zagen. Maar voor de kleinste robot (llama3.2:3b) was het geven van voorbeelden een ramp. Hij werd juist slechter wanneer hij de extra voorbeelden moest lezen. Het is als een student die geweldig scoort op een toets wanneer hij alleen de vraag leest, maar in de war raakt en fouten maakt wanneer je hem eerst een voorbeeldantwoord laat zien.

De manier waarop je de vraag stelt, maakt ook veel uit. Wanneer de onderzoekers de robots vroegen om alle vijf de talen tegelijkertijd te vertalen (de family-scope prompt), gingen de grotere robots er goed mee om en produceerden ze een nette lijst met vertalingen voor elke taal. Maar de kleinste robot? Die stortte volledig in. Hij vergat vaak om sommige talen te vertalen, of hij kon de instructies niet opvolgen om de antwoorden in het juiste formaat te zetten. Het is alsof de kleine robot overweldigd werd door de grote bestelling en gewoon de helft van de items liet vallen.

Het artikel keek ook naar de vraag of de "slimme" manier van het kiezen van voorbeelden (het vinden van de meest vergelijkbare zinnen) beter was dan het simpelweg kiezen van willekeurige voorbeelden. Voor de robots die voorbeelden konden gebruiken, hielpen de slimme, vergelijkbare voorbeelden een klein beetje meer dan de willekeurige voorbeelden. Maar het verschil was niet enorm. Het belangrijkste was simpelweg dat de robot in staat was om de voorbeelden überhaupt te gebruiken. Als de robot te klein of te verward was, kon zelfs de beste voorbeelden hem niet redden.

Kortom, dit artikel suggereert dat we niet simpelweg kunnen zeggen "AI-vertaling is goed" of "AI-vertaling is slecht". Het hangt ervan af hoe je de vraag stelt. Als je een lokale robot wilt gebruiken om voor jou te vertalen, moet je een model kiezen dat groot genoeg is om complexe instructies en meerdere talen tegelijk aan te kunnen. Als je een piepklein model kiest en het te veel tegelijk vraagt, of het te veel extra informatie geeft, kan het spectaculair falen. De auteurs concluderen dat wanneer we deze vertaaltools testen, we niet alleen naar de kwaliteit van de vertaling moeten kijken; we moeten ook controleren of de robot in staat is om complexe instructies op te volgen en precies te leveren wat we hebben gevraagd, zonder dat hij de ballen laat vallen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →