A Pocket Offline Model for Simultaneous Speech Translation as CUNI Submission to IWSLT 2026
Dit artikel presenteert de CUNI-inzending voor de IWSLT 2026 Simultaneous Speech Translation Shared Task, die het 1B-parameter offline Canary-model met het AlignAtt-beleid aanpast om hoogwaardige, meertalige simultane vertaling te bereiken over het Tsjechisch, Engels, Duits en Italiaans met lage computationele vereisten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme, meertalige vertaler hebt genaamd Canary. Deze vertaler is ongelooflijk getalenteerd in het beluisteren van een hele toespraak en het vervolgens perfect opschrijven van de vertaling. Maar er is een addertje onder het gras: Canary is gewend om te wachten totdat de spreker zijn hele zin heeft afgemaakt voordat het aan het werk gaat. Het is als een ober die weigert je bestelling op te nemen totdat je de hele menukaart hebt uitgelezen, zelfs als je alleen maar een koffie wilt bestellen.
Het team van de Charles Universiteit (CUNI) wilde Canary leren hoe het een simultaanvertaler kan zijn—iemand die tegelijkertelt luistert en vertaalt, woord voor woord, net als een menselijke tolk.
Dit is hoe ze het deden, met behulp van enkele eenvoudige analogieën:
1. De "Stop-en-Ga"-strategie (AlignAtt)
Om Canary in real-time te laten werken, heeft het team niet de hele vertaler vanaf nul opnieuw getraind. In plaats daarvan gaven ze Canary een nieuwe set regels genaamd AlignAtt.
Beschouw de hersenen van Canary als een paar "aandachtsbrillen". Wanneer de vertaler een nieuw stuk audio hoort, kijkt hij naar de zin die hij aan het opbouwen is. De AlignAtt-regel zegt: "Zodra je een geluid hoort dat overeenkomt met een specifiek punt in de audio die je net hebt gehoord, stop dan met het opschrijven van de rest van de zin."
Het is als een spelletje "telefoonspelletje" waarbij je alleen de woorden doorgeeft waarvan je 100% zeker bent. Als de vertaler een woord begint te raden op basis van audio die nog niet volledig is gearriveerd, kapt het systeem die gok af. Dit voorkomt dat de vertaler "hallucineert" (dingen verzint) of zichzelf herhaalt.
2. De "Zakformaat" Krachtpatser
Een van de coolste dingen aan dit project is de grootte van de vertaler. De meeste hoogwaardige vertalers zijn als enorme supercomputers die een heel datacentrum nodig hebben om te draaien. Canary is echter een 1-miljard parameter model.
De auteurs noemen dit een "Pocket Offline Model." Stel je voor dat je een vertaler ter grootte van een smartphone-app in je zak past. Het is klein genoeg om op een gewone telefoon te draaien zonder dat er gegevens naar een gigantische server in de cloud gestuurd hoeven te worden. Dit betekent dat je het zelfs kunt gebruiken als je geen internetverbinding hebt, en het zou veel sneller zijn omdat het niet hoeft te wachten tot een signaal heen en weer gereisd is.
3. De "Noise-Canceling" Koptelefoon
Audio in de echte wereld is rommelig. Mensen hoesten, auto's toeteren en kamers galmen na. Om dit op te vangen, voegde het team een "ruisfilter" toe (genaamd Silero VAD). Beschouw dit als een paar hoogtechnologische noise-canceling koptelefoons voor de vertaler. Het negeert de stilte en het achtergrondgeluid, en let alleen op wanneer er daadwerkelijk een menselijke stem spreekt. Dit voorkomt dat de vertaler in de war raakt of probeert de klap van een dichtslaande deur te vertalen.
4. De Race tegen de Klok (De Resultaten)
Het team testte hun nieuwe systeem in een gesimuleerde race tegen andere topvertalers (de "baselines") voor drie taalparen: Tsjechisch naar Engels, Engels naar Duits en Engels naar Italiaans.
- De Opstelling: Ze testten twee scenario's: een "High Latency" race (waarbij de vertaler wat langer kan wachten voor meer nauwkeurigheid) en een "Low Latency" race (waarbij snelheid alles is).
- De Uitkomst:
- Snelheid vs. Kwaliteit: Hun systeem was een kampioen in beide categorieën. In de "High Latency" race vertaalde het aanzienlijk beter dan de beste bestaande systemen van de organisatoren (met een verbetering van 4 tot 8 punten).
- De Concurrentie Verslaan: Zelfs in de "Low Latency" race (waar het super snel moest zijn), hield het stand en versloeg het vaak de voorheen beste systemen.
- Het "Sliding Window": Ze vergeleken hun methode ook met een andere manier om offline modellen real-time te laten werken (genaamd "Sliding Window", wat is als het constant opnieuw lezen van een paragraaf om fouten te herstellen). Hun "Stop-en-Ga" (AlignAtt) methode was veel beter en produceerde kwalitatief hogere vertalingen met minder vertraging.
5. Wat ze leerden (en wat ze niet leerden)
Het team concludeerde dat het een winnende strategie is om een krachtige, offline vertaler een "real-time regelboek" te geven. Het is simpel, effectief en vereist geen dure training.
Ze liepen echter ook tegen een kleine hindernis aan. Ze probeerden de vertaler "contextuele aanwijzingen" te geven (zoals vertellen: "Dit is een politieke bijeenkomst, dus gebruik formele woorden"), maar toen ze probeerden deze aanwijzingen te combineren met hun nieuwe "Stop-en-Ga" regels, raakte de vertaler in de war en stopte met werken. Ze vermoeden dat dit komt omdat de vertaler niet genoeg voorbeelden van deze specifieke combinatie heeft gekregen tijdens de training.
De Kernboodschap
Het CUNI-team is erin geslaagd om een "wacht-tot-het-einde" vertaler te veranderen in een "luister-en-vertaal-terwijl-je-gaat" vertaler die in je zak past. Ze hebben bewezen dat je geen gigantische supercomputer nodig hebt voor hoogwaardige simultaanvertaling; een klein, slim model met de juiste regels kan hetzelfde werk doen, of zelfs beter dan de grote systemen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.