← Nieuwste papers
💬 NLP

NAVER LABS Europe Submission to the Instruction-following 2026 Short Track

De IWSLT 2026-inzending van NAVER LABS Europe behaalde een gedeelde eerste plaats in de instruction-following short track door de multi-stage ASR, ST en SQA pipeline te verbeteren met de SpeechMapper projector en een synthetische wetenschappelijke dataset (fakACL), wat superieure prestaties mogelijk maakt met een compactere architectuur en een zwakkere LLM-backbone.

Oorspronkelijke auteurs: Marcely Zanon Boito, Hemant Yadav, Jean-Luc Meunier, Ioan Calapodescu

Gepubliceerd 2026-07-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Marcely Zanon Boito, Hemant Yadav, Jean-Luc Meunier, Ioan Calapodescu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar ietwat vergeetachtige robotassistent probeert te leren hoe hij naar een mens moet luisteren, wat diegene heeft gezegd moet begrijpen en vervolgens vragen daarover moet beantwoorden—en dat alles in verschillende talen. Dit is precies wat het team van NAVER LABS Europe deed voor een grote wedstrijd genaamd IWSDT 2026.

Hier is een overzicht van hun werk, eenvoudig uitgelegd met enkele analogieën.

Het Doel: De "Universele Vertaler" Uitdaging

Het team nam deel aan een wedstrijd waarbij ze een systeem moesten bouwen dat kon:

  1. Luisteren naar Engelse spraak en dit opschrijven (zoals een hofstenoograaf).
  2. Vertalen die spraak naar het Chinees, Italiaans of Duits.
  3. Vragen beantwoorden over wat er gehoord is, in diezelfde talen.

Beschouw dit als het trainen van een robot om in een collegezaal te zitten, aantekeningen te maken van de lezing, de lezing te vertalen voor een vriend, en vervolgens de vriend te ondervragen over de inhoud, zonder ooit de tekst op een scherm te zien—alleen door de stem te horen.

Het Probleem: Een Kleiner Brein, Een Grotere Taak

Vorig jaar won dit team de wedstrijd met een enorm "brein" (een Large Language Model of LLM). Dit jaar werden ze gedwongen een veel kleiner, zwakker brein te gebruiken (een model met 4 miljard parameters).

De Analogie: Stel je voor dat de robot van vorig jaar een doctoraat in de taalkunde had. Dit jaar moesten ze een zeer bekwame middelbare scholier gebruiken. De uitdaging was om deze "scholier" net zo goed te laten presteren als de "doctorandus", zonder extra tijd of middelen te geven.

De Oplossing: Twee Gespecialiseerde Hulpmiddelen

Om dit kleinere brein te laten werken, hebben ze niet simpelweg data in het model gepompt. Ze bouwden twee gespecialiseerde hulpmiddelen om het brein te helpen leren, zoals een tutor en een vertaler die samenwerken.

1. De "Oor-naar-Brein" Verbinding (SpeechMapper)

Het brein van de robot is ontworpen om tekst te lezen, niet om geluid te horen. Normaal gesproken heb je een zware, complexe machine nodig om geluidsgolven om te zetten in tekst zodat het brein het kan begrijpen.

  • Wat ze deden: Ze vervingen de oude, zware machine door een nieuw, lichter hulpmiddel genaamd SpeechMapper.
  • De Analogie: Stel je voor dat de oude methode was als het proberen te vertalen van een liedje door elke enkele noot op een blad muziek te schrijven voordat je het zingt. Het was traag en log. De nieuwe SpeechMapper is als een "muzikaal oor" dat direct de melodie herkent en de juiste toon direct in het oor van de zanger neuriet. Het leert om geluid om te zetten in "gedachten" door alleen via luipoefoefeningen, waardoor het veel sneller is en minder aanspraak maakt op het geheugen van de computer.

2. De "Nep-Lezing" Generator (fakACL)

Het team merkte op dat de robot goed was in het lezen van boeken, maar moeite had met de specifieke stijl van de test: wetenschappelijke presentaties (zoals bij een computerwetenschappelijk congres).

  • Wat ze deden: Ze creëerden een nep-dataset genaamd fakACL. Ze gebruikten het eigen brein van de robot om nep wetenschappelijke toespraken te schrijven, en gebruikten vervolgens een stem-synthesizer om deze toespraken in audio om te zetten.
  • De Analogie: Het is als een student die geweldig is in het bestuderen van geschiedenisboeken, maar bijna een toets krijgt over moderne natuurkunde. In plaats van alleen maar te hopen dat hij slaagt, genereert de docent (het team) een hele reeks nep natuurkundelectures zodat de student erop kan oefenen. Dit overbrugt de kloof tussen wat de student weet en wat de test vraagt.

Het Trainingsproces: Parallel Leren

Het team heeft niet alles tegelijk getraind. Ze gebruikten een driestaps-pipeline:

  1. Stap A: Leer het "Oor" (SpeechMapper) om geluid te begrijpen met behulp van echte spraakdata.
  2. Stap B: Leer het "Brein" (de LLM) om tekst te begrijpen en vragen te beantwoorden met behulp van tekstdata.
  3. Stap C: Breng ze samen. Ze combineerden het getrainde "Oor" en het getrainde "Brein" en gaven ze een laatste, korte oefensessie waarbij ze moesten luisteren en spreken op hetzelfde moment.

De Resultaten: Presteren Boven Hun Gewicht In

Ondanks het gebruik van een veel kleiner "brein" dan vorig jaar, presteerde hun nieuwe systeem uitzonderlijk goed.

  • De Uitkomst: Ze deelden de eerste plaats in de algemene ranglijst.
  • De Verrassing: Hun systeem was in sommige gebieden zelfs beter dan het winnende systeem van vorig jaar, ook al was het kleiner en gebruikte het minder rekenkracht.

Waarom het Er Toe Doet (Volgens het Paper)

Het paper stelt dat door een slimmere manier te gebruiken om geluid aan tekst te koppelen (SpeechMapper) en door te oefenen op realistische, nep data (fakACL), zij bewezen hebben dat je geen gigantisch, duur computerbrein nodig hebt om een geweldige stemassistent te bouwen. Je hebt alleen de juiste trainingsmethoden nodig.

Kortom: Ze namen een kleinere, goedkopere robot, gaven het een beter "oor", lieten het oefenen op nep lezingen, en het eindigde met het winnen van de race tegen de reuzen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →