← Nieuwste papers
⚡ electrical engineering

Multilingual Long-Form Speech Instruction Following: KIT's Submission to IWSLT 2026

De inzending van KIT voor de IWSLT 2026 Instruction Following Track presenteert een meertalig langvormige spraakinstructiesysteem dat gebruikmaakt van een data-augmentatiepipeline om meer dan 1 miljoen trainingsinstanties te genereren en een hybride decoderingsstrategie toepast die likelihood-gebaseerde herwaardering combineert met Minimum Bayes Risk om semantische degradatie tijdens langvormige inferentie te overwinnen.

Oorspronkelijke auteurs: Enes Yavuz Ugan, Maike Züfle, Yuka Ko, Supriti Sinhamahapatra, Fabian Retkowski, Seymanur Akti, Jan Niehues, Alexander Waibel

Gepubliceerd 2026-06-04
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Enes Yavuz Ugan, Maike Züfle, Yuka Ko, Supriti Sinhamahapatra, Fabian Retkowski, Seymanur Akti, Jan Niehues, Alexander Waibel

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: AI leren luisteren naar lange verhalen

Stel je voor dat je een slimme assistent hebt die heel goed is in het begrijpen van korte zinnen, zoals "Wat is het weer?" of "Vertaal dit woord." Maar als je hem vraagt om naar een lezing van 15 minuten of een lange podcast te luisteren, raakt hij in de war, vergeet hij het begin, of begint hij te hallucineren.

De onderzoekers van KIT (Karlsruhe Institute of Technology) wilden dit oplossen. Ze namen deel aan een wedstrijd genaamd IWSLW 2026, waarbij het doel was om een AI te bouwen die instructies kan opvolgen op basis van langdurige spraak (tot 15 minuten) in vier talen: Engels, Duits, Italiaans en Chinees. Ze moesten ook omgaan met een "verrassingstaak" die ze vooraf niet kenden.

Hieronder vol je hoe ze het deden, onderverdeeld in vier hoofdonderdelen.


1. Het Dataprobleem: Korte fragmenten veranderen in een marathon

De Uitdaging: De meeste AI-trainingsdata zijn als een verzameling korte spraakberichten van 15 seconden. Maar de wedstrijd vereiste dat de AI 15 minuten durende audiobestanden kon verwerken. Het is alsof je een marathonloper probeert te trainen met alleen maar 100-meter sprints.

De Oplossing: Ze bouwden een "Datafabriek" om korte clips uit te rekken tot lange verhalen.

  • De Lijm-methode: Ze namen duizenden korte audiofragmenten en plakten deze achter elkaar om lange segmenten te creëren.
  • De Vertaler: Omdat de meeste data alleen in het Engels beschikbaar was, gebruikten ze een superintelligente AI-vertaler om versies in het Duits, Italiaans en Chinees te maken.
  • De Labelmaker: Ze gebruikten AI om instructies en antwoorden te schrijven voor de nieuwe lange clips, waardoor ze effectief meer dan 1 miljoen nieuwe trainingsvoorbeelden creëerden.

Het Resultaat: Ze veranderden een bibliotheek van korte spraakberichten in een enorme bibliotheek van lange lezingen en gesprekken, klaar voor training.


2. De Trainingsstrategie: Het balanceren van het dieet

De Uitdaging: De AI moest zes verschillende taken leren:

  1. ASR: Spraak omzetten naar tekst (transcriberen).
  2. ST: Spraak vertalen naar tekst in een andere taal.
  3. SQA: Vragen beantwoorden over wat er is gehoord.
  4. SSUM: De audio samenvatten.
  5. ACHAP: De audio opdelen in hoofdstukken met titels.
  6. Surprise: Iets onbekends doen.

Sommige van deze taken hadden veel meer data dan andere (zoals een dieet dat zwaar is op broccoli maar licht op wortels). Als ze de AI willekeurig data zouden voeren, zou hij goed worden in de veelvoorkomende taken en de zeldzame taken vergeten.

De Oplossing: Ze probeerden twee manieren om de data te mengen:

  • Vast Plan: Handmatig beslissen om de AI 10% ASR, 30% Q&A, enzovoort te voeren.
  • Temperature Scaling (De "Vierkantswortel"-truc): Ze gebruikten een wiskundige formule (Temperatuur = 2) die het dieet op natuurlijke wijze balanceert. Het is als een slimme chef die je een beetje van alles geeft, maar niet toestaat dat het meest voorkomende ingrediënt de zeldzame ingrediënten overstemt.

De Ontdekking: De "Vierkantswortel"-methode werkte het best. Het hielp de AI om alle taken even goed te leren zonder in de war te raken.


3. Het Falen van de "Geheime Code" (Chain-of-Thought)

De Uitdaging: Het team probeerde een populaire truc genaamd "Chain-of-Thought". Dit is alsof je tegen de AI zegt: "Denk eerst na over wat voor taak dit is voordat je antwoordt." Ze gaven de AI speciale "tokens" (zoals geheime codes) om te zeggen: "Dit is een vertaaltaak" of "Dit is een samenvattings taak".

Het Falen: Het werkte averechts. De AI werd lui. Omdat "Samenvatten" iets vaker voorkwam en op "Transcriberen" leek, begon de AI bijna alles als "Samenvatten" te raden, zelfs wanneer het een vertaling moest zijn. Hij stopte met luisteren naar de instructies en koos simpelweg voor de weg van de minste weerstand.

De Les: Je kunt een AI niet simpelweg vertellen "wat te doen" met een simpele label als de taken te veel op elkaar lijken; de AI moet het verschil echt leren door oefening, niet alleen door een prefix.


4. De Laatste Afwerking: De "Re-Ranking" Filter

De Uitdaging: Wanneer de AI een antwoord genereert, maakt hij vaak 17 verschillende versies. Sommige zijn perfect, andere zijn onzin. Het team had een manier nodig om de beste te kiezen zonder te weten welke taak ze aan het uitvoeren waren (aangezien de "Surprise Task" onbekend was).

Het Falen van Standaardmethoden:

  • Likelihood (De "Zelfvertrouwen"-check): De AI koos het antwoord waar hij zich het meest zeker van was. Dit werkte geweldig voor Transcriberen (ASR), maar was verschrikkelijk voor Samenvatten. De AI bleef antwoorden kiezen die in kleine, afgekapte stukjes waren verdeeld omdat de wiskunde er goed uitzag, ook al ging de betekenis verloren.
  • MBR (De "Consensus"-check): Deze methode koos het antwoord dat het meest leek op alle andere antwoorden. Dit was veilig en goed voor de betekenis, maar negeerde de beste transcriptie-kandidaten.

De Winneniersstrategie (Likelihood + MBR):
Ze combineerden de twee. Denk aan een selectiecommissie:

  • Likelihood is de "Zelfverzekerde Kandidaat" die snel en duidelijk spreekt.
  • MBR is de "Veilige Kandidaat" die consistent is.
  • De Combinatie: Ze lieten de "Zelfverzekerde Kandidaat" winnen, tenzij de "Veilige Kandidaat" het er sterk mee oneens was. Dit voorkomde dat de AI afgekapte, gebroken antwoorden koos voor samenvattings-taken, terwijl de beste transcripties behouden bleven.

De Eindresultaten

Het team diende twee systemen in:

  1. Het Primaire Systeem (End-to-End): De AI luistert naar audio en geeft direct een antwoord. Het was erg goed in het begrijpen van de betekenis (vragen beantwoorden, samenvatten).
  2. Het Contrastieve Systeem (Cascaded): De AI schrijft eerst precies op wat er gezegd is (Transcriberen), en leest vervolgens die tekst om een antwoord te geven. Dit was fantastisch in het juist krijgen van de woorden (Transcriberen) en vertalen, maar iets minder goed in diep begrip.

De Verrassing: Toen de "Surprise Task" (Kwaliteitsschatting) op tafel kwam, verpletterde het systeem dat eerst de tekst opschreef (Cascaded) de concurrentie, terwijl het directe systeem volledig faalde. Dit liet zien dat het soms beter is om een complex probleem op te splitsen in stappen (Luisteren -> Schrijven -> Denken) dan om alles in één keer te proberen.

Samenvatting

Het artikel laat zien dat om AI te laten luisteren naar lange spraken, je het volgende nodig hebt:

  1. Het uitrekken van korte data naar lange data.
  2. Het balanceren van het trainingsdieet met een "vierkantswortel" wiskundige truc.
  3. Het vermijden van simpele "taaklabels" die de AI lui maken.
  4. Het combineren van zelfvertrouwen en consistentie om het beste antwoord te kiezen.

Ze hebben succesvol een systeem gebouwd dat meertalige audio van lange duur kan verwerken, en bewezen dat met de juiste data en een slim "stemmechanisme" voor antwoorden, AI eindelijk het hele verhaal kan volgen, en niet alleen de eerste zin.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →