← Nieuwste papers
💬 NLP

Liberating LLM Capabilities in Full-Duplex Speech Models

Dit artikel introduceert Listen-Write-Speak (LWS), een nieuw tekst-eerst driekanaals paradigma dat full-duplex spraakmodellen in staat stelt om simultaan te luisteren, zichtbare gestructureerde tekst te schrijven en in real-time te spreken met behulp van een gedeeld autoregressief LLM zonder architecturale wijzigingen, waardoor tekst-native capaciteiten zoals codegeneratie en gestructureerd redeneren worden ontsloten terwijl de conversationele responsiviteit behouden blijft.

Oorspronkelijke auteurs: Luoyuan Zhang, Bokai Xu, Junbo Cui, Weiyue Sun, Yingjing Xu, Hanyu Liu, Yuan Yao

Gepubliceerd 2026-06-09
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Luoyuan Zhang, Bokai Xu, Junbo Cui, Weiyue Sun, Yingjing Xu, Hanyu Liu, Yuan Yao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je in een vergadering zit met een briljante collega die ook een meesterlijke typist is. Momenteel zijn de meeste AI-spraakassistenten als collega's die alleen kunnen spreken. Als je hen vraagt om een complex computerprogramma te schrijven of een gedetailleerde grafiek te tekenen, moeten ze dit hardop beschrijven: "Oké, begin met een functie, definieer dan een variabele..." Dit is traag, moeilijk te volgen en je moet het zelf opschrijven als je het wilt bewaren.

Het artikel introduceert een nieuwe manier voor AI om te communiceren, genaamd Listen-Write-Speak (LWS). Denk aan deze nieuwe AI als een collega die drie dingen tegelijk doet, perfect gesynchroniseerd:

  1. Luisteren: Ze horen je in realtime praten, zelfs terwijl ze tegen je praten.
  2. Schrijven: Terwijl ze luisteren en nadenken, typen ze simultaan hun gedachten, code of gestructureerde aantekeningen op een scherm direct voor je neus.
  3. Spreken: Tegelijkertijd spreken ze een vereenvoudigde, gesproken samenvatting uit van wat ze aan het typen zijn.

De "Driebaansnelweg" Analogie

De auteurs beschrijven dit als een tri-channel paradigma. Stel je een driebaansnelweg voor waar het verkeer in één richting stroomt (de tijdlijn van het gesprek):

  • Baan 1 (Luisteren): Deze baan staat altijd open. De AI luistert nooit naar je stoppen, zelfs niet wanneer de AI zelf spreekt. Dit maakt "full-duplex" interactie mogelijk, wat betekent dat je de AI kunt onderbreken zonder dat deze in de war raakt of stopt met verwerken.
  • Baan 2 (Zichtbaar Schrijven): Dit is de "denkbaan". In plaats van de gedachten verborgen te houden in een zwarte doos, typt de AI ze op een scherm. Als je om een Python-script vraagt, verschijnt de code direct op het scherm. Als je om een vergadering-samenvatting vraagt, verschijnt er een nette tabel. Dit is de "first-class" output, wat betekent dat dit de primaire manier is waarop de AI zijn werk aan jou laat zien.
  • Baan 3 (Spreken): Deze baan draagt de stem. De AI leest een vereenvoudigde, gesproken versie voor van wat hij typt, zodat je het antwoord kunt horen terwijl je de details leest.

Hoe het werkt (De Magische Truc)

Het artikel beweert dat hiervoor geen nieuw, ingewikkeld robotbrein nodig is. In plaats daarvan hebben ze een slimme Token Schema gebruikt.

Beschouw de interne taal van de AI als een set Lego-blokjes. Meestal bouwen deze blokjes alleen spraak. De onderzoekers hebben speciale "instructie-blokjes" uitgevonden (zoals <unit>, <ls_cogn> en <speak>) die de AI vertellen: "Op dit moment bevind je je in een tijdblok van 1 seconde. In dit blok moet je deze audio beluisteren, deze tekst typen en deze zin uitspreken."

Door het gesprek te organiseren in deze kleine, 1-seconde durende "tijdblokken" (Units), kan de AI alle drie de taken uitvoeren zonder in de knoop te raken. Het is als een dirigent die een orkest vertelt: "Voor de volgende seconde speelt de viool, speelt de fluit en tikt de percussionist op de trommel, allemaal op exact hetzelfde moment."

Wat ze vonden

De onderzoekers hebben deze nieuwe AI getest tegenover andere spraakmodellen en ontdekten:

  • Het is een betere multitasker: In tests die maten hoe goed de AI begrijpt en redeneert terwijl hij spreekt, scoorde LWS hoger dan modellen die alleen spreken of eerst denken voordat ze spreken.
  • Het is consistent: De AI zei niet één ding en schreef iets anders. In 92,6% van de gevallen kwam wat de AI sprak exact overeen met wat hij schreef.
  • Het gaat goed om met onderbrekingen: Omdat de AI blijft luisteren terwijl hij spreekt, kan hij een onderbreking vloeiend afhandelen zonder vast te lopen of te wachten tot jij klaar bent.

De Kern van het Verhaal

Het artikel betoogt dat door de AI te laten schrijven wat hij denkt terwijl hij spreekt, we het beste van beide werelden krijgen: de snelheid en het natuurlijke gevoel van een gesproken gesprek, gecombineerd met de precisie en structuur van geschreven tekst (zoals code of datatabellen). Het transformeert de AI van een "praatkop" naar een "collaboratieve partner" die zijn werk gaandeweg laat zien.

Opmerking over beperkingen: De auteurs geven toe dat omdat de AI dit alles in realtime moet doen (elke seconde), het misschien niet de beste optie is voor extreem lange, complexe plannings-taken die uren diep nadenken vereisen voordat er gesproken wordt. Ook accepteert het momenteel alleen spraak als input, geen afbeeldingen of bestanden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →