MOSS Transcribe Diarize Technical Report
MOSS Transcribe Diarize is een verenigd multimodaal groot taalmodel dat de state-of-the-art sprekersgeattribueerde, tijdgestempelde transcriptie bereikt door gebruik te maken van een contextvenster van 128k en end-to-end training op uitgebreide real-world data om de beperkingen van bestaande systemen te overwinnen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je in een druk koffietentje zit en probeert precies op te schrijven wat drie verschillende vrienden tegen elkaar zeggen. Je moet niet alleen de woorden weten, maar ook wie ze zei en precies wanneer ze spraken. Dit is de uitdaging van "Speaker-Attributed, Time-Stamped Transcription" (SATS). Het is een superkracht voor computers: het verandert een rommelige audio-opname in een schoon, georganiseerd script waar elke zin is voorzien van een spreker en een exacte tijdstempel. Dit is ongelooflijk nuttig voor zaken als het transcriberen van zakelijke vergaderingen, het analyseren van klantenservicegesprekken of het helpen van mensen met een gehoorbeperking om complexe gesprekken te volgen.
Tot nu toe probeerden computers dit meestal in twee aparte stappen op te lossen. Eerst luisterde een "spraak-naar-tekst" robot en typte de woorden uit. Daarna probeerde een andere "spreker-detective" robot uit te zoeken wie wat zei. Het probleem is dat deze twee robots vaak niet met elkaar communiceren. Als de eerste robot een kleine fout maakt, raakt de tweede robot in de war, en wordt het uiteindelijke script een rommelige bende. Het is alsof je een puzzel probeert te leggen waarbij de helft van de stukjes uit een andere doos komt. Dit nieuwe paper introduceert een nieuw soort computerbrein dat beide taken tegelijkert uitoert, in één enkele, vloeiende beweging.
De One-Brain Solution
Het team achter dit project, OpenMOSS, heeft een nieuw model gebouwd genaamd MOSS Transcribe Diarize. Denk aan dit model als een superintelligente, veelzijdige dirigent. In plaats van een apart orkest in te huren voor de woorden en een apart orkest voor de stemmen, houdt deze dirigent de volledige partituur in zijn hoofd en leidt hij de hele uitvoering in één keer.
In het verleden hadden computers moeite met lange gesprekken. Als een vergadering een uur duurde, moesten de oude systemen de audio opknippen in kleine stukjes van 30 seconden, elk stukje oplossen en vervolgens proberen ze weer aan elkaar te plakken. Dit leidde er vaak toe dat de computer vergat wie "Spreker A" was na de onderbreking, of het overzicht over de flow van het gesprek verloor. MOSS Transcribe Diarize verandert de regels door een enorme "geheugenvenster" van 128k tokens te hebben. Om dit in perspectief te plaatsen: dit stelt het model in staat om tot wel 90 minuten aan audio in één ononderbroken passage te beluisteren en te begrijpen. Het hoeft de audio niet op te knippen; het hoort het hele verhaal van begin tot eind, waardoor het een helder mentaal beeld behoudt van wie wie is, zelfs als iemand al een tijdje niet meer heeft gesproken.
Hoe het werkt (De Magische Truc)
Het model is een "multimodale groot taalmodel", wat een chique manier is om te zeggen dat het tegelijkertijd tekst kan lezen en naar audio kan luisteren. Hier is de truc:
- De Oren: Het neemt de ruwe geluidsgolven en zet deze om in een digitaal formaat.
- De Vertaler: Het gebruikt een speciale "projectie" om die geluidsgolven om te zetten in een taal die het tekstlezende deel van het brein begrijpt.
- De Output: In plaats van alleen woorden uit te spuwen, geeft het een script uit dat er zo uitziet:
[0.11] [S01] Goedemorgen! [1.03] [S02] Goedemorgen, jongens!. Het geeft je de spreker-ID (S01, S02), de exacte tijd waarop ze begonnen te spreken, en de woorden die ze zeiden, allemaal in één enkele forward pass.
Om dit model te trainen, gebruikten de onderzoekers niet alleen schone opnames van studiokwaliteit. Ze voerden het een enorme dieet van "echte wilde" data—opnames van het internet die achtergrondgeluid, overlappende stemmen, verschillende accenten en mensen die door elkaar heen praten bevatten. Ze creëerden ook "gesimuleerde" gesprekken waarbij ze verschillende stemmen mixten en matchen om het model te leren hoe het lastige situaties moet afhandelen, zoals wanneer twee mensen op exact hetzelfde moment praten.
Wat ze vonden
Het team heeft hun nieuwe model getest tegenover enkele van de grootste, meest dure commerciële systemen die momenteel beschikbaar zijn (zoals die van Doubao, ElevenLabs en diverse Google-modellen). Ze gebruikten drie verschillende soorten tests:
- AISHELL-4: Lange, real-world vergaderopnames (tot ongeveer 40 minuten).
- Podcast: Hoogwaardige, lange interviews met meerdere gasten.
- Films: Korte fragmenten met snelle, overlappende dialogen.
De resultaten waren indrukwekkend. In bijna elke test maakte MOSS Transcribe Diarize minder fouten dan de concurrentie.
- Nauwkeurigheid: Het kreeg de woorden vaker goed (lagere Character Error Rate).
- Identiteit: Het was veel beter in het bijhouden van wie wat zei. De onderzoekers maten dit met een metriek genaamd Δcp (het verschil tussen woordfouten en sprekerfouten). Een lager getal hier betekent dat het model niet in de war raakte over wie er sprak. MOSS Transcribe Diarize had de laagste Δcp-scores, wat betekent dat het de identiteit van de spreker consistent hield, zelfs in lange, rommelige gesprekken.
- Long-Form Capability: Terwijl sommige beroemde commerciële modellen (zoals GPT-4o en Gemini 3 Pro) simpelweg faalden bij het verwerken van de lange audiobestanden of niet in staat waren om het juiste formaat voor hen uit te voeren, verwerkte MOSS Transcribe Diarize de volledige 90 minuten aan input zonder moeite.
Waarom dit ertoe doet
Het paper suggereert dat door spraakherkenning en sprekeridentificatie te combineren in één verenigd systeem met een lang geheugen, we betrouwbaardere transcripties kunnen krijgen. Het model bewijst dat je audio niet in stukjes hoeft te hakken om het te begrijpen; je kunt het hele gesprek in één keer beluisteren en nog steeds de details goed krijgen.
De auteurs merken er voorzichtig bij op dat hoewel hun model een belangrijke stap voorwaarts is, het geen toverstaf is die elk probleem perfect oplost. Ze zien nog steeds ruimte voor verbetering, zoals het bruikbaar maken van het systeem in real-time (streaming) en het ondersteunen van nog meer talen. Maar voor nu hebben ze laten zien dat een enkel, verenigd brein het werk van twee aparte robots kan doen, en dat beter, vooral wanneer het gesprek lang en ingewikkeld wordt.
De code en het model zijn nu openbaar voor iedereen om te proberen, beschikbaar op GitHub en Hugging Face, en nodigen anderen uit om te zien of zij nog betere tools kunnen bouwen op dit nieuwe fundament.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.