Pisets: A Robust Speech Recognition System for Lectures and Interviews
Dit artikel introduceert "Pisets", een robuust Russisch spraak-naar-tekst systeem ontworpen voor lezingen en interviews dat de transcriptie nauwkeurigheid verhoogt en hallucinaties vermindert in vergelijking met standaard Whisper-modellen door een drieledige architectuur te hanteren die Wav2Vec2, Audio Spectrogram Transformer en Whisper combineert met curriculum learning en geavanceerde onzekerheidsmodellering.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een lange, complexe lezing te transcriberen van een professor die snel spreekt, soms mompelt en omringd wordt door het geluid van krijt dat tegen een schoolbord tikt. Als je een standaard AI-assistent zou vragen dit op te schrijven, zou deze de woorden misschien wel goed krijgen, maar feiten verzinnen die nooit hebben plaatsgevonden (een "hallucinatie"), of hele zinnen missen omdat de assistent in de war raakt door het lawaai.
De auteurs van dit artikel hebben een systeem gebouwd genaamd "Pisets" (wat "schrijver" betekent in het Russisch) om dit probleem op te lossen. Denk bij Pisets niet aan één enkele robot, maar aan een driedimensionaal redactieteam dat samenwerkt om een perfect transcript te produceren.
Zo werkt hun "team", met behulp van eenvoudige analogieën:
1. De eerste redacteur: Het "Supergevoelige oor" (Wav2Vec2)
In een normale opstelling probeert de computer naar het hele audiobestand te luisteren tegelijk. Pisets begint met een specialist genaamd Wav2Vec2.
- De analogie: Stel je een detective voor die ongelooflijk goed is in het herkennen van wanneer iemand spreekt en wanneer er stilte is. In tegen tegenstelling tot standaardtools die alleen op basis van volume raden (zoals een eenvoudige bewegingssensor), gebruikt deze detective "context" om precies te weten waar een zin begint en eindigt.
- De truc: Het team heeft deze detective getraind met een methode genaamd Curriculum Learning. In plaats van de detective direct de moeilijkste, luidruchtigste lezingen voor te werpen, begonnen ze met heldere, rustige opnames en voegden ze geleidelijk ruis en accenten toe. Het is als een leerling die leert autorijden: eerst op een leeg parkeerterrein, dan op rustige straten en tot slot in druk verkeer. Dit maakte de detective veel beter in het vinden van spraak in rommelige omgevingen.
2. De tweede redacteur: De "Ruisfilter" (AST)
Zodra de eerste redacteur de audio in stukken heeft gehakt, stapt de tweede specialist, de Audio Spectrogram Transformer (AST), naar voren.
- De analogie: Soms raakt de eerste redacteur enthousiast en denkt hij dat een hoestbui of het schuiven met een stoel menselijke spraak is. Deze tweede redacteur fungeert als een strikte kwaliteitscontroleur. Hij kijkt naar de geluidsgolven en zegt: "Wacht, dat is gewoon achtergrondgeluid, geen menselijke stem."
- Het resultaat: Het filtert "vals alarm" uit voordat de uiteindelijke transcriptie plaatsvindt, zodat de volgende stap geen tijd verspilt aan het opschrijven van onzin.
3. De derde redacteur: De "Meesterklerk" (Whisper)
Ten slotte gaat de opgeschoonde audio naar het Whisper-model, dat erom bekend staat zeer goed te zijn in het omzetten van spraak naar tekst.
- De analogie: Dit is de meesterklerk die daadwerkelijk de woorden typt. Omdat de vorige twee redacteurs hun werk hebben gedaan, wordt de schrijver niet afgeleid door ruis of stilte.
- Het vangnet: Het team heeft ook een "consistentiecontrole" toegevoegd. Ze vergelijken wat de Meesterklerk heeft geschreven met wat de Eerste Redacteur (de detective) heeft gehoord. Als ze aanzienlijk van mening verschillen, markeert het systeem dit als potentieel foutief. Ze gebruiken ook een speciale wiskundige truc (BIRM) om ervoor te zorgen dat de schrijver accuraat blijft, zelfs wanneer de audio lastig is.
Waarom is dit beter dan de concurrentie?
Het artikel vergelijkt Pisets met andere systemen zoals WhisperX.
- WhisperX is als een snelle typist die een standaard bewegingssensor gebruikt om spraak te vinden. Het is goed, maar kan in de war raken door ruis.
- Pisets is als diezelfde typist, maar zij werken met een team van specialisten die de audio eerst opschonen en dubbelchecken.
- Het resultaat: In tests met lange lezingen (20–40 minuten) die lawaai bevatten (zoals krijtgeluiden of muziek), maakte Pisets minder fouten en bedacht het minder nepfeiten dan de standaard systemen.
De "Onzekerheid"-functie: De "Gele Marker"
Een van de meest interessante onderdelen van Pisets is het vermogen om te zeggen: "Ik weet het niet zeker over dit deel."
- De analogie: Stel je een corrector voor die niet alleen fouten corrigeert, maar ook zinnen die hij niet zeker weet met geel markeert.
- Hoe het werkt: Het systeem berekent een "betrouwbaarheidsscore" voor elk woord. Als het systeem onzeker is (misschien omdat het geluid erg hard was of de spreker mompelde), markeert het dat woord.
- Het voordeel: Het artikel laat zien dat door slechts 5% van de woorden te markeren (de woorden waarvan het systeem het minst zeker is), ze 35% van alle fouten kunnen vangen. Dit stelt een mens in staat om snel de transcriptie te scannen en alleen de gemarkeerde delen te controleren, in plaats van het hele document van begin tot eind te lezen.
Samenvatting
Het "Pisets"-systeem is een robuust hulpmiddel ontworpen voor wetenschappers en journalisten die lange, luidruchtige opnames van lezingen en interviews willen omzetten in nauwkeurige tekst. Door de taak onder te verdelen in een detective (het vinden van spraak), een filter (het verwijderen van ruis) en een klerk (het schrijven van de tekst), en vervolgens een marker toe te voegen voor onzekere delen, hebben ze een systeem gecreëerd dat betrouwbaarder is en minder geneigd is om feiten te verzinnen dan eerdere AI-modellen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.