← Nieuwste papers
💻 computer science

AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach

Het artikel introduceert AgenticASR, een agentisch framework dat realtime spraakherkenning verfijnt door transcripties iteratief te herzien om disfluënties te verwijderen en zelfcorrecties op te lossen terwijl de uiteindelijke intentie van de spreker behouden blijft, gevalideerd door een nieuwe tweetalige benchmark en superieure prestaties over meerdere ASR-frontends heen.

Oorspronkelijke auteurs: Zixuan Jiang, Binghao Qiang, Jiaying Chi, Yanqiao Zhu, Kai Yu, Xie Chen

Gepubliceerd 2026-07-31
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zixuan Jiang, Binghao Qiang, Jiaying Chi, Yanqiao Zhu, Kai Yu, Xie Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je het verhaal van een vriend probeert op te schrijven, maar je vriend praat precies zoals een mens: hij struikelt over woorden, zegt "ehm" en "uh", begint een zin, beseft dat hij een fout heeft gemaakt, en corrigeert zichzelf dan halverwege. Als je alles opschrijft wat hij zegt, krijg je een rommelig, verwarrend transcript vol met mislukte starts en herhalingen. Dit is wat traditionele spraak-naar-teksttechnologie doet; het is een zeer letterlijke kopiist die de klank van spraak vastlegt, maar niet de bedoeling van de boodschap. Aan de andere kant proberen sommige nieuwere tools de tekst op te schonen, maar ze wachten meestal tot de persoon volledig klaar is met spreken voordat ze beginnen met bewerken. Dit creëert een probleem: als je vriend zegt: "Ontmoet me bij Mary's huis... wacht, nee, Marie's huis," kan een tool die tot het einde wacht al "Mary" hebben opgeschreven en kan niet teruggaan om het te herstellen zonder opnieuw te beginnen. Het doel van dit onderzoek is om een systeem te bouwen dat werkt als een supersnelle, aandachtige redacteur die in realtime meeluistert, fouten oppikt terwijl ze gebeuren, en de tekst direct herschrijft om schoon en leesbaar te zijn, terwijl de persoon nog aan het praten is.

Het artikel introduceert een nieuwe aanpak genaamd AgenticASR (Agentic Speech Recognition). Denk aan een tweepersoons-team dat werkt aan een live uitzending. De eerste persoon is de "Scribe" (de ASR front-end), die snel opschrijft wat hij hoort, inclusief alle hakkelingen en "ums". De tweede persoon is de "Refiner" (het Agentic deel), een slimme redacteur die constant naar de laatste paar zinnen van de Scribe kijkt. Zodra de Scribe een tekstblok typt, bekijkt de Refiner het, fixt de rommel en vervangt de slordige versie door een schone versie.

Hier is de magische truc: de Refiner kijkt niet alleen naar de huidige zin; het houdt een klein "venster" van de laatste paar tekstblokken in zijn geheugen. Als de Scribe "Ontmoet Mary" typt, en het volgende blok komt binnen als "Wacht, Marie," ziet de Refiner de connectie onmiddellijk. Het realiseert zich dat het eerste blok een fout was, verwijdert "Mary" en werkt de hele zin bij naar "Ontmoet Marie" voordat de spreker zelfs de volgende gedachte heeft afgemaakt. Dit stelt het systeem in staat om zelfcorrecties en uitleg on the fly af te handelen, in plaats van te wachten tot de spraak stopt.

Om te testen of dit echt werkt, bouwden de auteurs een speciale speeltuin genaamd AASR-Bench. Stel je een enorme hindernisbaan voor met 917 verschillende scenario's, variërend van informele gesprekken en klantenservicegesprekken tot technische programmeersessies en zoekopdrachten via spraak. Ze creëerden 6.637 kleine, specifieke vragen (rubrieken) om de resultaten te beoordelen, waarbij ze controleerden op zaken als: "Heeft hij de 'ums' verwijderd?", "Heeft hij de spelling van de naam gecorrigeerd?" en "Heeft hij de uiteindelijke betekenis correct behouden?". Ze keken niet alleen naar hoeveel woorden er goed waren; ze keken naar hoe leesbaar en bruikbaar de tekst was.

De resultaten suggeries dat deze "Agentic" aanpak een belangrijke stap voorwaarts is. Wanneer ze AgenticASR testten tegen andere systemen, produceerde het consequent schonere, nauwkeurigere tekst. Bijvoorbeeld, bij het gebruik van een specifieke opstelling (Qwen3-ASR-1.7B met hun Refiner), scoorde het systeem 79,95 op hun algemene benchmark, waarmee het de op één na beste methoden met een comfortabele marge versloeg. De studie vond dat het systeem het beste werkt wanneer het naar een "venster" van ongeveer drie tekstblokken tegelijk kijkt. Dit venster was de ideale balans: het was groot genoeg om correcties op te vangen die enkele seconden geleden plaatsvonden (zoals de overgang van "Mary" naar "Marie"), maar klein genoeg om het systeem snel te houden.

De auteurs ontdekten ook dat de grootte van de "Refiner" ertoe doet. Een grotere, slimmere redacteur (een model met 4 miljard parameters) deed een iets beter werk bij het oplossen van complexe zinnen, maar had ook iets langer nodig om na te denken. Echter, zelfs de kleinere, snellere modellen waren veel beter dan systemen die simpelweg wachtten tot het einde om te bewerken. Het artikel benadrukt dat dit systeem niet perfect is; als de initiële Scribe een woord volledig mist, kan de Refiner het niet magisch weer tevoorschijn toveren. Maar voor de rommelige, echte wereld zaken waar we daadwerkelijk mee te maken hebben — vulwoorden, hakkelingen en correcties midden in een zin — suggereert AgenticASR een praktische manier om direct schone, leesbare tekst te krijgen, waardoor de chaotische stroom van menselijke spraak wordt omgezet in een gepolijst verhaal terwijl het gebeurt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →