← Nieuwste papers
⚡ electrical engineering

Preference-ASR: A Preference-Aware Test Set for Benchmarking ASR in the Era of Speech LLMs

Dit artikel introduceert PreferenceASR, een nieuwe testset en evaluatiekader ontworpen om het vermogen van ASR-systemen te benchmarken om zich te houden aan door de gebruiker gespecificeerde outputvoorkeuren met betrekking tot normalisatie, entiteiten, disfluenties en hoofdlettergebruik, waarmee de beperkingen van traditionele benchmarks die dergelijke stilistische variaties negeren worden geadresseerd.

Oorspronkelijke auteurs: Nithin Rao Koluguri, Sasha Meister, Nikolay Karpov, Piotr Zelasko, Desh Raj, Jagadeesh Balam, Boris Ginsburg

Gepubliceerd 2026-06-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Nithin Rao Koluguri, Sasha Meister, Nikolay Karpov, Piotr Zelasko, Desh Raj, Jagadeesh Balam, Boris Ginsburg

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, nieuwe soort robot hebt die naar mensen kan luisteren en opschrijft wat ze zeggen. Dit wordt een ASR (Automatic Speech Recognition) systeem genoemd. In het verleden waren deze robots als rigide typisten: ze schreven gewoon woorden op, en als ze een fout maakten, kregen ze een slecht cijfer.

Maar nu hebben we "Speech LLMs" (Speech Large Language Models). Dit zijn als superintelligente assistenten die niet alleen luisteren, maar ook instructies kunnen opvolgen. Je kunt ze vertellen: "Schrijf dit op als een formeel rapport," of "Schrijf het exact zoals gesproken, inclusief alle 'umms' en 'ahhs'."

Het probleem? We hadden geen goede manier om te testen of ze daadwerkelijk naar die instructies luisterden.

Het Probleem: De "Eén-maat-voor-alleen"-liniaal

De auteurs van dit paper wijzen erop dat de oude tests voor deze robots kapot zijn. Het is alsof je een stuk stof probeert te meten met een liniaal waarvan de markeringen constant veranderen.

  • Inconsistente Regels: Sommige testdatasets zeggen dat getallen als woorden geschreven moeten worden ("tweeëntwintig"), terwijl andere zeggen dat je cijfers moet gebruiken ("22"). Sommige willen dat je stopwoorden ("um, uh") behoudt, terwijl andere ze willen verwijderen.
  • Het "Gum"-effect: Wanneer we deze robots beoordelen, gebruiken we meestal een standaard "normalizer" die werkt als een gigantische gum. Het wist alle vormverschillen weg (het verandert "22" in "tweeëntwintig", verwijdert hoofdletters, verwijdert "um").
  • Het Resultaat: Als een robot correct jouw instructie opvolgt om "22" te schrijven, wist de oude test dat succes weg en markeert het als fout omdat de test "tweeëntwintig" verwachtte. We beoordeelden ze op hoe goed ze je instructies negeerden, niet op hoe goed ze ze opvolgden.

De Oplossing: "Preference-ASR"

Het team heeft een nieuwe test ontwikkeld genaamd Preference-ASR. Zie dit als een gepersonaliseerd examen voor spraakrobots.

In plaats van één vaste antwoordkaart, geeft deze test de robot voor elke audiofragment een specifieke "voorkeurinstructie".

  • De Instructie: "Schrijf getallen als cijfers."
  • De Audio: Iemand die "twenty-two" zegt.
  • Het Doel: De robot moet "22" schrijven.

Ze hebben deze test gebouwd met 3.210 audiofragmenten uit zeven verschillende bronnen (zoals vergaderopnames, kwartaalcijfers en podcasts). Ze gebruikten een tweestaps-proces:

  1. LLM Sorting: Een slimme AI hielp de fragmenten in categorieën in te delen: Normalisatie (getallen/symbolen), Entiteiten (namen van personen/bedrijven), Disfluencies (stopwoorden) en Case (hoofdletters/interpunctie).
  2. Menselijke Controle: Echte mensen controleerden de antwoorden om er zeker van te zijn dat de AI geen fouten had gemaakt.

Het Nieuwe Beoordelingstool: De "Slimme Liniaal"

Om deze robots eerlijk te beoordelen, hebben ze een Preference-Aware Normalizer uitgevonden.

  • Oude Liniaal: "Het maakt me niet uit wat je te horen kreeg; ik ga alles omzetten naar kleine letters en woorden."
  • Nieuwe Slimme Liniaal: "Als de instructie zei 'gebruik cijfers', dan beoordeel ik de robot op cijfers. Als er stond 'houd de 'ums' erbij', dan beoordeel ik het op het behouden van de 'ums'."

Dit zorgt ervoor dat als een robot jouw specifieke verzoek opvolgt, deze een goed cijfer krijgt.

Wat ze vonden

Ze testten vier verschillende spraakmodellen (sommige oudere, sommige gloednieuwe "SpeechLLMs") met dit nieuwe systeem. De resultaten waren verrassend:

  1. Ranglijsten Veranderen: Een robot die op oude tests als "beste" uit de bus kwam, leek op de nieuwe tests soms de "slechtste", en vice versa. De oude tests verborgen de echte verschillen.
  2. De "Hallucinatie"-valstrik: Eén zeer slim model (Qwen3-Omni) was erg goed in het opvolgen van opmaakinstructies (zoals hoofdletters of getalstijlen). Echter, wanneer het gevraagd werd om specifieke bedrijfsnamen op te nemen, bedacht het model deze soms zelf (hallucineerde) simpelweg omdat ze in de prompt stonden, zelfs als ze niet in de audio voorkwamen. De oude tests zouden dit gemist hebben omdat ze de opmaak toch al weggumden.
  3. Training Maakt het Verschil: Eén model (Canary-Qwen) had een krachtig brein (een LLM) maar was niet getraind om naar opmaakinstructies te luisteren. Het negeerde de instructies volledig en deed gewoon zijn standaard transcriptie. Dit bewees dat het hebben van een slim brein niet genoeg is; je moet het specifiek leren om naar de voorkeuren van de gebruiker te luisteren.

De Kern van het Verhaal

Dit paper introduceert een nieuwe manier om spraakrobots te testen. Het laat zien dat de "beste" robot volledig afhangt van wat de gebruiker wil. Als je een schoon overzicht nodig hebt, is misschien een andere robot het beste. Als je een letterlijk transcript wilt met alle haperingen, wint een andere robot.

De auteurs hebben deze nieuwe testset en de "slimme liniaal"-tool aan het publiek beschikbaar gesteld, zodat iedereen betere spraakrobots kan bouwen die daadwerkelijk luisteren naar wat jij wilt, in plaats van alleen maar te gokken wat de makers van de test wilden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →