← Nieuwste papers
⚡ electrical engineering

SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios

Dit artikel introduceert SE-AGCNet, een end-to-end framework dat spraakverbetering en automatische winstregeling gezamenlijk optimaliseert om de beperkingen van conventionele discrete pipelines te overwinnen, waardoor een doelmatig luidheid wordt bereikt terwijl de spraakkwaliteit en ASR-nauwkeurigheid in vergaderscenario's worden verbeterd.

Oorspronkelijke auteurs: Jinming Zhang, Wei Rao, Xionghu Zhong, Eng Siong Chng

Gepubliceerd 2026-06-25
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jinming Zhang, Wei Rao, Xionghu Zhong, Eng Siong Chng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een vergadering leidt in een kamer waar de audiokwaliteit een beetje een puinhoop is. Sommige mensen fluisteren achterin de kamer, anderen schreeuwen aan de voorkant, en er is een constant gezoem van airconditioners en getik op toetsenborden op de achtergrond.

Traditioneel gezien was het oplossen van deze audio alsof je twee aparte werkers inhuurt die niet met elkaar praten:

  1. De Ruisreiniger (Speech Enhancement): Hun taak is om de achtergrondruis weg te poetsen. Maar omdat ze zo gefocust zijn op het verwijderen van ruis, verwijderen ze soms per ongeluk ook de zachte fluisterstemmen, waardoor deze volledig verdwijnen.
  2. De Volumeregelaar (Automatic Gain Control): Hun taak is om ervoor te zorgen dat iedereen op hetzelfde volume wordt gehoord. Maar als ze hun werk doen voordat de Ruisreiniger aan de slag gaat, draaien ze misschien het volume van de achtergrondruis omhoog, waardoor de puinhoop alleen maar erger wordt. Als ze het de Ruisreiniger doen, versterken ze misschien de delen die de Ruisreiniger per ongeluk heeft verwijderd.

Het artikel introduceert een nieuwe oplossing genaamd SE-AGCNet. Denk hierbij niet aan twee aparte werkers, maar aan een enkele, hoogopgeleide dirigent die beide taken gelijktijdig beheert.

Hoe het werkt: De "Joint Training" aanpak

In plaats van ruisonderdrukking en volumeregeling als afzonderlijke stappen te behandelen, leert SE-AGCNet de computer om beide taken tegelijkertijd uit te voeren.

  • De Synergie: Het systeem leert een speciale truc: het vertelt de "Ruisreiniger" om voorzichtig te zijn met de zachte stemmen, wetende dat de "Volumeregelaar" deze later toch nog zal versterken. Dit voorkomt dat de zachte sprekers worden gewist.
  • Het Resultaat: Het systeem verwijdert de achtergrondruis terwijl de zachte spraak intact blijft, en brengt vervolgens het volume perfect in balans zodat iedereen klinkt alsof ze vlak naast de microfoon zitten.

De Trainingsdata: "De Simulatiefabriek"

Een van de grootste hindernissen bij het bouwen van dit systeem was dat er geen bestaande bibliotheek van audiodata was die zowel ruizige spraak áls extreem variërende volumes liet zien (wat gebruikelijk is in echte vergaderingen).

Om dit op te lossen, hebben de auteurs een data-simulatiepipeline gebouwd genaamd SE-AGC-DataGen.

  • De Analogie: Stel je een geluidstechnicus in een laboratorium voor die zuivere opnames van sprekende mensen neemt, deze mengt met realistische vergadergeluiden (zoals ventilatoren en toetsenborden), en vervolgens kunstmatig sommige mensen heel zacht en anderen juist heel hard laat klinken. Hij doet dit duizenden keren om een "oefengym" te creëren voor de AI.
  • Het Doel: Dit stelt de AI in staat om te oefenen met exact de chaos die te vinden is in echte vergaderingen, zonder dat er eerst duizenden uren aan werkelijke, rommelige vergaderingen opgenomen hoeven te worden.

Hoe ze succes hebben gemeten: De "Luidheid-liniaal"

De auteurs hebben niet alleen geluisterd om te zien of het goed klonk; ze gebruikten een nieuwe, gestandaardiseerde manier om "luidheid" te meten die meer lijkt op hoe menselijke oren echt werken.

  • De Oude Manier: Het meten van volume als een simpele thermometer (RMS), wat misleidend kan zijn.
  • De Nieuwe Manier: Het gebruik van LUFS (Loudness Units relative to Full Scale). Denk aan dit als een "perceptie-liniaal". Het meet hoe luid de audio voelt voor een mens, niet alleen het ruwe elektrische signaal. Ze streefden naar een specifieke "comfortzone" van -23 LUFS, wat de standaard is voor heldere, gebalanceerde spraak.

De Resultaten: Wat is er gebeurd?

Wanneer ze SE-AGCNet testten tegenover de oude "aparte werker"-methoden:

  1. Betere Helderheid: De spraak klonk helderder en de achtergrondruis werd effectiever verminderd.
  2. Perfect Volume: Het systeem slaagde erin om het volume van zachte sprekers te verhogen en dat van luide sprekers te verlagen naar de doelstelling "comfortzone", zonder de klank te vervormen.
  3. Slimere Computers: Wanneer ze de schoongemaakte audio in een spraak-naar-tekst computer (ASR) voerden, maakte de computer minder fouten. Dit is cruciaal, want als het volume te laag is of de ruis te hoog, kan de computer niet begrijpen wat er gezegd is.

Samenvattend

Het artikel presenteert SE-AGCNet, een nieuw framework dat ruisonderdrukking en volumeregeling verenigt in één slim systeem. Door ze samen te trainen, vermijdt het systeem de fouten die ontstaan bij het apart uitvoeren van deze taken. Het gebruikt een op maat gemaakte "oefengym" van gesimuleerde vergaderdata om te leren, en het bewijst dat deze gezamenlijke aanpak resulteert in duidelijkere spraak, een betere volumebalans en nauwkeurigere spraak-naar-tekst herkenning in vergaderscenario's.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →