BanglaVowelDataset: True AC and Synthetic BC Bangla Vowel Datasets in Speech Information System
Dit artikel introduceert de BanglaVowelDataset, bestaande uit 120 opgenomen via luchtgeleiding (AC) en 120 synthetische via botgeleiding (BC) opgenomen Bengaalse klinkers van tien sprekers, om het gebrek aan dergelijke middelen aan te pakken en onderzoek naar ruisbestendige spraakverwerking, herkenning en sprekersidentificatie te faciliteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de wereld van spraaktechnologie leren computers voortdurend om te luisteren. Ze worden getraind op enorme bibliotheken van opgenomen stemmen om woorden te herkennen, sprekers te identificeren of commando's te begrijpen. De meeste van deze bibliotheken zijn echter gebouwd uit geluiden die via de lucht zijn opgevangen. Wanneer we spreken, reizen geluidsgolven door de lucht, raken een microfoon en worden omgezet in digitale gegevens. Deze methode, bekend als luchtgeleiding (air-conduction), is de standaard voor bijna alle stemassistenten en transcriptiediensten. Maar er is een andere manier waarop geluid onze oren en opnameapparaten bereikt: via de botten van onze schedel. Wanneer we spreken, laten onze stembanden onze schedelbotten trillen, en deze trillingen reizen direct naar het binnenoor en kunnen worden opgevangen door sensoren die op de huid zijn geplaatst. Dit is botgeleiding (bone-conduction). Terwijl door lucht geleid geluid gemakkelijk wordt overstemd door het gezoem van verkeer of het geroezemoes van een menigte, blijft door bot geleid geluid opmerkelijk helder omdat het de luidruchtige lucht omzeilt. Decennialang hebben onderzoekers geprobeerd computers te bouwen die deze op bot gebaseerde spraak kunnen begrijpen, grotendeels omdat de benodigde gegevens voor veel talen simpelweg niet bestonden.
Een team van onderzoekers van universiteiten uit Bangladesh en Japan heeft nu een aanzienlijke kloof in dit veld opgevuld door de eerste speciale collectie klinkers in de Bengalse taal te creëren, vastgelegd via zowel lucht als bot. Het Bengalse alfabet bevat twaalf verschillende klinkerklanken, een complexiteit die de taal rijk maakt maar moeilijk voor machines om te analyseren, vooral wanneer achtergrondruis interfereert. Tot aan dit werk bestond er geen dataset die zowel de traditionele via de lucht opgenomen versies van deze klanken als hun via het bot geleide tegenhangers voor vergelijking bood. De onderzoekers zetten zich erop gericht om deze klanken op te nemen van tien moedertaalsprekers — vijf mannen en vijf vrouwen — in een stille, geluidsdichte kamer. Ze gebruikten hoogwaardige microfoons om de via de lucht geleide klinkers op te nemen, waarbij ze ervoor zorgden dat elke opname lang genoeg was voor analyse, variërend van 600 tot 780 milliseconden. Om te garanderen dat de gegevens schoon waren, hebben ze de stille begin- en eindstukken van elke opname zorgvuldig weggeknipt, waardoor alleen het pure, stemgegeven deel van het geluid overbleef.
De uitdaging werd vervolgens hoe de via het bot geleide gegevens te verkrijgen zonder dat elke deelnemer gespecialiseerde, zeldzame botgeleidingsmicrofoons hoefde te dragen, die moeilijk te vinden en te gebruiken zijn in standaard onderzoeksinstellingen. In plaats van de bottrillingen direct op te nemen, gebruikte het team een geavanceerd computermodel om deze te simuleren. Ze namen de schone, via de lucht opgenomen klinkers en stuurden deze door een digitaal filter dat nabootst hoe de menselijke schedel geluid verandert. Dit proces verwijderde effectief de hoogfrequente details die de lucht draagt maar die botten filteren, waardoor een synthetische versie ontstond van hoe het geluid eruit zou hebben gezien als het door de schedel was opgenomen. Het resultaat was een gekoppelde dataset: 120 echte via de lucht geleide klinkers en 120 synthetische via het bot geleide klinkers, perfect afgestemd op dezelfde sprekers en dezelfde twaalf klinkers.
De onderzoekers hebben deze enorme collectie vervolgens georganiseerd in een gestructureerde bibliotheek, waarbij de gegevens zijn onderverdeeld in verschillende stadia van verwerking om andere wetenschappers te helpen hun eigen theorieën te testen. Ze boden de ruwe opnames, de uitgeknipte versies en de computergesimuleerde botgeluiden aan, allemaal voorzien van nauwkeurige details over het geslacht van de spreker en de specifieke gesproken klinker. Om te bewijzen dat hun simulatie accuraat was, vergeleken ze de wiskundige eigenschappen van de echte luchtgeluiden met de synthetische botgeluiden. Ze ontdekten dat de synthetische botgeluiden zich precies gedroegen zoals verwacht: ze vertoonden een breder frequentiebereik en een specifieke wiskundige signatuur die hen onderscheidt van luchtgeluiden. Dit bevestigde dat hun computermodel succesvol het unieke akoestische profiel van via het bot geleide spraak had gerecreëerd.
Deze dataset is nu beschikbaar voor de wereldwijde onderzoeksgemeenschap om te gebruiken. Het biedt een unieke kans om te testen hoe goed spraakherkenningssystemen met ruis om kunnen gaan. Omdat via de lucht geleide spraak gemakkelijk wordt aangetast door achtergrondruis, terwijl via het bot geleide spraak dat niet is, kunnen onderzoekers deze gekoppelde gegevens gebruiken om systemen te bouwen die tussen de twee schakelen of ze combineren om spraak te begrijpen in chaotische omgevingen zoals drukke straten of overvolle kamers. Het team heeft ook de computercode die ze gebruikten om deze geluiden te genereren openbaar gemaakt, zodat anderen hun methoden kunnen verifiëren of dezelfde technieken op andere talen kunnen toepassen. Door de eerste uitgebreide blik op Bengalse klinkers via zowel lucht als bot te bieden, opent dit werk de deur naar meer robuuste, ruisbestendige spraaktechnologie die overal betrouwbaar kan functioneren, en niet alleen in een stille studio.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.