← Nieuwste papers
💬 NLP

Tagarela - A Portuguese speech dataset from podcasts

Deze paper introduceert TAGARELA, een openbaar beschikbaar dataset van meer dan 8.972 uur podcastaudio in het Portugees die is ontworpen om de ontwikkeling van geavanceerde spraakherkennings- en tekst-naar-spraakmodellen te stimuleren.

Oorspronkelijke auteurs: Frederico Santos de Oliveira, Lucas Rafael Stefanel Gris, Alef Iury Siqueira Ferreira, Augusto Seben da Rosa, Alexandre Costa Ferro Filho, Edresson Casanova, Christopher Dane Shulby, Rafael Teixeira S
Gepubliceerd 2026-03-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Frederico Santos de Oliveira, Lucas Rafael Stefanel Gris, Alef Iury Siqueira Ferreira, Augusto Seben da Rosa, Alexandre Costa Ferro Filho, Edresson Casanova, Christopher Dane Shulby, Rafael Teixeira Sousa, Diogo Fernandes Costa Silva, Anderson da Silva Soares, Arlindo Rodrigues Galvão Filho

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

TAGARELA: De Grote Portugese Stemmenbibliotheek

Stel je voor dat je een enorme bibliotheek hebt, maar dan niet met boeken, maar met stemmen. Voor talen als Engels is deze bibliotheek al volgepropt met miljoenen uren van kristalheldere opnames. Maar voor het Portugees? Daar was de bibliotheek tot nu toe bijna leeg. Er waren wel wat kleine kastjes met stemmen, maar niet genoeg om de slimste computers (kunstmatige intelligentie) echt goed te leren spreken en te begrijpen.

De auteurs van dit paper hebben een oplossing bedacht: TAGARELA.

Wat is TAGARELA eigenlijk?

TAGARELA is een gigantische verzameling van 8.972 uur aan podcast-opnames. Dat is alsof je 373 dagen lang non-stop luistert naar mensen die praten! Het is speciaal gemaakt om computers te leren twee dingen:

  1. Luisteren en schrijven: Als je iets zegt, schrijft de computer het op (zoals een supersnelle stenograaf).
  2. Spreken: De computer leert hoe het klinkt als een mens een tekst voorleest (zoals een robot die een acteur wordt).

Het probleem: De "Ruwe Diamant"

Deze podcasts zaten oorspronkelijk in een grote, rommelige doos genaamd "Cem Mil Podcasts" (Honderdduizend Podcasts). Het probleem was dat het ruw materiaal was.

  • Het was alsof je een berg ongesorteerd afval kreeg in plaats van schone stenen.
  • Er was veel ruis (achtergrondgeluid).
  • Mensen praten vaak tegelijkertijd (overlappende stemmen).
  • De teksten die erbij zaten waren vaak foutenrijk.

Als je een computer zou laten leren op zo'n rommelige berg, zou hij net zo goed leren als een kind dat probeert te lezen terwijl er een lawaaierige feestzaal naast hem staat.

De Oplossing: De "Stemmen-Fabriek"

Om van die rommelige berg een schat te maken, hebben de onderzoekers een productielijn (een pipeline) gebouwd. Denk hierbij aan een supermoderne fabriek die ruwe diamant in schitterende juwelen verandert:

  1. De Scherpslijper (Segmentatie): Eerst snijden ze de lange podcasts in kleine, nette stukjes (zoals het hakken van een grote boom in brandhout).
  2. De Stem-Scheider (Diarization): In een podcast praten vaak meerdere mensen door elkaar. Deze stap zorgt ervoor dat de computer precies weet: "Dit is stem A, dit is stem B". Ze scheiden de mensen uit elkaar, alsof je een groep vrienden uit elkaar haalt zodat je met één persoon kunt praten.
  3. De Lawaaier-Detecteur (Overlap Detection): Als twee mensen tegelijk praten, gooit de computer dat stukje weg. Je wilt immers een schone stem horen, geen kakelbende.
  4. De Ruisverwijderaar (Denoising): Ze gebruiken een slimme filter om achtergrondgezoem, piepjes en echo's weg te halen. Het is alsof je een vieze raam schoonmaakt tot het glashelder is.
  5. De Slimme Vertaler (Transcriptie): Dit is het slimste stukje. Ze hebben eerst een heel goede, dure computer (een "seed") gebruikt om een klein stukje van de audio perfect te transcriberen. Vervolgens hebben ze een andere AI (Whisper) getraind op die perfecte stukjes om de rest van de uren te vertalen. Ze hebben zelfs een tweede AI ingezet om te controleren of de vertaling klopt. Alleen als beide AI's het eens waren, werd het bewaard.

Wat leverde dit op?

Na al dit werk hadden ze twee schatten:

  • Een enorme schat (8.972 uur): Voor het leren van computers om te luisteren. Hierin zitten ook de "foutjes" en haperingen van echte mensen, wat maakt dat de computer goed wordt in het begrijpen van echt, spontaan taalgebruik.
  • Een schone schat (2.800 uur): Voor het leren van computers om te spreken. Dit is de "schone" versie, zonder haperingen, zodat de robotstemmen natuurlijk klinken.

De Test: Werkt het?

De onderzoekers hebben de nieuwe computers getest.

  • Bij het luisteren: De computer die ze trainden met TAGARELA deed het beter dan alle andere bestaande modellen voor het Portugees. Het was alsof je een student hebt die na een jaar studeren al beter is dan een professor.
  • Bij het spreken: De robots die ze trainden klonken heel natuurlijk. Mensen die luisterden gaven hoge cijfers (een MOS van ongeveer 4,2 op 5). Het klonk niet als een robot, maar als een echte mens.

Waarom is dit belangrijk?

Voorheen was het Portugees een "onderbelichte" taal in de wereld van technologie. Nu, met TAGARELA, heeft het Portugees eindelijk een bibliotheek die net zo groot en rijk is als die van het Engels.

Kortom: De onderzoekers hebben een rommelige berg oude podcasts omgetoverd tot een glasheldere, georganiseerde bibliotheek. Hierdoor kunnen nu slimme computers beter leren spreken en luisteren in het Portugees, wat opent de deur voor betere spraakassistenten, vertalers en hulpmiddelen voor miljoenen Portugees-sprekers over de hele wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →