← Neueste Arbeiten
💬 NLP

Tagarela - A Portuguese speech dataset from podcasts

Das Paper stellt TAGARELA vor, ein öffentlich verfügbares, groß angelegtes portugiesisches Spracherkennungs- und Sprachsynthesedatenset mit über 8.972 Stunden Podcast-Audio, das durch eine spezielle Vorverarbeitungs- und Transkriptionspipeline erstellt wurde, um den Mangel an hochwertigen Ressourcen für die portugiesische Sprache zu beheben und den Fortschritt in der Sprachtechnologie zu fördern.

Ursprüngliche Autoren: Frederico Santos de Oliveira, Lucas Rafael Stefanel Gris, Alef Iury Siqueira Ferreira, Augusto Seben da Rosa, Alexandre Costa Ferro Filho, Edresson Casanova, Christopher Dane Shulby, Rafael Teixeira S
Veröffentlicht 2026-03-17
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Frederico Santos de Oliveira, Lucas Rafael Stefanel Gris, Alef Iury Siqueira Ferreira, Augusto Seben da Rosa, Alexandre Costa Ferro Filho, Edresson Casanova, Christopher Dane Shulby, Rafael Teixeira Sousa, Diogo Fernandes Costa Silva, Anderson da Silva Soares, Arlindo Rodrigues Galvão Filho

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stell dir vor, die Welt der Sprach-KI ist wie ein riesiges, modernes Restaurant. Für die englische Sprache gibt es dort ein üppiges Buffet mit Tausenden von hochwertigen Zutaten (Daten): riesige Mengen an klaren Aufnahmen, perfekt transkribierten Texten und unzähligen Stunden an Material. Die Köche (die KI-Entwickler) können daraus die besten Gerichte (Sprachmodelle) zaubern.

Für die portugiesische Sprache war das Buffet bisher aber eher karg. Es gab zwar ein paar kleine Schüsseln mit Daten, aber sie waren entweder zu klein, zu verrauscht oder für bestimmte Zwecke (wie das Erstellen von künstlichen Stimmen) ungeeignet. Das war wie ein Restaurant, das nur mit alten, schmutzigen Resten arbeitet – die Köche konnten keine feinen Gerichte daraus zaubern.

Das ist die Geschichte von TAGARELA.

Die Autoren dieses Papers haben sich gedacht: „Das muss sich ändern!" Sie haben eine riesige Schatzkiste gefunden, die „Cem Mil Podcasts" (Hunderttausend Podcasts) genannt wird. Das ist ein Berg von über 76.000 Stunden portugiesischer Sprache. Aber das Problem: Dieser Berg war ein chaotischer Müllhaufen. Die Aufnahmen waren verrauscht, mehrere Leute redeten gleichzeitig durcheinander, und die Texte dazu waren oft falsch oder gar nicht vorhanden.

Die Lösung: Der „TAGARELA"-Filter

Um aus diesem chaotischen Berg ein wertvolles Goldnugget zu machen, haben die Forscher eine hochmoderne „Wasch- und Sortiermaschine" gebaut. Stell dir das wie einen extrem sorgfältigen Küchenprozess vor:

  1. Aufräumen und Schneiden (Standardisierung): Zuerst wurden alle Töpfe auf die gleiche Größe gebracht. Lange Podcasts wurden in kleine, handliche Stücke (Clips) geschnitten, genau wie man ein großes Brot in Scheiben schneidet.
  2. Die Gäste trennen (Diarisierung): In Podcasts reden oft mehrere Leute. Die KI hat gelernt, genau zu hören: „Aha, jetzt spricht Maria, jetzt spricht João." Sie hat die Stimmen voneinander getrennt, damit am Ende jeder Teller nur eine Stimme enthält.
  3. Lärm entfernen (Denoising): Podcasts haben oft Hintergrundgeräusche (Autos, Kaffeemaschinen, Hall). Ein spezieller KI-Filter hat diese Störgeräusche wie ein Staubsauger herausgesaugt, bis die Stimme kristallklar war.
  4. Das Chaos der Überlappungen stoppen: Manchmal reden zwei Leute gleichzeitig. Das verwirrt eine KI. Ein spezieller Detektor hat diese Stellen gefunden und sie einfach weggeworfen. Nur saubere, einzelne Sätze blieben übrig.
  5. Der Text-Check (Transkription): Da die Podcasts keine perfekten Texte hatten, haben sie eine „Lern-Methode" angewandt. Zuerst haben sie einen kleinen Teil mit einer sehr teuren, kommerziellen KI perfekt abgeschrieben. Daraufhin haben sie eine eigene, kostenlose KI (Whisper) trainiert, die dann den Rest des riesigen Berges abgeschrieben hat. Um sicherzugehen, dass keine Fehler unterlaufen sind, haben sie zwei KIs gegeneinander antreten lassen und nur die Texte behalten, bei denen beide übereinstimmten.

Das Ergebnis: Ein riesiges, sauberes Buffet

Am Ende haben sie TAGARELA geschaffen: Ein Dataset mit über 8.972 Stunden portugiesischer Sprache. Das ist riesig! Zum Vergleich: Andere portugiesische Datensätze waren oft nur so groß wie ein kleiner Snack (ein paar hundert Stunden). TAGARELA ist jetzt so groß wie die großen englischen Datensätze.

Es gibt sogar zwei Versionen:

  • Eine für Spracherkennung (ASR): Hier sind auch die kleinen Unsicherheiten und „Ähms" enthalten, damit die KI lernt, wie Menschen wirklich sprechen.
  • Eine für Sprachsynthese (TTS): Hier ist alles extrem sauber und klar, damit die KI lernen kann, eine natürliche, menschliche Stimme zu imitieren.

Der Beweis: Es funktioniert!

Die Forscher haben nicht nur das Dataset gebaut, sondern auch getestet, ob es wirklich gut ist. Sie haben damit neue KI-Modelle trainiert:

  • Beim Hören (ASR): Die KI konnte portugiesische Sprache so gut verstehen, dass sie besser war als viele andere Modelle, die mit weniger Daten trainiert wurden.
  • Beim Sprechen (TTS): Die KI konnte portugiesische Texte so natürlich vorlesen, dass menschliche Prüfer sie kaum von echten Menschen unterscheiden konnten.

Fazit

TAGARELA ist wie ein riesiger, neuer Lieferwagen voller frischer Zutaten, der endlich in die portugiesische Sprach-KI-Küche geliefert wurde. Dank dieses Projekts können Entwickler jetzt viel bessere Sprachassistenten, Übersetzer und Vorleser für Portugiesisch bauen. Es schließt die Lücke zwischen dem englischen Sprach-Buffet und dem portugiesischen, damit auch die 250 Millionen Portugiesischsprecher endlich die besten Sprachtechnologien der Welt erhalten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →