← Últimos artículos
💬 NLP

Tagarela - A Portuguese speech dataset from podcasts

Este artículo presenta TAGARELA, un nuevo conjunto de datos de podcast en portugués con más de 8.972 horas de audio, diseñado para superar la escasez de recursos públicos de gran escala y permitir el entrenamiento de modelos de reconocimiento y síntesis de voz de última generación.

Autores originales: Frederico Santos de Oliveira, Lucas Rafael Stefanel Gris, Alef Iury Siqueira Ferreira, Augusto Seben da Rosa, Alexandre Costa Ferro Filho, Edresson Casanova, Christopher Dane Shulby, Rafael Teixeira S
Publicado 2026-03-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Frederico Santos de Oliveira, Lucas Rafael Stefanel Gris, Alef Iury Siqueira Ferreira, Augusto Seben da Rosa, Alexandre Costa Ferro Filho, Edresson Casanova, Christopher Dane Shulby, Rafael Teixeira Sousa, Diogo Fernandes Costa Silva, Anderson da Silva Soares, Arlindo Rodrigues Galvão Filho

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que el mundo de la tecnología de la voz es como una gran biblioteca de recetas para cocinar.

Hasta ahora, si querías aprender a cocinar un plato delicioso en inglés, tenías miles de libros de cocina gigantes, con recetas perfectas, ingredientes frescos y chefs famosos explicando cada paso. Esos son los datos que tienen los modelos de Inteligencia Artificial (IA) para el inglés: ¡tienen horas y horas de audio limpio!

Pero, si querías cocinar el mismo plato en portugués, te dabas cuenta de que solo tenías un par de libritos viejos, con recetas borrosas y algunas páginas arrancadas. Aunque el portugués lo hablan cientos de millones de personas, la tecnología para entenderlo y hablarlo estaba "hambrienta" de buenos datos.

Aquí es donde entra el proyecto TAGARELA.

¿Qué es TAGARELA?

Piensa en TAGARELA como un gigantesco festival de podcasts que los investigadores han organizado y limpiado a fondo.

  1. La Materia Prima (El Desorden): Todo comenzó con una colección llamada "Cem Mil Podcasts" (Cien Mil Podcasts). Imagina que tienes 100.000 grabaciones de radio: hay gente hablando rápido, otros interrumpiendo, ruidos de fondo, risas, y a veces dos personas hablando al mismo tiempo. Es un caos divertido, pero imposible de usar directamente para enseñar a una IA a hablar o entender bien.
  2. La Limpieza (El Pipeline): Los autores crearon una "fábrica de limpieza" automática.
    • Separaron a los invitados: Usaron una IA para identificar quién es quién, como si separaran a los invitados de una fiesta para que cada uno tenga su propia grabación.
    • Quitaron el ruido: Eliminaron el zumbido de fondo y las interferencias, como si pusieran auriculares de cancelación de ruido a cada hablante.
    • Detectaron las superposiciones: Si dos personas hablaban a la vez, la IA lo detectó y descartó esa parte, porque una IA necesita escuchar una sola voz clara.
    • Corrigieron las transcripciones: Escribieron lo que se dijo. Para no equivocarse, usaron un sistema de "doble verificación": una IA escribía, otra revisaba, y solo guardaban lo que ambas coincidían.

El Resultado: Un Tesoro de 9.000 Horas

Al final del proceso, obtuvieron TAGARELA: un dataset (un conjunto de datos) con más de 8.972 horas de audio limpio.

  • Es como si hubieran llenado una biblioteca con 8.972 horas de conversaciones perfectas.
  • Incluye tanto el portugués de Brasil como el de Portugal.
  • Tiene voces de hombres y mujeres.

¿Para qué sirve esto?

Los investigadores probaron que este dataset funciona de dos maneras principales:

  1. Para que la IA entienda (Reconocimiento de Voz - ASR): Imagina que le das a la IA un micrófono y le dices: "Escucha a esta persona y escribe lo que dice". Antes, la IA se confundía con el acento o el ruido. Ahora, entrenada con TAGARELA, la IA entiende el portugués casi tan bien como un humano. ¡Es como si le hubieran dado un diccionario gigante y un oído entrenado!
  2. Para que la IA hable (Texto a Voz - TTS): Imagina que quieres que una IA lea un libro en voz alta. Antes, la voz sonaba robótica o extraña. Con TAGARELA, la IA aprendió a hablar con una naturalidad sorprendente, con la entonación correcta y sin sonar como un robot de los años 80.

En Resumen

Este paper es como decir: "¡Dejen de buscar recetas en libritos viejos! Hemos creado una biblioteca completa de audio en portugués, limpia y organizada, para que cualquier desarrollador pueda crear asistentes de voz, traductores y sistemas de lectura que suenen naturales y entiendan perfectamente a los hablantes de portugués."

Es un paso gigante para que la tecnología deje de tratar al portugués como un "idioma secundario" y lo trate con la misma importancia que al inglés. ¡Y lo mejor es que lo han puesto a disposición de todos, gratis, para que la comunidad pueda seguir mejorando estas herramientas!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →