← Últimos artículos
💬 NLP

ToxSyn-PT: A Synthetic Fine-Grained Dataset of Minority-Targeted Toxic Language in Portuguese

Este artículo presenta ToxSyn-PT, el primer conjunto de datos sintéticos a gran escala en portugués que cuenta con anotaciones de discurso de odio multietiqueta y de grano fino en nueve grupos minoritarios con contraejemplos no tóxicos esenciales, revelando que los modelos entrenados con datos de redes sociales no logran generalizar a contextos específicos de minorías y destacando las limitaciones de las métricas de evaluación estándar.

Autores originales: Iago Alves Brito, Julia Soares Dollis, Fernanda Bufon Farber, Diogo Fernandes, Arlindo R. Galvão Filho

Publicado 2026-06-23
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Iago Alves Brito, Julia Soares Dollis, Fernanda Bufon Farber, Diogo Fernandes, Arlindo R. Galvão Filho

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a detectar a un acosador en un patio de recreo. Durante mucho tiempo, los investigadores solo han podido enseñar a este robot utilizando ejemplos de patios de recreo de habla inglesa e, incluso entonces, la mayoría de las veces le mostraban al robot a los acosadores obvios y gritones. Rara vez le mostraban al robot a los acosadores sutiles y astutos que esconden sus palabras hirientes detrás de bromas o de "simples preguntas".

Ahora, imagina intentar enseñarle al robot a entender el portugués. El problema es que casi no existen libros de texto (conjuntos de datos) de calidad en portugués que muestren la diferencia entre un ataque malintencionado contra un grupo específico de personas y una conversación normal y amistosa sobre esas mismas personas.

Este artículo presenta ToxSyn-PT, un nuevo y masivo "libro de texto" creado específicamente para solucionar este problema. He aquí cómo los autores construyeron esto y lo que descubrieron, explicado de forma sencilla:

1. El Problema: El fallo del "talla única"

Piensa en los conjuntos de datos de discurso de odio existentes en portugués como una biblioteca que solo tiene libros sobre Twitter. Si entrenas a tu robot usando solo libros de Twitter, se convertirá en un experto en detectar los gritos fuertes y enfurecidos comunes en las redes sociales.

Sin embargo, los autores descubrieron que cuando tomaban este robot "entrenado en Twitter" y lo ponían en una habitación diferente (como la sección de comentarios de un periódico o una discusión formal), se volvía completamente ciego. No podía reconocer el discurso de odio allí porque el "lenguaje del acosador" cambia dependiendo de la habitación.

  • La Analogía: Es como enseñar a un estudiante a reconocer a un "lobo" mirando solo lobos en un zoológico. Cuando ese estudiante va al bosque, no reconoce al lobo porque se ve diferente en la naturaleza.

2. La Solución: Construir un "Gimnasio de Entrenamiento" Sintético

Dado que no había suficientes ejemplos reales de discurso de odio en portugués dirigido a grupos específicos (como personas negras, mujeres, personas LGBTQIA+, ancianos, etc.), los autores decidieron construir sus propios ejemplos utilizando IA.

Crearon una línea de montaje de cuatro pasos (un pipeline) para generar 53.000 frases:

  • Paso 1: La Semilla. Comenzaron con una colección diminuta y de alta calidad de ejemplos escritos por humanos (tanto malos como buenos) sobre dos grupos.
  • Paso 2: Expansión. Utilizaron una IA (GPT-4) para observar esas semillas y escribir miles de variaciones nuevas, dirigidas a nueve grupos minoritarios diferentes.
  • Paso 3: Parafraseo. Tomaron esas nuevas frases y las reescribieron en diferentes estilos. Crucialmente, no solo escribieron cosas malas; escribieron cosas buenas sobre los mismos grupos. Esto es vital porque le enseña a la IA la diferencia entre odiar a un grupo y hablar de un grupo.
  • Paso 4: Enriquecimiento. Añadieron formas de prejuicio aún más complejas y sutiles (como el "prejuicio ambiguo", donde el odio está oculto en un doble sentido) para que el entrenamiento fuera más difícil y mejor.

El Resultado: Un conjunto de datos masivo que está perfectamente equilibrado. Contiene frases malintencionadas, frases amables y frases neutrales, todas etiquetadas con precisión sobre quién es el objetivo y qué "truco retórico" (como el sarcasmo o la culpabilización de la víctima) se está utilizando.

3. El Gran Descubrimiento: "Fallo Catastrófico"

Los autores probaron sus nuevos modelos de IA frente a los antiguos. Los resultados fueron impactantes:

  • Modelos Antiguos: Cuando intentaron usar modelos entrenados en redes sociales generales para detectar el discurso de odio en este nuevo conjunto de datos específico, fallaron estrepitosamente. Pasaron por alto casi todo el odio.
  • Nuevos Modelos: Cuando entrenaron modelos con ToxSyn-PT, esos modelos fueron excelentes para detectar el odio en su propio "gimnasio", pero también fallaron cuando fueron probados en los antiguos datos de redes sociales.

La Metáfora: Es como entrenar a un nadador para competir en una piscina. Se convierte en un nadador de piscina de clase mundial. Pero si lo pones en el océano, se ahoga. Inversamente, si lo entrenas en el océano, no puede nadar en la piscina. El "agua" (el contexto) es simplemente demasiado diferente.

Esto demuestra que el discurso de odio no es una sola cosa. Cambia según quién sea el atacado y dónde esté ocurriendo la conversación. Los autores también advierten que las "hojas de puntuación" estándar (como el Macro F1) pueden ser engañosas; un robot puede obtener una puntuación alta en general, pero seguir fallando completamente en su tarea más importante: detectar el odio específico que se suponía debía encontrar.

4. Por qué esto es importante

Este artículo no pretende haber resuelto el discurso de odio para siempre. En su lugar, proporciona el primer "gimnasio" de alta calidad para que la IA en portugués aprenda a distinguir entre el odio genuino y la discusión normal sobre las minorías.

  • Antes: Los investigadores tenían que adivinar o utilizar conjuntos de datos diminutos y desequilibrados que pasaban por alto los matices.
  • Ahora: Tienen un recurso masivo y equilibrado que incluye los ejemplos "buenos" necesarios para enseñar a la IA qué no debe marcar como odio.

Los autores han publicado este conjunto de datos de forma pública para que otros investigadores puedan utilizarlo para construir sistemas de IA mejores y más cuidadosos que comprendan las formas sutiles y peligrosas en que el discurso de odio ataca a las comunidades vulnerables en portugués.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →