← Últimos artículos
💬 NLP

BioSentinel at EXIST 2026: Soft-Label Optimization with XLM-RoBERTa for Sexism Intent Classification in Memes

El artículo del equipo BioSentinel detalla su participación en la Tarea 2.2 de EXIST 2026, donde emplearon un modelo basado en XLM-RoBERTa entrenado con una función de pérdida compuesta para equilibrar eficazmente las predicciones de etiquetas suaves y etiquetas duras para clasificar la intención sexista en memes, logrando finalmente clasificaciones específicas en la evaluación de CLEF 2026.

Autores originales: Chandru Munisamy, Karthikeya Raguveer, Alapan Kuila

Publicado 2026-07-28
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Chandru Munisamy, Karthikeya Raguveer, Alapan Kuila

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que el internet es una plaza de la ciudad gigante y caótica donde todo el mundo grita, susurra y hace dibujos en las paredes. A veces, estos dibujos (llamados "memes") son solo bromas divertidas, pero otras veces, esconden comentarios de mala intención sobre el género que son difíciles de detectar. Este es el mundo de la detección de sexismo, una rama de la informática donde enseñamos a las máquinas a "leer la habitación" y entender si un chiste es inofensivo o hiriente.

Pero aquí está la parte difícil: los humanos no siempre están de acuerdo sobre qué es ofensivo. Una persona puede ver un meme como un insulto directo, mientras que otra piensa que es solo un chiste irónico y sutil, y una tercera puede no ver nada malo en absoluto. Esto se llama desacuerdo. En el pasado, las computadoras eran enseñadas a elegir solo una respuesta "correcta", como un profesor calificando un examen con una única clave de respuestas. Sin embargo, este artículo argumenta que cuando los humanos no pueden ponerse de acuerdo, la computadora no debería simplemente adivinar una respuesta; debería aprender a entender la dispersión de las opiniones, de forma similar a un pronóstico del tiempo que dice "hay un 60% de probabilidad de lluvia" en lugar de solo gritar "¡Está lloviendo!". Este enfoque se llama Aprendizaje con Desacuerdo (Learning with Disagreement), y ayuda a las máquinas a ser más matizadas y menos excesivamente seguras de sí mismas.


La misión del equipo BioSentinel: Leer el texto, ignorar la imagen

Conoce al equipo BioSentinel, un grupo de investigadores que participó en una competencia de alto nivel llamada EXIST 2026. ¿Su desafío? Construir un robot que pudiera mirar memes y decidir si el creador estaba siendo directo (obviamente sexista), juicioso (usando ironía o pistas sutiles) o no (nada sexista).

¿El giro inesperco? La competencia no solo quería que el robot eligiera una etiqueta. Quería que el robot escupiera una distribución de probabilidad, una forma elegante de decir: "Estoy un 70% seguro de que esto es directo, un 20% seguro de que es juicioso y un 10% seguro de que es inofensivo". Esto imita cómo un grupo de jueces humanos podría votar de manera diferente sobre el mismo meme.

La estrategia: Un detective de solo texto

El equipo, liderado por Chandru Munisamy y amigos de la India, decidió jugar un juego muy específico. Aunque los memes son imágenes con texto, decidieron ignorar las imágenes por completo. Actuaron como un detective que solo lee la transcripción de una conversación, ignorando las expresiones faciales y el lenguaje corporal.

¿Por qué? Querían ver si podían volverse realmente buenos entendiendo las palabras y la incertidumbre de las etiquetas sin distraerse con las partes visuales desordenadas. Utilizaron un potente cerebro lingüístico llamado XLM-RoBERTa (un modelo con 270 millones de parámetros que habla tanto inglés como español) y le enseñaron un truco especial.

En lugar de solo decirle al modelo: "Esta es la respuesta", le dieron dos tipos de tareas:

  1. La Tarea Suave (Soft Homework): "Aquí está cómo votaron los humanos. Intenta coincidir con esa mezcla exacta de opiniones". Utilizaron una herramienta matemática llamada Divergencia KL para hacer que las suposiciones del modelo se parecieran al patrón de votación humano.
  2. La Tarea Dura (Hard Homework): "Aquí está el ganador oficial de la votación. Asegúrate de que también aciertes esto". Utilizaron una herramienta estándar llamada Entropía Cruzada Ponderada (Weighted Cross-Entropy) para asegurar que el modelo no se confundiera demasiado.

Al mezclar estas dos lecciones (70% suave, 30% dura), esperaban crear un modelo que fuera tanto preciso como consciente del desacuerdo humano.

Los resultados: Un desempeño sólido, pero no perfecto

Cuando el equipo BioSentinel probó su sistema en el examen oficial (el conjunto de prueba), esto fue lo que sucedió:

  • Puntuación de Etiqueta Suave (Soft-Label Score): Lograron una puntuación de 0.3229 (llamada ICM-Soft-Norm). Esto fue mejor que un robot básico de "adivinar la respuesta más común", que solo obtuvo 0.2835.
  • Puntuación de Etiqueta Dura (Hard-Label Score): Para elegir la mejor respuesta única, obtuvieron una puntuación de 0.4236 (F1-score).
  • Clasificación: De los 118 equipos que enviaron predicciones de etiquetas suaves, quedaron en el puesto 40. De los 187 equipos que enviaron predicciones de etiquetas duras, fueron el puesto 49.

El equipo encontró que su método de entrenamiento de "mezcla y combinación" funcionó. Cuando eliminaron la lección "suave" (la divergencia KL), su capacidad para coincidir con las opiniones humanas cayó drásticamente (de 0.312 a 0.142). Cuando eliminaron la lección "dura", su precisión en respuestas únicas disminuyó. La combinación fue la clave de su éxito.

La lucha con lo "Juicioso"

Sin embargo, el robot tenía un punto ciego. Era pésimo detectando el sexismo juicioso (el tipo sutil e irónico). Su puntuación para esta categoría específica fue muy baja: 0.071.

¿Por qué? El equipo se dio cuenta de que, sin la imagen, el robot perdía el remate del chiste. Muchos de estos memes dependen de un chiste visual —como una caricatura o una expresión facial específica— que el texto por sí solo no puede explicar. Por ejemplo, un texto que dice "Sentado en tu mesa familiar..." podría parecer inocente, pero si la imagen muestra a un padre recibiendo el pez más grande y a la madre el más pequeño, el chiste queda claro. Sin la imagen, el robot solo veía una frase neutral.

El equipo también notó algo curioso sobre cómo aprendió el robot. Durante los dos primeros días de entrenamiento, ni siquiera adivinó "juicioso" ni una sola vez. Solo comenzó a entender esta categoría truculenta después de que ya había aprendido a distinguir entre "inofensivo" y "directo". Esto sugiere que lo sutil es lo más difícil de aprender y podría necesitar más tiempo o un entrenamiento especial.

Lo que no hicieron (Y por qué importa)

El artículo es muy honesto sobre lo que no hizo. No intentaron usar los datos de ondas cerebrales (EEG) o los datos de seguimiento ocular que los organizadores de la competencia proporcionaron. ¿Por qué? Porque los datos no coincidían entre los conjuntos de entrenamiento y de prueba. Tampoco intentaron usar modelos más grandes y complejos porque, en su configuración específica, esos modelos se volvían inestables y confusos.

También probaron un ajuste de "temperatura" (una perilla que hace que las suposiciones del robot sean más o menos seguras). En su prueba de práctica, girar esta perilla a 0.7 hizo que el robot fuera ligeramente mejor para coincidir con las opiniones humanas (elevando la puntuación de 0.317 a 0.326) y que su confianza fuera más realista. Sin embargo, para la prueba oficial final, se mantuvieron con las configuraciones estándar para estar seguros.

La conclusión

El equipo BioSentinel demostió que se puede construir un detector de sexismo decente usando solo texto, siempre y cuando se le enseñe a respetar el desacuerdo humano. Al usar una mezcla de lecciones "suaves" y "duras", crearon un modelo que entiende los matices de la opinión humana mejor que los métodos antiguos.

Pero el artículo también nos advierte: si quieres atrapar los chistes sutiles e irónicos, no puedes solo leer el texto. Necesitas ver la imagen. La lucha del robot con la categoría "juicioso" demuestra que, a veces, el contexto visual es lo único que hace que el chiste (o el insulto) tenga sentido. El equipo sugiere que los futuros robots deberían intentar mirar tanto las palabras como las imágenes para obtener la historia completa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →