← Últimos artículos
💬 NLP

Lingo_Research_Group at SemEval-2026 Task 9: Evaluating Prompt Variants for Polarization Detection

El artículo de Lingo_Research_Group presenta una evaluación sistemática de doce variantes de prompts utilizando el modelo Gemma3-27B para la Tarea 9 de SemEval-2026, demostrando que, si bien los enfoques basados en prompts detectan eficazmente la polarización de grano grueso en 22 idiomas, enfrentan desafíos crecientes en la clasificación sociolingüística de grano fino y multietiqueta.

Autores originales: Pritam Kadasi, Anuj Tiwari, Mayank Singh

Publicado 2026-06-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Pritam Kadasi, Anuj Tiwari, Mayank Singh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective tratando de resolver un misterio que ocurre en 22 idiomas diferentes alrededor del mundo. El misterio no trata sobre una joya robada, sino sobre algo llamado "polarización". En términos sencillos, la polarización es cuando la gente en las redes sociales comienza a gritarse unos a otros, trazando líneas duras entre "nosotros" y "ellos", y negándose a escuchar al otro lado.

El equipo detrás de este artículo, Lingo Research Group, entró en un concurso global (SemEval-2026) para ver si podían enseñarle a una computadora súper inteligente (una IA) a detectar estas peleas, averiguar de quién están peleando y cómo están peleando.

Aquí explicamos cómo lo hicieron, usando analogías de la vida cotidiana:

Los tres niveles del misterio

El concurso tenía tres niveles de dificultad, como un videojuego:

  1. Nivel 1 (La comprobación de "¿está sucediendo?"): La IA solo necesita responder "Sí" o "No". ¿Es esta publicación enojada y divisiva, o es solo una publicación normal?
    • Analogía: Como un detector de humo. Solo necesita decir: "¿Hay humo?".
  2. Nivel 2 (La comprobación de "¿de quién se trata?"): Si la publicación es polarizada, ¿de quién están peleando? ¿Son políticos? ¿Una raza específica? ¿Una religión? ¿Género?
    • Analogía: Como un detective preguntando: "¿Quién es el sospechoso?". La IA tiene que elegir uno o más sospechosos de una alineación.
  3. Nivel 3 (La comprobación de "¿cómo están peleando?"): Este es el nivel más difícil. ¿Cómo se expresa el odio? ¿Están usando estereotipos? ¿Están insultando a la gente? ¿Están actuando como si no les importaran los sentimientos de los demás?
    • Analogía: Como analizar el estilo de la pelea. ¿Están usando un cuchillo, un objeto contundente o simplemente gritando? Esto requiere detectar comportamientos sutiles y complicados.

La herramienta: El "Prompt" como una receta

En lugar de enseñarle a la computadora mostrándole miles de ejemplos (lo que sería como obligar a un estudiante a memorizar un libro de texto), el equipo utilizó prompts. Piensa en un prompt como una receta o un conjunto de instrucciones dadas a un chef muy talentoso pero de mentalidad literal (la IA).

El equipo probó 12 recetas diferentes.

  • Algunas recetas eran muy cortas: "¿Es esto enojado?".
  • Otras eran detalladas: "Busca palabras que separen a las personas en grupos. Si ves sarcasmo, comprueba si es grosero. Aquí hay tres ejemplos de cómo se ve eso...".

Probaron estas recetas en dos "chefs" (modelos de IA) diferentes: aya-101 y Gemma3-27B. Descubrieron que Gemma3-27B era el mejor chef, así que lo usaron para el concurso final.

Los resultados: Buenos en lo básico, con dificultades en los matices

Los resultados del equipo fueron una mezcla de éxito y lucha, lo que cuenta una historia interesante:

  • Nivel 1 (Detector de humo): La IA fue muy buena en esto. Identificó correctamente las publicaciones polarizadas el 76% de las veces en promedio. Es como un detector de humo que rara vez pierde un incendio.
  • Nivel 2 (Los sospechosos): La puntuación bajó a un 59%. Fue más difícil señalar exactamente a quién se estaba atacando.
  • Nivel 3 (El estilo de pelea): La puntuación bajó aún más, hasta aproximadamente el 44%. Esta fue la parte más difícil.

¿Por qué se volvió más difícil?
Los autores explican que a medida que la tarea se vuelve más específica, la IA se confunde.

  • El problema del "Chef Conservador": La IA fue entrenada para ser muy cuidadosa. Solo decía "Sí, esto es polarizado" si la evidencia era súper obvia (como alguien gritando un insulto).
  • La trampa del sarcasmo: En inglés, la gente suele pelear usando el sarcasmo, la ironía o juegos de palabras ingeniosos (por ejemplo, "Oh, genial, otro socialista en nombre de Jesús"). La IA, al ser demasiado literal, se perdía estas porque no había "palabras de pelea" obvias. Pensaba: "¿No hay insultos directos? Entonces debe ser seguro".
  • La brecha entre lo directo y lo indirecto: En muchos otros idiomas (como el hindi o el chino), la gente suele ser más directa en sus argumentos. La IA era excelente detectando esos golpes directos, pero le costaba entender los argumentos sutiles e indirectos del inglés.

El rompecabezas del idioma

La IA no se desempeñó igual en todos los idiomas.

  • El nepalí y el chino fueron fáciles para la IA porque la polarización solía ser muy clara y directa (como "Grupo A contra Grupo B").
  • El inglés fue sorprendentemente difícil. Debido a que los angloparlantes usan mucho el sarcasmo y la jerga cultural, la IA seguía perdiendo las peleas. Es como intentar entender un chiste en un idioma que no conoces del todo: escuchas las palabras, pero te pierdes el remate.

La gran conclusión

El artículo concluye que la IA es buena detectando las peleas "ruidosas" (Nivel 1), pero tiene dificultades con las peleas "silenciosas" o "ingeniosas" (Niveles 2 y 3).

El equipo aprendió que no puedes simplemente darle a una IA una instrucción simple y esperar que entienda las complejas emociones humanas a través de 22 culturas diferentes. Cuanto más le pides que analice el matiz (el "cómo" y el "quién"), más tiende a perder los signos sutiles, especialmente cuando la gente es sarcástica o indirecta.

En resumen: La IA es un buen detective para crímenes obvios, pero necesita más entrenamiento para entender las formas sutiles, truculentas y sarcásticas en que la gente discute en línea.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →