HABIB_TAZ at SemEval-2026 Task 11: Disentangling Formal Logic from Content via Synthetic Training and Multi-Objective Optimization
El sistema HABIB_TAZ alcanzó los primeros puestos en la Tarea 11 de SemEval-2026 mediante el empleo de modelos mDeBERTa-v3 entrenados con datos silogísticos sintéticos con optimización multiobjetivo para desenredar eficazmente la lógica formal del sesgo de contenido a través de múltiples idiomas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que le estás enseñando a un robot superinteligente cómo resolver acertijos de lógica. Le das una regla: "Si todas las aves pueden volar, y un pingüino es un ave, entonces un pingüino puede volar". Un humano podría hacer una pausa y decir: "¡Espera, los pingüinos no pueden volar! Esa regla es errónea en el mundo real". Pero un robot que dependa demasiado de su "sentido común" podría confundirse. Podría pensar: "Oh, los pingüinos son aves, y las aves vuelan, así que la conclusión debe ser verdadera", a pesar de que la lógica en sí misma sea defectuosa porque la regla inicial era falsa. Este es el problema complicado que los científicos están tratando de resolver con los Modelos de Lenguaje Extensos (LLM). Estos son los poderosos cerebros de IA detrás de los chatbots y los motores de búsqueda. Son increíbles escribiendo historias y respondiendo preguntas, pero a menudo luchan por separar lo que es lógicamente cierto de lo que suena creíble. Se dejan engañar por los "efectos de contenido", donde el significado del mundo real de las palabras los distrae de la estructura real del argumento. El objetivo de esta investigación es construir una IA que actúe como un lógico estricto: uno que verifique si las matemáticas del argumento funcionan, independientemente de si la historia suena tonta o sensata.
El equipo detrás de este proyecto, HABIB_TAZ, entró en una competición llamada SemEval-2026 Task 11 para probar exactamente esta capacidad. Su misión era crear un sistema que pudiera analizar silogismos (un tipo de argumento lógico con dos premisas y una conclusión) en 12 idiomas diferentes y decidir si la conclusión seguía las reglas, incluso si las premisas eran disparates o si había frases adicionales y distractoras de por medio.
Para resolver esto, los investigadores no solo alimentaron a su IA con más datos del mundo real. En su lugar, construyeron un campo de entrenamiento "sintético". Imagina que crearon una fábrica gigante que genera millones de acertijos lógicos utilizando reglas estrictas y creadas, con palabras sin sentido o jerigonza, en lugar de animales u objetos reales. Esto fue para evitar que la IA aprendiera atajos basados en el conocimiento del mundo real. Luego entrenaron su modelo de IA, basado en un potente motor de lenguaje llamado mDeBERTa-v3, utilizando una receta de entrenamiento especial de tres partes. Primero, utilizaron una técnica para asegurar que el modelo no ignorara los ejemplos más difíciles y complicados. Segundo, añadieron una "penalización por sesgo", que es como un profesor que regaña suavemente al estudiante cada vez que se distrae por lo "plausible" que suena una historia, obligándolo a concentrarse únicamente en la lógica. Tercero, utilizaron una verificación de consistencia para asegurar que el modelo entendiera que una oración compleja significaba lo mismo lógicamente que una oración simple.
Los resultados fueron una mezcla de puntuaciones perfectas y desafíos interesantes. En las tareas más sencillas —acertijos solo en inglés, acertijos en inglés con distracciones, y acertijos en 12 idiomas sin distracciones— su sistema alcanzó una puntuación perfecta de 100.0. Ignoró completamente los trucos del "mundo real" y acertó la lógica en cada ocasión, con cero sesgo. Sin embargo, el desafío más difícil fue la tarea de "Multilingüe con Ruido", donde la IA tenía que lidiar con 12 idiomas y frases distractoras. Aquí, el sistema quedó en el sexto lugar. Acertó el 89.06% de las respuestas, pero todavía mostraba una pequeña cantidad de sesgo (2.89%).
Los investigadores descubrieron que su receta de entrenamiento especial funcionó de maravilla para las tareas más fáciles, demostrando que se puede enseñar a una IA a ser un lógico puro si se la entrena con datos sintéticos basados en reglas en lugar de texto desordenado del mundo real. Para la tarea más difícil, notaron que el modelo tenía más dificultades con los datos multilingües originales que con las traducciones al inglés, lo que sugiere que la forma en que el modelo maneja diferentes idiomas es todavía algo inestable. También descubrieron que añadir una verificación de "consistencia" específica (usando la Divergencia KL) ayudó al modelo a mantenerse estable a través de los diferentes idiomas, aunque requería mucha potencia de cómputo para ejecutarse. En última instancia, el artículo sugiere que, si bien podemos construir IAs que sean increíblemente buenas en la lógica pura, hacerlas robustas en cada idioma y en cada tipo de ruido sigue siendo un trabajo en progreso. El equipo ha hecho públicos sus códigos y herramientas de generación de datos, con la esperanza de que otros los utilicen para construir una IA aún más lógica en el futuro.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.