LeWiDi-2025 at NLPerspectives: Third Edition of the Learning with Disagreements Shared Task
La tercera edición de la tarea compartida LeWiDi en NLPerspectives hace avanzar el desarrollo de la IA consciente del desacuerdo al expandir el benchmark a cuatro tareas diversas de PLN con esquemas de etiquetado ordinal, introduciendo tanto paradigmas de evaluación de etiquetas suaves como perspectivistas con métricas novedosas, y proporcionando nuevos recursos e información sobre la modelización de la variación del juicio humano.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando enseñarle a un robot a entender el lenguaje humano. Durante mucho tiempo, enseñamos a los robots mostrándoles ejemplos donde todos estaban de acuerdo con la respuesta, como "2 + 2 = 4". Pero en la vida real, los humanos solemos discrepar. Una persona puede pensar que un chiste es divertidísimo, mientras que otra puede pensar que es ofensivo. Una persona puede ver una frase como una mentira, mientras que otra la ve como una opinión inofensiva.
Este artículo describe la tercera edición de un "concurso" (llamado LeWiDi-2025) diseñado para enseñar a los modelos de IA a lidiar con estos desacuerdos, en lugar de pretender que no existen.
Aquí tienes un desglose sencillo de lo que hicieron, utilizando algunas analogías de la vida cotidiana:
1. El objetivo: Enseñar a la IA a escuchar a la multitud
En lugar de obligar a la IA a elegir una sola respuesta "correcta", los organizadores querían ver si la IA podía entender el panorama completo de la opinión humana.
- La forma antigua: Si 10 personas votan sobre una película y 6 dicen "Buena" y 4 dicen "Mala", la IA antigua simplemente sería informada de que "La respuesta es Buena". Ignora a las 4 personas.
- La nueva forma: Se le dice a la IA: "Aquí está la historia completa: a 6 personas les gustó, a 4 no. Tu trabajo es entender por qué se sintieron así y predecir la mezcla de opiniones".
2. Los cuatro "juegos" (conjuntos de datos)
El concurso ofreció a los participantes cuatro tipos diferentes de acertijos para resolver, cada uno representando un tipo diferente de desacuerdo humano:
- El juego del sarcasmo (CSC): Imagina leer un mensaje de texto. ¿Es un cumplido sincero o una pulla sarcástica? Diferentes personas califican qué tan "sarcástico" es en una escala del 1 al 6.
- El juego de la ironía (MP): Una publicación corta y una respuesta. ¿Está la respuesta siendo irónica? Esto se jugó en 9 idiomas diferentes (como inglés, español y árabe), demostrando que la ironía es un problema global.
- El juego de la paráfrasis (Par): Se hacen dos preguntas. ¿Están preguntando lo mismo? En lugar de un simple "Sí/No", las personas calificaron qué tan similares eran en una escala de -5 a 5.
- El juego de la lógica (VEN): Una afirmación y un hecho. ¿El hecho prueba la afirmación, la contradice o no tiene nada que ver con ella? Aquí, las personas también tuvieron que escribir explicaciones para sus respuestas.
3. Las dos formas de jugar (tareas)
Los participantes debían elegir entre dos formas diferentes de demostrar la comprensión de su IA:
- Tarea A: El "pronosticador del clima" (Etiqueta suave / Soft-Label)
En lugar de adivinar una respuesta específica, la IA actúa como un pronosticador del clima. No solo dice "Va a llover"; dice: "Hay un 60% de probabilidad de lluvia, un 30% de sol y un 10% de nieve". La IA predice la distribución de cómo votarían los humanos. - Tarea B: El "lector de mentes" (Perspectivista)
Esto es más difícil. La IA tiene que adivinar qué diría una persona específica. Si le dices a la IA: "Aquí está lo que la Persona X suele pensar", la IA debe predecir: "Basado en el historial de la Persona X, es probable que dé esta respuesta". Es como predecir si tu tío gruñón o tu tía optimista estaría de acuerdo con un chiste.
4. La nueva tarjeta de puntuación (métricas)
En el pasado, los jueces usaban una regla simple para medir qué tan lejos estaba la IA. Pero esa regla no funcionaba bien para cosas como las "escalas de sarcasmo" o los "múltiples idiomas".
- La nueva regla: Inventaron nuevas formas de medir el éxito.
- Para las "escalas" (como del 1 al 6), usaron una métrica que entiende que estar equivocado por un punto (decir 4 en lugar de 5) es mejor que estar equivocado por cinco puntos (decir 1 en lugar de 5).
- Para la tarea del "lector de mentes", midieron qué tan bien la IA podía imitar los sesgos y hábitos específicos de personas individuales.
5. Los resultados: ¿Quién ganó?
Cerca de 15 equipos participaron en el concurso. Esto es lo que encontraron:
- El enfoque de "Gran Cerebro": Los equipos principales utilizaron Modelos de Lenguaje Extensos (LLMs) —el mismo tipo de IA superinteligente que escribe ensayos y chatea contigo—. Estos modelos fueron muy buenos analizando ejemplos de cómo votaron diferentes personas y copiando ese patrón.
- El enfoque de "Pequeño pero Poderoso": Algunos equipos utilizaron modelos más pequeños y especializados. Estos hicieron sorprendentemente bien en los conjuntos de datos más pequeños y complicados.
- El ingrediente secreto: Los sistemas ganadores no solo miraban el texto; miraban a quién estaba escribiendo el texto. Utilizaron pistas como la edad, el género o el historial de votación anterior del anotador para hacer mejores conjeturas.
- El "bono de explicación": En el juego de la lógica, los equipos que alimentaron a la IA con las explicaciones que la gente escribió (no solo las respuestas) funcionaron mucho mejor. Es como entender por qué alguien votó, no solo cómo votó.
6. El inconveniente (limitaciones)
Los autores son honestos sobre lo que no probaron:
- El problema de la "Nueva Cara": En el mundo real, podrías conocer a un extraño cuya opinión nunca has visto antes. En este concurso, la IA fue probada con personas que ya había "conocido" durante el entrenamiento. Aún no sabemos si estos modelos pueden manejar a una persona completamente nueva.
- Solo texto: El concurso fue solo sobre leer y escribir. No sabemos si estos métodos funcionan para imágenes, videos o voz.
Resumen
Este artículo es una boleta de calificaciones de un concurso que enseñó a la IA a dejar de pretender que todos están de acuerdo. Al utilizar nuevos métodos de puntuación y centrarse en la realidad desordenada del desacuerdo humano, los ganadores demostraron que los mejores modelos de IA son aquellos que pueden mirar a una multitud, entender las diferentes voces dentro de ella y predecir la mezcla de opiniones en lugar de simplemente elegir a un único ganador.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.