← Últimos artículos
💬 NLP

Contrastive ESA: Human Evaluation of Multiple Translations at Once

El artículo presenta la Anotación de Intervalos de Error Contrastiva (cESA), un protocolo de evaluación humana que evalúa múltiples traducciones simultáneamente para reducir el ruido del anotador y el tiempo, produciendo al mismo tiempo puntuaciones de calidad absolutas para clasificaciones de modelos interpretables.

Autores originales: Vilém Zouhar, Roman Grundkiewicz, Sara Rajaee, Parker Riley, Martin Popel, Rachel Bawden, Philipp Koehn, Marine Carpuat, Tom Kocmi

Publicado 2026-07-30
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Vilém Zouhar, Roman Grundkiewicz, Sara Rajaee, Parker Riley, Martin Popel, Rachel Bawden, Philipp Koehn, Marine Carpuat, Tom Kocmi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un juez en un concurso de talentos masivo, pero en lugar de cantantes, juzgas traducciones de historias de un idioma a otro. Durante años, la forma estándar de hacer esto era entregar al juez una sola traducción, pedirle que la calificara de forma aislada y luego pasar a la siguiente. Es como pedirle a alguien que califique una manzana sin haber visto otras manzanas para comparar. ¿El problema? Es agotador, costoso y sorprendentemente desordenado. Cuando miras una sola cosa por separado, tu cerebro se cansa, tu estado de ánimo cambia y tus calificaciones pueden ser erráticas. Este es el mundo de la "Evaluación de la Traducción Automática", un campo dedicado a descubrir qué tan bien pueden los ordenadores traducir lenguajes humanos. El objetivo es simple: encontrar el mejor traductor de IA para que podamos confiar en él para tareas del mundo real. Pero para lograrlo, los humanos tienen que actuar como los árbitros, y las viejas reglas de arbitraje estaban haciendo que el juego fuera lento y las puntuaciones poco fiables.

Entra un equipo de investigadores que decidió cambiar las reglas del juego. Introdujeron un nuevo protocolo llamado Contrastive Error Span Annotation (cESA). En lugar de mostrar al juez una traducción a la vez, pusieron tres (o más) traducciones una al lado de la otra en la misma pantalla. Es como darle al juez una cesta de manzanas en lugar de una sola fruta. De repente, detectar una manzana con un golpe se vuelve mucho más fácil porque puedes ver las brillantes y perfectas justo al lado. Los investigadores descubrieron que este método de "visualización en grupo" no solo hizo a los jueces más rápidos, sino que también los hizo más consistentes y precisos. Descubrieron que mostrar tres traducciones a la vez era el punto ideal, ahorrando aproximadamente un 31% de tiempo mientras mejoraba la calidad de las puntuaciones. También se aseguraron de que ver las otras traducciones no engañara a los jueces para que fueran injustos, y descubrieron que el sesgo era tan minúsculo que no importaba. En resumen, demostraron que cuando dejas que los jueces comparen opciones juntas, todos obtienen un resultado mejor, más rápido y más justo.

La vieja forma: La manzana solitaria

Durante mucho tiempo, la forma estándar de probar los traductores de IA fue la "evaluación puntual" (pointwise evaluation). Imagina que estás calificando una pila de ensayos. En el método antiguo, tomarías un ensayo, lo leerías, le darías una nota, lo dejarías y luego tomarías el siguiente sin mirar atrás. Podrías darle al primer ensayo un 85 porque parecía bueno, pero luego podrías darle al segundo uno de 90, incluso si era peor, solo porque estabas cansado o porque el primero fue realmente malo. Esto se llama "ruido del anotador". Es como intentar juzgar la temperatura de una taza de café tocándola una vez, en una habitación fría, sin un termómetro. El artículo señala que este método sufre de un alto "ruido del anotador" y es muy costoso porque necesitas a muchos jueces para obtener un promedio confiable.

La nueva forma: La cesta de frutas

Los autores, liderados por Vilém Zouhar y sus colegas, propusieron un nuevo método llamado cESA. En lugar de mirar una traducción en el vacío, el anotador ve múltiples traducciones del mismo texto fuente al mismo tiempo. Piensa en ello como un enfoque de "cesta de frutas". Si ves una manzana ligeramente golpeada junto a una perfecta, notarás el golpe mucho más rápido que si estuvieras mirando la manzana golpeada sola.

En este nuevo sistema, el juez mira un texto fuente (como una frase de una historia) y ve, por ejemplo, tres traducciones de diferentes modelos de IA de esa frase, una al lado de la otra. Luego, el juez:

  1. Marca "intervalos de error" específicos (las palabras exactas que están mal).
  2. Decide si el error es "mayor" (un error grande) o "menor" (un pequeño desliz).
  3. Da una puntuación del 0% al 100% basada en una escala clara.

El artículo explica que esto funciona debido a un concepto psicológico llamado "evaluación conjunta frente a la evaluación separada". Cuando ves las cosas juntas, puedes detectar errores en una traducción comparándola con las otras. También te ayuda a comprender el "espacio de las posibles traducciones", haciendo que tu juicio sea más objetivo. Además, no tienes que volver a leer el texto fuente original una y otra vez por cada traducción, lo que ahorra una enorme cantidad de tiempo.

El experimento: Probando la cesta de frutas

Para ver si este nuevo método realmente funcionaba, los investigadores realizaron un experimento masivo utilizando traducciones de inglés a japonés. Probaron 12 modelos de IA diferentes (incluyendo nombres importantes como Gemini, Claude y DeepSeek) utilizando un conjunto de datos de 97 segmentos de noticias, redes sociales y vídeos.

Compararon la forma antigua (mostrar una traducción a la vez) con la nueva forma (mostrar 1, 2, 3 o 4 traducciones a la vez). Esto es lo que encontraron:

  • Velocidad: El nuevo método fue significativamente más rápido. Al mostrar tres modelos a la vez (el "punto ideal"), el tiempo promedio para anotar un segmento cayó de 77.8 segundos a 53.7 segundos. Eso es una reducción del 31% en el tiempo por elemento.
  • Calidad: Las puntuaciones fueron más estables. Los investigadores midieron la "concordancia entre anotadores" (cuánto coincidían dos jueces diferentes) y la "concordancia intra-anotador" (cuánto coincidía el mismo juez consigo mismo en un segundo intento). El nuevo método mostró una mayor concordancia, lo que significa que los jueces fueron más consistentes.
  • El número mágico: Probaron mostrando 1, 2, 3 y 4 modelos a la vez. Encontraron que mostrar 3 modelos era el mejor equilibrio. Pasar de 1 a 2 modelos ahorró mucho tiempo, pero añadir un 4º modelo no ahorró mucho más tiempo y, de hecho, hacía que la pantalla estuviera un poco demasiado abarrotada. Tres era el número perfecto para mantener a los jueces contentos y eficientes.

Abordando los "¿Y si...?": ¿Son los jueces sesgados?

Los investigadores temían que tal vez ver las otras traducciones engañara a los jueces. Se preguntaron: "Si una traducción realmente mala está sentada junto a una buena, ¿la buena parecerá demasiado buena? O si una excelente está junto a una mala, ¿la mala parecerá demasiado mala?".

Realizaron pruebas para comprobar dos tipos de sesgo:

  1. Sesgo de posición: ¿Recibe la traducción de la izquierda una mejor puntuación que la de la derecha? Los datos mostraron casi ninguna diferencia basada en la posición.
  2. Sesgo de entorno: ¿Cambia la puntuación de las otras al ver un "señuelo" (una traducción muy mala o muy buena)? Encontraron un efecto minúsculo: si un modelo estaba junto a un modelo mucho más fuerte, su puntuación bajaba aproximadamente 0.5 puntos en promedio. Sin embargo, los autores señalan que esto es tan pequeño comparado con las diferencias reales entre modelos (que pueden ser de 10 o 20 puntos) que realmente no importa. Es como si un corredor termina 10 segundos detrás del ganador; no importa si terminó 0.5 segundos más lento porque estaba parado junto a un campeón mundial.

El veredicto

El artículo concluye que cESA es una mejor forma de juzgar los traductores de IA. Es más rápido, más barato y produce puntuaciones más fiables. Los autores sugieren que cualquiera que realice la evaluación humana de traducciones debería cambiar a mostrar tres modelos a la vez. Incluso crearon una herramienta sencilla (llamada Pearmut) que cualquiera puede usar para ejecutar este nuevo protocolo, completa con tutoriales y guías.

Al final, el artículo sugiere que, al dejar que los jueces comparen manzanas en una cesta en lugar de una por una, obtenemos una imagen mucho más clara de qué IA es verdaderamente la mejor. Es un cambio simple en cómo miramos el trabajo, pero hace que todo el proceso de juzgar máquinas sea mucho más inteligente y amigable para los humanos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →