← Últimos artículos
💬 NLP

Compared to What? Baselines and Metrics for Counterfactual Prompting

Este artículo sostiene que las evaluaciones estándar de la sensibilidad a la formulación de contrafactuales a menudo atribuyen erróneamente la sensibilidad del modelo a factores específicos porque no tienen en cuenta la sensibilidad general a los cambios en la forma superficial, proponiendo un marco robusto que compara las intervenciones objetivo con líneas base de parafraseo para distinguir los efectos reales del ruido incidental.

Autores originales: Zihao Yang, Mosh Levy, Yoav Goldberg, Byron C. Wallace

Publicado 2026-05-05
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Zihao Yang, Mosh Levy, Yoav Goldberg, Byron C. Wallace

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective tratando de averiguar si una pista específica (como el género de un paciente) está realmente influyendo en la decisión de un sospechoso (un modelo de IA). Cambias esa única pista en una historia y ves si el sospechoso cambia de opinión.

Este artículo argumenta que la mayoría de los detectives están cometiendo un error enorme: olvidan verificar si el sospechoso cambia de opinión simplemente porque reescribiste la historia, incluso si el significado permaneció igual.

Aquí tienes el desglose de los hallazgos del artículo usando analogías simples:

1. El Problema Central: La "Trampa de la Paráfrasis"

Imagina que estás probando si un juez tiene prejuicios contra las personas llamadas "Bob".

  • La Vieja Forma: Tomas un expediente sobre "Bob" y cambias el nombre por "Alice". El juez cambia su veredicto. Concluyes: "¡Ajá! El juez tiene prejuicios contra Bob".
  • La Perspectiva del Artículo: ¡Pero espera! ¿Y si el juez cambia su veredicto simplemente porque cambiaste las palabras en el expediente, y no el nombre? Quizás el juez odia las oraciones largas, o quizás se confunde con nuevas formulaciones.

Los autores llaman a esto la "Trampa de la Paráfrasis". Descubrieron que cuando simplemente reescribes una oración para significar exactamente lo mismo (una "paráfrasis benigna"), la IA cambia su respuesta con la misma frecuencia que cuando cambias quirúrgicamente un factor sensible como el género o la raza.

La Analogía:
Es como probar si un coche es sensible al color de la pintura.

  • Prueba Dirigida: Pintas el coche de rojo. El motor se cala. Piensas: "¡El rojo rompe el motor!".
  • La Verificación de la Realidad: Luego tomas un coche azul y lo repintas de azul (solo un tono diferente de azul, mismo significado). El motor también se cala.
  • Conclusión: El motor no es sensible al "rojo"; simplemente es sensible a que cualquiera toque la pintura.

2. La Solución: El "Grupo de Control" para la IA

Para solucionar esto, los autores proponen una nueva regla para probar la IA: Debes comparar tu "cambio especial" contra un "cambio aburrido".

  • El Cambio Especial: Cambiar "hombre" por "mujer" en una historia médica.
  • El Cambio Aburrido: Reescribir la historia usando palabras diferentes pero manteniendo el significado exacto (y cambiando el mismo número de letras/palabras).

Si la IA cambia de opinión tanto por el "cambio aburrido" como por el "cambio especial", entonces el "cambio especial" en realidad no hizo nada especial. Fue solo ruido.

3. Lo Que Encontraron (El Experimento "MedPerturb")

Los autores volvieron a un estudio famoso que afirmaba que los modelos de IA tenían fuertes prejuicios contra ciertos géneros en diagnósticos médicos. Volvieron a ejecutar las pruebas con su nuevo grupo de control de "cambio aburrido".

  • El Resultado: El "prejuicio" desapareció en gran medida.
  • La Conclusión: Cuando tuvieron en cuenta el hecho de que los modelos de IA son generalmente sensibles a cualquier cambio de texto, la sensibilidad específica al género desapareció. De 120 pruebas, solo 5 mostraron un efecto real, y esas estaban relacionadas con añadir lenguaje "colorido" (como signos de exclamación), no con el género.

Analogía: Es como darse cuenta de que una balanza no está rota porque pesa una pluma de manera diferente a una roca; es simplemente que la balanza oscila cada vez que la tocas. Los estudios anteriores pensaban que la balanza estaba rota para las plumas; los autores se dieron cuenta de que la balanza simplemente oscila para todo.

4. Mejores Herramientas para el Trabajo (La Analogía de la "Regla")

El artículo también argumenta que las herramientas que usan los investigadores para medir estos cambios a menudo son demasiado toscas.

  • La Herramienta Tosca (Métricas Agregadas): Imagina intentar medir el viento contando cuántas veces da vueltas una cometa. Si la cometa da una vuelta, dices "¡Viento!". Si no, dices "Sin viento". Esto pasa por alto la brisa sutil que hace que la cometa oscile sin dar vueltas.
    • Término del artículo: Tasa de inversión, Información Mutua.
  • La Herramienta Precisa (Métricas por Muestra): Imagina usar un anemómetro sensible que mide la velocidad exacta del viento, incluso si la cometa no da vueltas.
    • Término del artículo: Divergencia JSD, Divergencia KL.
  • La Herramienta Direccional (Regresión): Esto te dice no solo cuánto sopló el viento, sino hacia qué dirección sopló.
    • Término del artículo: Coeficientes de Regresión.

El Hallazgo: Las "Herramientas Precisas" (JSD/KL) y las "Herramientas Direccionales" (Regresión) son mucho mejores para encontrar prejuicios reales. Las "Herramientas Toscas" a menudo pasan por alto efectos pequeños pero reales o se confunden con desequilibrios de clases (como cuando el 99% de las respuestas son "Sí").

5. Un Ejemplo Real: La Prueba "Profesor vs. Enfermera"

Para demostrar que su método funciona, probaron un prejuicio conocido: la idea de que la IA asocia "Profesor" con hombres y "Enfermera" con mujeres.

  • Tomaron biografías de profesores y enfermeras e intercambiaron los géneros.
  • La Herramienta Tosca: Solo vio un cambio diminuto, casi invisible, en la respuesta final "Sí/No".
  • La Herramienta Precisa: Vio un cambio claro en la confianza interna de la IA.
  • La Herramienta Direccional: Confirmó que cambiar una biografía a "Mujer" redujo sistemáticamente la confianza de la IA en que la persona era un profesor.

Esto demostró que su método puede encontrar prejuicios reales cuando existen, pero filtra el "falso" prejuicio que fue causado simplemente por la IA estando nerviosa ante cambios de texto.

Resumen del Consejo del Artículo

Si quieres probar una IA por prejuicios, no cambies solo una palabra y veas qué pasa. Debes:

  1. Usar un Control: Compara tu cambio con una reescritura "aburrida" que cambie la misma cantidad de texto.
  2. Igualar el Tamaño: Asegúrate de que tu reescritura "aburrida" cambie el mismo número de palabras que tu cambio "especial".
  3. Usar Reglas Sensibles: No cuentes solo los cambios "Sí/No"; observa los cambios sutiles en la confianza de la IA.
  4. Verificar la Dirección: Usa matemáticas para ver si el cambio empuja a la IA en una dirección específica y sesgada.

La Conclusión Final: Muchos estudios anteriores afirmaron que la IA estaba sesgada porque no se dieron cuenta de que la IA simplemente estaba reaccionando al hecho de que el texto había sido tocado. Una vez que tienes en cuenta esa "sensibilidad al tacto", la evidencia de prejuicio a menudo desaparece, o se vuelve mucho más clara y específica.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →