← Últimos artículos
📈 economics

Same System, Opposite Verdicts: Metric Discretion in AI Ethics Audits and the Limits of Disclosure

Este artículo demuestra que la falta de métricas de equidad estandarizadas en la ética de la IA permite resultados de auditoría arbitrarios y contradictorios, argumentando que implementar requisitos de divulgación similares a las medidas de desempeño alternativo financieras —en lugar de exigir una única métrica correcta— puede reducir significamente esta discreción y mejorar la transparencia.

Autores originales: Shay Tsaban

Publicado 2026-08-12
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Shay Tsaban

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un juez en una sala de tribunal, pero en lugar de decidir la culpabilidad o inocencia, juzgas si un programa informático es justo. En el mundo de la Inteligencia Artificial (IA), la "equidad" no es un número único y simple como la altura o el peso. Es más bien como una receta. Puedes hacer un pastel que sepa dulce, o uno que sepa agrio, o uno que esté perfectamente equilibrado, dependiendo de qué ingredientes elijas y cuánto de cada uno añadas. De la misma manera, para medir si una IA es justa, tienes que elegir qué receta matemática usar. Tienes que decidir quién cuenta como un "grupo" para comparar, qué puntuación cuenta como un "aprobado" y qué fórmula matemática específica ejecutar.

Durante mucho tiempo, los expertos discutieron sobre cuál era la receta "correcta". Algunos decían: "Deberíamos observar cuántas personas son contratadas", mientras que otros decían: "No, deberíamos observar cuántas personas son rechazadas". Este artículo entra en esa cocina caótica para ver qué sucede cuando diferentes chefs usan diferentes recetas con los mismos ingredientes exactos. La gran pregunta es: ¿Importa qué receta elijas? La respuesta resulta ser un rotundo y estruendoso "Sí". Si cambias la receta, podrías cambiar el veredicto de "Esta IA es justa" a "Esta IA es sesgada", aunque el ordenador no haya cambiado absolutamente nada. Esto importa porque los gobiernos y las empresas están exigiendo ahora estas puntuaciones de equidad para tomar grandes decisiones sobre quién obtiene un préstamo, un trabajo o incluso la libertad en un tribunal. Si la puntuación depende enteramente de la receta que elegiste, y nadie te dice qué receta se utilizó, la puntuación podría carecer de sentido.


El Gran Truco de la Equidad de la IA

Este artículo es como un experimento masivo donde el autor, Shay Tsaban, actúa como un auditor superescrupuloso. Tomó cuatro sistemas de IA diferentes —una herramienta del mundo real utilizada en una cárcel de Florida para predecir si alguien volverá a delinquir, y tres famosos conjuntos de datos de prueba utilizados por científicos para comprobar el sesgo en ingresos, crédito y empleos. Luego, no se limitó a ejecutar un solo test. Ejecutó 91.572 versiones diferentes del test.

Piénsalo de esta manera: Imagina que tienes una caja gigante de Legos que representan un sistema de IA. El autor construyó una máquina que podía ensamblar todas las combinaciones posibles de "reglas de equidad" para ver qué tipo de torre construiría. Probó todas las formas defendibles de medir la equidad: cambiando la fórmula matemática, cambiando la puntuación de corte para un "aprobado", cambiando qué grupos de personas se comparaban e incluso cambiando el año específico de los datos utilizados.

El resultado impactante: El veredicto cambia
Lo más sorprendente que encontró el artículo es que, para cada uno de los sistemas probados, el resultado cambiaba de un lado a otro. En los 7 casos específicos que analizaron (como "acusados negros frente a blancos" o "hombres frente a mujeres"), la IA podía ser declarada "Justa" bajo un conjunto de reglas y "Injusta" bajo otro.

Se vuelve aún más loco. ¡A veces, el grupo etiquetado como "desfavorecido" (los que están siendo tratados injustamente) también cambiaba! Bajo una receta, la IA estaba perjudicando al Grupo A. Bajo una receta diferente, igualmente válida, la IA estaba perjudicando al Grupo B. El artículo encontró que las cifras reportadas podían oscilar de forma descontrolada, entre 6 y 30 veces más allá del "error de muestreo" normal (ese pequeño margen de error que esperamos simplemente por el azar). De hecho, la elección de qué fórmula matemática usar fue responsable del 45% de la diferencia en la puntuación final, mientras que el azar solo movió la aguja una fracción mínima.

El problema del "Lavado de Imagen de Equidad" (Fairwashing)
El artículo también analizó lo que las empresas y los gobiernos están haciendo actualmente. Leyeron 6.797 documentos públicos donde las organizaciones afirmaban haber auditado su IA. ¿El resultado? Casi nadie está jugando limpio con la información.

  • Solo 38 de esos casi 7.000 documentos proporcionaron un número específico de equidad.
  • De esos 38, ninguno explicó por qué eligieron esa receta matemática específica.
  • Ninguno mencionó qué otras recetas consideraron y rechazaron.
  • Ninguno comparó la puntuación actual con una puntuación del año anterior para ver si las cosas estaban mejorando o empeorando.

Es como si un chef te dijera: "Este pastel está delicioso", pero se negara a decirte si usó azúcar o sal, o si lo horneó durante 10 minutos o una hora. No puedes saber si el pastel es realmente bueno o si simplemente tuvo suerte con la receta.

La solución: La regla de la "Tarjeta de Receta"
Entonces, ¿cómo arreglamos esto? El artículo sugiere tomar prestado un truco del mundo de las finanzas. En contabilidad, las empresas tienen permitido reportar "ganancias ajustadas" (su propia versión de beneficios), pero deben mostrar una tabla de "reconciliación" que explique exactamente cómo llegaron a ese número a partir del beneficio estándar.

El autor realizó una simulación para ver qué pasaría si los auditores de IA tuvieran que hacer lo mismo. Encontró que si los auditores simplemente tuvieran que escribir cuatro cosas:

  1. Qué familia matemática eligieron (la receta).
  2. Las reglas específicas que utilizaron (los ingredientes).
  3. A quién compararon (los comensales).
  4. Si mantuvieron las reglas iguales a lo largo del tiempo (consistencia).

...este simple proceso de divulgación cerraría el 78% del "margen de maniobra". Haría que los resultados fueran mucho más consistentes y honestos sin necesidad de ponerse de acuerdo sobre cuál es la única receta "correcta". Mejor aún, si también reportaran cómo cambió la puntuación a lo largo del tiempo, cerrarían el 82% del margen de maniobra.

La conclusión final
El artículo concluye que no necesitamos resolver el imposible problema matemático de encontrar la definición "perfecta" de equidad para arreglar este lío. Solo necesitamos dejar de ocultar las elecciones. Si un sistema de IA puede ser juzgado como "justo" o "injusto" simplemente cambiando la regla con la que se mide, entonces la regla misma debe ser parte del informe.

En este momento, el problema "residual" —ese pequeño margen de maniobra que queda incluso después de obligar a la gente a escribir sus elecciones— es de aproximadamente 0,16 en la escala. Ese es el límite de lo que la transparencia puede arreglar. Pero el artículo demuestra que la gran mayoría de la confusión proviene de que la gente no nos dice qué reglas siguió. Al obligarlos a mostrar su trabajo, podemos detener el juego de "Mismo Sistema, Veredictos Opuestos" y empezar a obtener respuestas reales.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →