← Últimos artículos
🤖 machine learning

Using predictive multiplicity to measure individual performance within the AI Act

Este artículo sostiene que la multiplicidad predictiva —la existencia de múltiples modelos con una precisión similar pero con predicciones individuales contradictorias— contradice los requisitos de la Ley de IA de la UE para los sistemas de alto riesgo, y propone métricas específicas y directrices de notificación para cuantificar y divulgar tales desacuerdos a fin de garantizar el cumplimiento y la fiabilidad.

Autores originales: Karolin Frohnapfel, Mara Seyfert, Sebastian Bordt, Ulrike von Luxburg, Kristof Meding

Publicado 2026-06-23
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Karolin Frohnapfel, Mara Seyfert, Sebastian Bordt, Ulrike von Luxburg, Kristof Meding

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás solicitando un préstamo, un empleo o un tratamiento médico. Esperas que el sistema informático que decide tu destino sea una bola de cristal que ve la verdad perfectamente. Pero, ¿y si esa bola de cristal no es un objeto único? ¿Y si en realidad es una caja llena de diferentes bolas de cristal, todas fabricadas por la misma empresa, todas afirmando tener un 95% de precisión, pero todas te dicen algo ligeramente distinto sobre tu situación específica?

Este es el problema central que aborda el artículo "Using predictive multiplicity to measure individual performance within the AI Act" (Usar la multiplicidad predictiva para medir el rendimiento individual dentro de la Ley de IA). Aquí presento un desglose sencillo de su argumento, utilizando analogías cotidianas.

1. El Problema: El Efecto "Rashomon"

En el mundo de la IA, existe un fenómeno llamado Multiplicidad Predictiva. Piensa en ello como un grupo de jueces expertos analizando el mismo expediente.

  • El Escenario: Tienes 100 jueces expertos. Todos coinciden en el 90% de los casos. Todos son "precisos" en términos generales.
  • El Giro: Cuando observan tu caso específico, 50 jueces dicen "Sí" y 50 jueces dicen "No".
  • La Realidad: Debido a que no existe un único modelo "mejor", el proveedor de la IA podría haber elegido fácilmente un modelo diferente de su caja de herramientas que te habría dado el resultado opuesto, aun cuando ese modelo fuera igual de "preciso" en general.

Los autores argumentan que esta arbitrariedad es peligrosa. Si tu vida depende de la decisión, no debería importar qué modelo de los "igualmente buenos" eligió la computadora por azar. Si los modelos no se ponen de acuerdo contigo, el sistema está, esencialmente, lanzando una moneda al aire para tu caso específico.

2. La Ley: La Ley de IA de la UE

El artículo analiza este problema a través de la lente de la Ley de IA de la UE, una nueva ley en Europa que regula la IA de alto riesgo (como la contratación, la atención médica o los préstamos).

  • El Requisito: La ley establece que las empresas que construyen estos sistemas de IA deben demostrar que son precisos.
  • La Brecha: Normalmente, las empresas solo dicen: "Nuestro sistema tiene un 90% de precisión en el conjunto de datos completo".
  • La Perspectiva del Artículo: La ley exige en realidad que los proveedores informen sobre personas específicas, no solo sobre el promedio del grupo. Los autores argumentan que si diferentes modelos "buenos" discrepan sobre una persona específica, el sistema no es fiable para esa persona, incluso si la puntuación general parece excelente.

3. La Solución: Medir el "Desacuerdo"

Para solucionar esto, los autores proponen una nueva forma de medir el rendimiento. En lugar de preguntar simplemente "¿Es correcto el modelo?", preguntan: "¿Qué tanto discrepan los otros modelos buenos con este?"

Introducen dos herramientas (métricas) sencillas para medir esto:

  • El Ratio de Conflicto (El medidor de "Tira y Afloja"):
    Imagina un juego de tirar de la cuerda para tu caso específico. Si 100 modelos están tirando de la cuerda, ¿cuántos tiran hacia el "Sí" frente al "No"?

    • Si 99 tiran hacia el "Sí" y 1 tira hacia el "No", el conflicto es bajo. Puedes confiar en el "Sí".
    • Si 50 tiran hacia el "Sí" y 50 tiran hacia el "No", el conflicto está en su máximo. El sistema está confundido respecto a ti.
    • El Objetivo: Si el ratio de conflicto es alto, el sistema debería marcar a esa persona para que un humano la revise, en lugar de dejar que la computadora decida.
  • La δ\delta-Ambigüedad (El "Conteo de Confusión"):
    Esta es una forma de contar cuántas personas en todo el grupo se encuentran en este estado de "confusión". Ayuda a la empresa a ver si su sistema es generalmente fiable o si es un caos para una gran parte de la gente.

4. Cómo hacerlo: El enfoque "Ad-Hoc"

Podrías pensar: "Para encontrar todos estos modelos diferentes, ¡necesito probar millones de ellos!". Eso tomaría una eternidad.
Los autores encontraron un atajo inteligente. No necesitas probar todos los modelos posibles. Solo necesitas entrenar un pequeño grupo de modelos realizando cambios mínimos y aleatorios en el proceso, como:

  • Cambiar ligeramente el orden de los datos.
  • Añadir un poco de "ruido" (aleatoriedad) a los números.
  • Usar configuraciones ligeramente diferentes (como cambiar la temperatura de una estufa).

Probaron esto y descubrieron que incluso un pequeño grupo de modelos entrenados de esta manera es suficiente para revelar dónde está confundido el sistema. Es como pedir a varios chefs diferentes que cocinen el mismo plato con ingredientes ligeramente distintos; si todos están de acuerdo con el sabor, estás bien. Si discuten, sabes que algo pasa.

5. La Recomendación: Un apretón de manos entre el Creador y el Usuario

El artículo concluye con una sugerencia práctica de cómo debería funcionar la Ley de IA en la vida real:

  1. Para los Creadores de IA (Proveedores): No entreguen solo un modelo de "caja negra". Entreguen a las personas que usan el sistema (los Implementadores) un "kit de herramientas" de varios modelos igualmente buenos.
  2. Para los Usuarios de IA (Implementadores): Antes de tomar una decisión final sobre una persona, verifiquen el "Ratio de Conflicto".
    • Conflicto Bajo: Los modelos están de acuerdo. Proceda con la decisión automatizada.
    • Conflicto Alto: Los modelos están peleando. Deténgase. Involucre a un humano para que tome la decisión final.

Resumen

El artículo sostiene que la precisión no es solo un número; es una historia sobre la consistencia. Si un sistema de IA no puede estar de acuerdo consigo mismo respecto a ti, no debería tener permitido tomar una decisión que cambie tu vida sin que un humano vigile su actuación. Al medir cuánto discrepan diferentes modelos "buenos", podemos hacer que la IA sea más segura y confiable bajo las nuevas leyes europeas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →