← Últimos artículos
🤖 machine learning

Benchmarking non-conformity score functions in conformal prediction

Este artículo ofrece una visión general e introduce modificaciones a las funciones de puntuación de no conformidad en la predicción de conformidad, proponiendo un nuevo método de evaluación para medir su eficacia en la generación de conjuntos de predicción, particularmente en condiciones de desequilibrio de clases.

Autores originales: Sol Erika Boman

Publicado 2026-05-26
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Sol Erika Boman

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Imagen: De "Adivinar Una Cosa" a "Hacer una Lista Segura"

Imagina que estás jugando a "Adivina el Animal". Un modelo de aprendizaje automático estándar es como un amigo seguro de sí mismo que señala una imagen y dice: "Eso es definitivamente un Gato". A veces tienen razón, pero a veces se equivocan, y nunca admiten incertidumbre.

La Predicción Conformal es un enfoque diferente. En lugar de adivinar solo un animal, el modelo te da una lista de posibilidades. Podría decir: "Es probable que sea un Gato, pero también podría ser un Perro o un Zorro".

La magia de este método es que garantiza una red de seguridad. Si le dices al modelo: "Quiero estar un 95% seguro de que mi respuesta está en la lista", el modelo ajustará el tamaño de su lista para asegurar que, con el tiempo, el animal real esté dentro de esa lista el 95% de las veces.

El Problema: ¿Qué Tamaño Debe Tener la Lista?

El artículo plantea una pregunta crucial: ¿Cómo decidimos qué va en esa lista?

Si la lista es demasiado pequeña (por ejemplo, solo "Gato"), podrías perder la respuesta real. Si la lista es demasiado grande (por ejemplo, "Gato, Perro, Zorro, Hámster, Pez Payaso"), estás a salvo, pero la lista es inútil porque incluye todo.

La herramienta que usa el modelo para decidir qué poner en la lista se llama Puntuación de No Conformidad. Piensa en esta puntuación como un "Medidor de Extrañeza".

  • Puntuación Baja: El punto de datos parece muy normal para esa clase (por ejemplo, una imagen esponjosa parece mucho un Gato).
  • Puntuación Alta: El punto de datos parece extraño o "no conforme" para esa clase (por ejemplo, una imagen de una roca parece muy extraña si intentas llamarla Gato).

El objetivo del artículo fue probar diferentes tipos de "Medidores de Extrañeza" para ver cuál crea las listas más útiles (listas que son pequeñas pero aún seguras).

Los "Medidores de Extrañeza" Probados

Los autores probaron varias formas de medir la "extrañeza" en diferentes tipos de datos (como imágenes de animales). Aquí están los principales que compararon, usando analogías:

  1. Distancia de Etiqueta (El "Medidor de Práctica de Tiro"):

    • Cómo funciona: Mide qué tan lejos está la suposición del modelo de la respuesta "perfecta". Imagina lanzar un dardo a un blanco. Si el dardo está cerca del centro, la puntuación es baja (no es extraño). Si está lejos, la puntuación es alta.
    • Hallazgo del Artículo: Esto funcionó muy bien, especialmente al usar una forma específica de medir la distancia llamada "Distancia Coseno" (que observa la dirección de la suposición en lugar de solo la distancia bruta).
  2. Distancia de Margen (El "Medidor de Patrulla Fronteriza"):

    • Cómo funciona: En lugar de medir la distancia a la respuesta perfecta, mide qué tan cerca está la suposición del borde entre dos respuestas. Si estás parado justo en la línea entre "Gato" y "Perro", estás muy confundido (alta extrañeza). Si estás profundo en el territorio del "Gato", estás seguro (baja extrañeza).
    • Hallazgo del Artículo: Este fue un desempeño estelar, a menudo creando las listas más pequeñas y eficientes, especialmente al observar los números crudos antes de convertirlos en porcentajes.
  3. Distancia Media (El "Medidor de Abrazo de Grupo"):

    • Cómo funciona: Compara una nueva imagen con el "promedio" de todas las imágenes que ha visto antes para esa clase. Si una nueva imagen de gato parece el gato promedio, es una buena coincidencia. Si parece un perro, es extraño.
    • Hallazgo del Artículo: Este fue el mejor método para conjuntos de datos complejos con muchas categorías (como CIFAR100).
  4. APS/RAPS/SAPS (Los "Medidores de Clasificación"):

    • Cómo funciona: Estos son métodos más complejos que observan la clasificación de las respuestas. Dicen: "Agreguemos la suposición principal, luego la segunda, luego la tercera..." hasta que nos sintamos lo suficientemente seguros para detenernos. Agregan algunos trucos matemáticos (regularización) para evitar que las listas se vuelvan demasiado grandes.
    • Hallazgo del Artículo: Estos fueron buenos, pero a menudo crearon listas ligeramente más grandes que los medidores de "Distancia". Curiosamente, el artículo descubrió que el "ruido" aleatorio que generalmente se agrega a estos métodos para hacerlos justos en realidad no era necesario para la garantía de seguridad; un número fijo simple funcionaba igual de bien.
  5. Distancia de Gradiente/Característica (Los "Medidores de Inmersión Profunda"):

    • Cómo funciona: Estos intentan medir la extrañeza profundamente dentro del cerebro de la computadora (las capas de características) en lugar de solo en la salida final.
    • Hallazgo del Artículo: Estos fueron computacionalmente pesados (lentos) y no siempre funcionaron mejor que los métodos más simples.

La Prueba "Injusta": Clases Desequilibradas

Los autores también probaron qué sucede cuando los datos son injustos. Imagina un conjunto de datos donde el 90% de las imágenes son Gatos y solo el 1% son Tigres.

  • El Desafío: El modelo es excelente detectando Gatos pero terrible detectando Tigres.
  • El Resultado: Cuando se obliga al modelo a estar un 95% seguro, a menudo incluye al "Tigre" en la lista para casi cada imagen individual, incluso si la imagen es claramente un Gato.
  • ¿Por qué? El modelo está tan inseguro sobre los Tigres que juega a lo seguro. Es como un guardia de seguridad que tiene tanto miedo de perderse un tigre que detiene a todos los que entran al edificio. El artículo señala que, aunque esto hace que la predicción sea "honesta" (admite que no sabe), hace que la lista sea enorme y menos útil para los elementos comunes.

Las Conclusiones Principales

  1. No Hay un Único Ganador: No existe un "Medidor de Extrañeza" "mejor" para cada situación.
    • Para tareas simples, la Distancia de Etiqueta o la Distancia de Margen funcionaron mejor.
    • Para tareas complejas con muchas categorías, la Distancia Media fue la campeona.
  2. La Dirección Importa: Usar la Distancia Coseno (midiendo el ángulo/dirección de los datos) a menudo fue mejor que la distancia estándar, especialmente en espacios de alta dimensión (como los modelos de aprendizaje profundo).
  3. La Simplicidad Gana: Los métodos más complejos (como los gradientes de características profundas) no necesariamente dieron mejores resultados y fueron mucho más lentos.
  4. La Arquitectura Importa: El tipo de modelo informático utilizado (por ejemplo, ResNet vs. EfficientNet) cambió qué "Medidor de Extrañeza" funcionó mejor, lo que sugiere que la elección del medidor depende del modelo específico que estés utilizando.

En resumen, el artículo proporciona un "menú" de herramientas para construir listas de IA más seguras. Muestra que al elegir el "Medidor de Extrañeza" correcto para tu problema específico, puedes mantener tus listas de predicción pequeñas y útiles sin sacrificar la seguridad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →