← Últimos artículos
🤖 machine learning

Evaluating Epistemic Uncertainty: Beyond OOD Detection and Active Learning

Este artículo propone un marco de teoría de la decisión para evaluar la incertidumbre epistémica basado en la minimización del arrepentimiento en lugar de las tareas de aproximación tradicionales, demostrando que las métricas de correlación estándar no logran predecir la utilidad operativa y revelando discrepancias significativas entre las clasificaciones de los métodos de incertidumbre de la teoría de la decisión y las de las tareas de aproximación.

Autores originales: Jakub Paplhám, Willem Waegeman, Eyke Hüllermeier, Vojtěch Franc

Publicado 2026-07-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jakub Paplhám, Willem Waegeman, Eyke Hüllermeier, Vojtěch Franc

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres el capitán de una nave espacial navegando a través de una nebulosa caótica. La computadora de tu nave es increíblemente inteligente, pero necesita reportarte dos tipos distintos de "incertidumbre". El primero es la incertidumbre aleatoria: es la "niebla de guerra"; el ruido en los sensores, la estática en la radio, el hecho de que la propia nebulosa es simplemente desordenada e impredecible. No importa qué tan buena sea tu computadora, ese ruido siempre estará ahí; es el caos irreducible del universo. La segunda es la incertidumbre epistémica: es la "ignorancia" de la computadora. Es la sensación que tiene la computadora cuando observa una región del espacio que nunca ha visto y piensa: "No tengo idea de qué hay ahí fuera porque no he estudiado esta región todavía". Este tipo de incertidumbre es reducible; si la computadora aprende más, este temor desaparece.

Durante mucho tiempo, los científicos que intentaban construir una mejor IA se obsesionaron con enseñar a las computadoras a distinguir entre la "niebla" y su propia "ignorancia". ¿Por qué? Porque si una computadora sabe que es ignorante, puede decir: "No lo sé, no me preguntes", y así evitar un error peligroso. Pero aquí está la parte difícil: ¿cómo pruebas si una computadora es realmente buena detectando su propia ignorancia? Tradicionalmente, los investigadores han utilizado dos "pruebas de proximidad" principales. Una es la detección de datos fuera de distribución (OOD), que pregunta: "¿Puedes notar cuando estás viendo algo totalmente extraño que nunca habías visto?". La otra es el Aprendizaje Activo, que pregunta: "Si pudieras elegir una nueva pieza de datos para estudiar, ¿cuál te enseñaría más?". La gran pregunta es: ¿estos tests realmente nos dicen si una computadora es buena detectando su propia ignorancia, o solo están probando algo completamente distinto?

Este artículo, titulado "Evaluating Epistemic Uncertainty: Beyond OOD Detection and Active Learning", argumenta que hemos estado jugando el juego equivocado. Los autores, un equipo de investigadores de universidades de Praga, Gante y Múnich, descubrieron que la "respuesta perfecta" matemática para detectar datos extraños (OOD) o para elegir el mejor material de estudio (Aprendizaje Activo) es en realidad completamente diferente de la "respuesta perfecta" para detectar la ignorancia (Regret/Arrepentimiento).

Para entender esto, imagina que eres un profesor calificando a un estudiante.

  • La prueba OOD es como preguntarle al profesor: "¿Puedes notar si esta pregunta fue escrita por un alienígena?". La respuesta perfecta depende solo de cómo se ve la pregunta, no de si el estudiante sabe la respuesta.
  • La prueba de Aprendizaje Activo es como preguntar: "¿Qué pregunta deberíamos hacer a continuación para ayudar al estudiante a aprender más?". La respuesta perfecta depende de cuánto mejorará el conocimiento futuro del estudiante.
  • La prueba de Regret (Epistemic Uncertainty) es preguntar: "Para esta pregunta específica en este momento, ¿qué tan probable es que el estudiante se equivoque porque simplemente no conoce el material?".

El artículo demuestra matemáticamente que estas tres "respuestas perfectas" a menudo apuntan a lugares completamente diferentes. Una computadora puede ser increíble detectando preguntas alienígenas (OOD), pero terrible en saber cuándo está a punto de fallar en un problema matemático específico (Regret). De hecho, los autores construyeron un mundo de "sandbox" unidimensional simple (inspirado en una función llamada función de Rossellini) para mostrar que la mejor estrategia para la detección de OOD podría indicarte que rechaces una región específica del espacio, mientras que la mejor estrategia para minimizar el regret te diría que aceptes esa misma región. Son fundamentalmente desalineadas.

Debido a este desajuste, los autores argumentan que usar la detección de OOD o el Aprendizaje Activo como una "proximidad" para juzgar qué tan bien una modelo entiende su propia ignorancia es erróneo. Muestran que los métodos que ocupan el puesto #1 en pruebas OOD pueden ocupar el puesto #10 en pruebas de regret, y viceversa. Por ejemplo, en sus pruebas con el conjunto de datos CIFAR-10H (una colección de imágenes con muchas opiniones humanas sobre lo que son), un método llamado "Redes Evidenciales" fue terrible detectando datos extraños (OOD), pero fue el mejor de todos identificando cuándo era ignorante y propenso a cometer un error. Por el contrario, los "Ensembles Profundos" (Deep Ensembles) fueron excelentes detectando datos extraños, pero fallaron en minimizar el regret.

El artículo también aborda una idea popular en el campo llamada "desentrelazamiento" (disentanglement). Recientemente, algunos investigadores argumentaron que si el puntaje de "niebla" de una computadora y su puntaje de "ignorancia" están altamente correlacionados (suben y bajan juntos), la computadora ha fallado en separar ambos conceptos. Los autores desafían esto. Muestran que, incluso si los puntajes están altamente correlacionados, la computadora aún podría tomar decisiones perfectas. En lugar de solo verificar si los puntajes están correlacionados, proponen una prueba más práctica: el Pareto-gap.

Piensa en el Pareto-gap como un "mapa de decisiones". Imagina un gráfico 3D donde puedes intercambiar cuántas preguntas respondes (Cobertura), cuántos errores cometes (Riesgo) y cuánta "ignorancia" evitas (Regret). La computadora "perfecta" dibuja una curva suave e ideal en este mapa. Los autores miden qué tan cerca está la curva de una computadora real de esa línea perfecta. Descubrieron que los métodos con alta correlación entre sus puntajes (que algunos pensaban que eran malos) podían, de hecho, dibujar curvas muy cerca de la línea perfecta, lo que significa que eran operativamente útiles.

En resumen, los autores demuestan que no podemos simplemente observar qué tan bien una modelo detecta datos extraños o elige temas de estudio para ver si entiende su propia ignorancia. Proporcionan un nuevo marco que trata la incertidumbre como una herramienta para tomar mejores decisiones, mostrando que las formas antiguas de probarla nos están llevando a menudo a las conclusiones equivocadas sobre qué modelos de IA son realmente seguros y confiables. Sus hallazgos se basan en pruebas matemáticas rigurosas y extensos benchmarks en conjuntos de datos del mundo real con anotaciones humanas densas, sugiriendo que el campo necesita dejar de depender de estos tests de proximidad convenientes pero engañosos y comenzar a medir la incertidumbre basándose en el regret real que ayuda a evitar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →