← Últimos artículos
📊 statistics

On the Epistemic Uncertainty of Overparametrized Neural Networks

Este artículo desafía la visión convencional de que la incertidumbre epistémica desaparece con más datos al demostrar que, en redes neuronales sobreparametrizadas, la no identificabilidad debida a simetrías y representaciones redundantes conduce a una incertidumbre paramétrica persistente incluso cuando la función subyacente está completamente identificada, un fenómeno que los autores analizan teóricamente y validan empíricamente en redes ReLU de una sola capa oculta.

Autores originales: David Rügamer

Publicado 2026-05-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: David Rügamer

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: El Problema de "Muchas Llaves, Una Puerta"

Imagina que tienes una cerradura muy compleja (el problema del mundo real) y un llavero masivo con miles de llaves (la red neuronal). Por lo general, pensamos que si tenemos suficientes datos, podemos encontrar la llave perfecta que abre la cerradura, y estaremos 100% seguros de haberla encontrado.

Este artículo argumenta que, para las redes neuronales modernas "sobredimensionadas" (redes con muchas más llaves de las necesarias), esto no es cierto. Incluso con datos infinitos, es posible que nunca sepas exactamente qué llave específica estás sosteniendo. Solo sabes que la puerta está abierta.

Los autores llaman a esto Incertidumbre Epistémica (incertidumbre sobre lo que sabemos). Demuestran que, incluso cuando la red conoce la respuesta perfectamente, sigue confundida sobre cómo llegó a esa respuesta, porque hay muchas formas diferentes de construir la misma solución.


Analogía 1: El Director de Orquesta (Simetría de Permutación)

Imagina a un director dirigiendo una orquesta. La música (la predicción) es perfecta.

  • El Problema: La sección de violines tiene 100 músicos. Si el Músico #1 cambia de asiento con el Músico #50, la música suena exactamente igual.
  • La Confusión: Si le preguntas al director: "¿Quién está tocando el primer violín?" y él responde: "Es el Músico #1", podrías pensar que está 100% seguro. Pero en realidad, el Músico #50 podría haber estado tocando ese papel, y la música seguiría siendo perfecta.
  • El Hallazgo del Artículo: En la estadística estándar, asumimos que con suficiente práctica (datos), el director sabrá exactamente quién está sentado dónde. Pero en estas redes gigantes, el director nunca puede estar seguro del plano de asientos, incluso si la música es impecable. La incertidumbre sobre quién está tocando (los parámetros) permanece, aunque la canción (la función) se conozca perfectamente.

Analogía 2: El Corte de la Pizza (No Identificabilidad Continua)

Ahora, imagina que la red es aún más grande de lo necesario. Tiene "neuronas" extra (chefs extra) que no son estrictamente necesarias.

  • El Escenario: Necesitas hornear una pizza que requiere exactamente 100 gramos de queso.
  • La Confusión:
    • Escenario A: Un chef pone los 100g completos en la pizza.
    • Escenario B: Dos chefs ponen 50g cada uno.
    • Escenario C: Diez chefs ponen 10g cada uno.
    • Escenario D: El Chef A pone 99g, el Chef B pone 1g.
  • El Hallazgo del Artículo: La red puede lograr exactamente la misma pizza (la misma predicción) dividiendo el "queso" (el peso) entre los chefs extra de infinitas formas diferentes.
    • A diferencia de la orquesta donde la gente solo cambia de asiento, aquí los chefs están discutiendo constantemente sobre cómo dividir el queso.
    • El artículo demuestra que, incluso con datos infinitos, la red no se asienta en una forma específica de dividir el queso. En cambio, deambula por una "variedad" (una superficie suave de posibilidades) donde la cantidad total de queso es siempre 100g, pero las cantidades individuales siguen cambiando.

¿Por Qué Importa Esto? (La Sección "Por Qué Fallan las Medidas Comunes")

Por lo general, cuando los científicos miden qué tan "incierta" es un modelo, miran cuánto cambia la salida.

  • La Vieja Visión: "Si el modelo da la misma respuesta cada vez, no es incierto".
  • La Visión del Artículo: "Eso es incorrecto. El modelo podría dar la misma respuesta, pero los engranajes internos (los pesos) están girando salvajemente en direcciones diferentes".

Los autores muestran que si solo miras la respuesta final (la pizza), te pierdes el hecho de que la maquinaria interna es caótica. Esto importa si necesitas saber cómo funciona el modelo (para cosas como la depuración, la compresión o entender qué características son importantes), no solo cuál es la respuesta.

¿Qué Hicieron?

  1. La Teoría: Utilizaron matemáticas para demostrar que, para redes neuronales simples (redes ReLU), este "dividir" y "cambiar" crea una niebla permanente de incertidumbre dentro del cerebro del modelo, incluso cuando el modelo es perfecto en su trabajo.
  2. Las Matemáticas: Describieron esta niebla utilizando formas llamadas variedades. Piénsalo como una hoja de papel lisa y plana flotando en una habitación tridimensional. Los pesos del modelo pueden deslizarse en cualquier lugar de esa hoja sin cambiar el resultado.
  3. Los Experimentos: Construyeron estas redes y las ejecutaron en computadoras. Observaron cómo se movían los "pesos" (los números internos).
    • Resultado 1: Las redes mejoraron en la predicción a medida que veían más datos.
    • Resultado 2: Pero los pesos internos nunca dejaron de moverse. Siguiendo deslizándose por esas "hojas" (variedades) y cambiando de lugar, demostrando que la incertidumbre sobre la estructura interna nunca desapareció.
  4. El Problema del Muestreo: También examinaron cómo las computadoras intentan "explorar" estas redes (usando un método llamado MCMC). Descubrieron que si inicias una simulación por computadora en un "plano de asientos" específico (una permutación), generalmente se queda atrapada allí y nunca salta a las otras disposiciones equivalentes, aunque todas sean válidas. Esto significa que los métodos informáticos estándar podrían perderse la imagen completa de la incertidumbre.

La Conclusión

El artículo afirma que las redes neuronales sobredimensionadas tienen una incertidumbre oculta y permanente sobre su propia estructura interna.

  • Espacio de Funciones (La Salida): El modelo se vuelve seguro. Conoce la respuesta.
  • Espacio de Parámetros (Los Pesos Internos): El modelo permanece incierto. No sabe qué combinación específica de números está usando para obtener esa respuesta, porque hay millones de combinaciones igualmente buenas.

Esto es como un chef maestro que puede cocinar un plato perfecto, pero si le preguntas: "¿Usaste 2 cucharaditas de sal o 1 cucharadita de sal y 1 cucharadita de salsa de soja?", no puede decirte, porque ambas recetas saben exactamente igual. El artículo argumenta que debemos dejar de fingir que el chef conoce la receta exacta solo porque la comida sabe bien.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →