← Últimos artículos
💻 computer science

Distributional Neurons: Making Uncertainty a Unit of Computation

El artículo presenta EVE, una neurona variacional que trata la incertidumbre como un primitivo computacional mediante la propagación de estados latentes distribucionales, demostrando que este enfoque a nivel de neurona mejora la calibración de la incertidumbre y el rendimiento tanto en arquitecturas MLP densas como en Transformers, manteniendo al mismo tiempo una precisión de punto competitiva.

Autores originales: YVES RUFFENACH

Publicado 2026-07-21
📖 7 min de lectura🧠 Análisis profundo

Autores originales: YVES RUFFENACH

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La vida secreta de una célula cerebral

Imagina que estás intentando enseñar a un ordenador a reconocer un gato en una foto. Construyes un cerebro digital hecho de capas de procesadores diminutos y sencillos llamados "neuronas". En la versión estándar de estos cerebros digitales, cada neurona actúa como un robot rígido y de visión única. Recibe información, procesa los números y escupe una única respuesta definitiva: un número específico. Si el robot dice "0.8", esa es la única verdad que conoce. No sabe si está adivinando, si la imagen está borrosa o si simplemente tiene un mal día. Es un mundo de certeza absoluta, incluso cuando el mundo es caótico.

Pero la vida real está llena de "tal vez". Cuando miras una forma borrosa en la niebla, no ves simplemente "gato" o "no gato"; sientes una ligera inseguridad. Los científicos han intentado durante mucho tiempo enseñar a los ordenadores a sentir esa incertidumbre, generalmente sacudiendo todo el cerebro o añadiendo capas extra de duda al final. Sin embargo, un nuevo estudio sugiere que podríamos estar mirando el problema desde el ángulo equivano. En lugar de hacer que todo el cerebro sea inseguro, ¿qué pasaría si hiciéramos que los propios bloques de construcción diminutos e individuales fueran inseguros? Esta investigación plantea una pregunta sencilla y lúdica: ¿Qué pasaría si cada una de las neuronas de este cerebro digital no fuera un robot rígido, sino un pequeño apostador que guarda algunas posibilidades diferentes en su bolsillo trasero?

Conoce a EVE: La neurona que mantiene sus opciones abiertas

En este artículo, un investigador llamado Yves Ruffenach presenta un nuevo tipo de neurona digital llamada EVE. Piensa en una neurona estándar como un trabajador de una fábrica que estampa siempre la misma pieza específica. EVE, por el contrario, es como un trabajador que no solo estampa una pieza, sino que crea una caja entera de versiones ligeramente diferentes de esa pieza, elige una al azar y luego la utiliza para construir la siguiente capa.

El artículo llama a esto una "neurona distribucional". En lugar de transmitir un único número (como 5.0), EVE transmite una distribución: toda una nube de números posibles. Lo hace teniendo un "posterior" interno (una palabra elegante para su mejor suposición actual de lo que podría ser cierto) y un "prior" (lo que cree que es generalmente posible). Toma una muestra de un "estado latente" aleatorio de esta nube, utiliza ese estado aleatorio para realizar su trabajo y luego transmite el resultado. Crucialmente, la neurona se entrena para mantener sus suposiciones internas honestas mediante una penalización de "regularización KL", que es como un profesor regañando suavemente a la neurona si empieza a adivinar salvajemente sin una buena razón.

El estudio pone a prueba esta idea en tres etapas distintas, como un científico haciendo zoom en una sola célula, luego construyendo un órgano entero y, finalmente, colocándolo en una máquina compleja.

Etapa 1: El microscopio
Primero, los investigadores aislaron una sola neurona para ver qué podía hacer por sí sola. Prepararon un juego donde el objetivo era predecir números que tenían una cantidad específica y cambiante de "ruido" (aleatoriedad) asociado. Compararon EVE con otros tres tipos de neuronas:

  1. Una neurona determinista estándar y aburrida (el robot rígido).
  2. Una neurona determinista "emparejada" que tenía la misma potencia de cálculo pero sin aleatoriedad.
  3. Una neurona "heterocedástica" especial que fue instruida explícitamente para predecir la incertidumbre al final.

Los resultados fueron fascinantes. El robot estándar era aceptable adivinando el número, pero terrible reconociendo qué tan inseguro estaba. El robot "emparejado" era tan inseguro como el estándar. ¿Pero EVE? Fue una estrella. Mientras que adivinaba los números con la misma precisión que el potente robot emparejado, se volvió increíblemente bueno rastreando la verdadera incertidumbre. De hecho, se alineó con el patrón de ruido real el 93.9% de las veces, mientras que el robot estándar apenas superaba el cero. EVE demostró que una sola neurona podía aprender a albergar la incertidumbre dentro de sí misma, no solo en la salida.

Etapa 2: La pila profunda
A continuación, los investigadores se preguntaron: "¿Funciona esto cuando apilas 128 de estas neuronas una encima de otra?". Construyeron una red neuronal profunda y masiva (128 capas de profundidad, con 128 neuronas en cada capa) para predecir la eficiencia energética en edificios. Esta es una prueba real de "composición": ¿pueden estas neuronas inciertas trabajar juntas sin que todo el sistema colapse en el caos?

La respuesta fue un rotundo "sí, pero con un matiz". Cuando probaron la red profunda, EVE mejoró significamente la capacidad del modelo para manejar la incertidumbre. Redujo el "Logaritmo Negativo de la Verosimilitud" (una puntuación de qué tan bien predice el modelo todo el rango de posibilidades) en aproximadamente un 18.8% y mejoró otras puntuaciones de incertidumbre entre un 4.5% y un 8.3% en las cinco ejecuciones de prueba. Sin embargo, cuando se trataba de simplemente adivinar el número exacto (medido por MSE y MAE), EVE era aproximadamente igual al robot estándar, a veces un poco mejor, a veces un poco peor. La gran victoria fue que la "incertidumbre" no se desvaneció a medida que la señal viajaba a través de las 128 capas; se mantuvo viva y medible. Los investigadores señalaron, sin embargo, que esto conllevaba un coste: EVE era aproximadamente 7.1 veces más lento de ejecutar debido a que tenía que realizar todo ese muestreo y matemáticas adicionales.

Etapa 3: El puente Transformer
Finalmente, los investigadores intentaron encajar a EVE en una arquitectura "Transformer" moderna, el tipo de cerebro utilizado para modelos de lenguaje como los que escriben ensayos o charlan contigo. Reemplazaron las partes de "feed-forward" estándar de un Transformer con neuronas EVE y le pidieron que predijera la siguiente palabra en una historia (usando un conjunto de datos llamado PG-19).

Los resultados sugirieron que EVE podía, de hecho, insertarse en estos sistemas complejos y modernos. El Transformer impulsado por EVE mejoró su capacidad para predecir la siguiente palabra (bajando la "perplejidad" de 189.74 a 161.94) y fue mejor adivinando la palabra correcta (la precisión pasó de 0.1938 a 0.2064). También produjo "señales de incertidumbre de Monte Carlo no degeneradas", que es una forma elegante de decir que cuando se le pedía al modelo que adivinara varias veces, daba respuestas diferentes e interesantes que reflejaban su incertidumbre, en lugar de simplemente repetir la misma suposición. Sin embargo, el estudio encontró que la "incertidumbre" ocurría principalmente en la primera capa de la red; las capas más profundas aún no estaban utilizando todo su potencial.

Lo que esto significa (y lo que no)

El artículo sugiere que hacer de la incertidumbre una unidad fundamental de computación, justo dentro de la neurona, es una idea viable y poderosa. Demuestra que puedes aislar este comportamiento, construir redes profundas con ello e incluso conectarlo con los modelos de lenguaje más avanzados.

Sin embargo, los autores tienen cuidado de no afirmar que esto sea una solución mágica. Descartan explícitamente la idea de que se trate solo de tener más potencia de cálculo; una neurona estándar con la misma potencia no obtuvo los mismos resultados. También señalan que, aunque EVE es excelente con la incertidumbre, no siempre gana en el simple hecho de "estar en lo cierto" sobre el número exacto. En las pruebas de la red profunda, las tasas de error estándar (MSE y MAE) eran muy cercanas, y a veces el modelo estándar era ligeramente mejor. Además, el estudio admite que la versión actual es más lenta y que la "incertidumbre" en el experimento del Transformer aún no estaba perfectamente equilibrada en todas las capas.

En resumen, EVE sugiere que si queremos que los ordenadores entiendan la confusión del mundo, no debemos añadir simplemente un botón de "duda" al final. Debemos enseñar a los propios bloques de construcción diminutos a mantener algunas opciones abiertas, a muestrear de ellas y a sentirse cómodos con lo desconocido. Es un cambio pequeño y lúdico en la forma en que construimos cerebros digitales, pero que podría ayudar a que vean el mundo un poco más como nosotros lo hacemos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →