← Últimos artículos
🤖 machine learning

On the Infinite Width and Depth Limits of Predictive Coding Networks

Este artículo investiga los límites de anchura y profundidad infinitos de las Redes de Codificación Predictiva, derivando parametrizaciones estables que previenen explosiones de entrenamiento y demostrando que los gradientes de la Codificación Predictiva convergen a los gradientes de Retropropagación en redes anchas, ofreciendo así un mecanismo de aprendizaje local biológicamente plausible para arquitecturas profundas.

Autores originales: Francesco Innocenti, El Mehdi Achour, Rafal Bogacz

Publicado 2026-08-11
📖 4 min de lectura☕ Lectura para el café

Autores originales: Francesco Innocenti, El Mehdi Achour, Rafal Bogacz

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un equipo de robots gigante y de múltiples capas cómo resolver un rompecabezas. En el mundo de la inteligencia artificial, la forma estándar de hacer esto se llama "retropropagación" (backpropagation). Es como un gerente estricto que se sitúa al final de la línea de montaje, observa el error final y luego corre de vuelta hasta el principio, gritando instrucciones específicas a cada uno de los robots sobre exactamente en qué fallaron. Funciona increíblemente bien para las computadoras, pero es un método que difiere de cómo opera la naturaleza. Los cerebros reales no tienen un gerente central gritando instrucciones hacia atrás en el tiempo; en su lugar, cada neurona solo sabe lo que están haciendo sus vecinos inmediatos.

Entra la "Codificación Predictiva", una teoría que sugiere que los cerebros aprenden más como un grupo de amigos tratando de adivinar el clima. Cada persona (neurona) hace una predicción basada en lo que dicen sus vecinos, siente un pequeño "error" si su suposición es incorrecta y ajusta su propia actividad para encajar mejor. Una vez que todos dejan de discutir y alcanzan un acuerdo tranquilo (equilibrio), todos ajustan sus conexiones ligeramente para hacerlo mejor la próxima vez. Este método es biológicamente realista porque cada uno solo habla con sus vecinos, pero durante mucho tiempo, los científicos no estaban seguros de si podría manejar las redes masivas y profundas necesarias para la IA moderna. ¿Podría este método local y comunicativo escalar al tamaño de una supercomputadora, o se desmoronaría?

Este artículo profundiza en esa pregunta exacta al observar qué sucede cuando haces que estas redes sean infinitamente anchas (añadiendo toneladas de neuronas una al lado de la otra) e infinitamente profundas (añadiendo toneladas de capas una encima de la otra). Los investigadores, Francesco Innocenti, El Mehdi Achour y Rafal Bogacz, querían saber: ¿Podemos ajustar las "perillas" de estas redes de codificación predictiva para que se mantengan estables y aprendan de manera efectiva, tal como lo hacen las redes de retropropagación estándar que usamos hoy en día?

Su investigación revela un giro sorprendente. Descubrieron que para que la codificación predictiva funcione a gran escala, debe utilizar exactamente los mismos ajustes y reglas de escalado que el método de retropropagación estándar. Si intentas usar los ajustes "estándar" que la mayoría de la gente usa en software como PyTorch, la salida de la red de codificación predictiva explotará en caos a medida que se vuelva más ancha, de forma muy similar a un micrófono dejado demasiado cerca de un altavoz. Sin embargo, si cambias a un conjunto específico de reglas matemáticamente precisas (conocidas como parametrizaciones de "campo medio" o de "actualización máxima"), la red se estabiliza.

Bajo estas condiciones estables, el artículo muestra que, a medida que la red se vuelve increíblemente ancha, la forma en que la codificación predictiva aprende se vuelve casi indistinguible de la retropropagación. De hecho, para redes que son mucho más anchas que profundas (piensa en un panqueque ancho y plano en lugar de una torre alta y delgada), las actualizaciones "locales" de la codificación predictiva se alinean perfectamente con las actualizaciones "globales" de la retropropagación. Los autores demostraron esto matemáticamente para redes lineales simples y lo confirmaron con experimentos en modelos no lineales complejos como Redes Neuronales Convolucionales (CNN) y Transformers.

El estudio también descarta algunas posibilidades emocionantes. Sugiere que la velocidad de aprendizaje "rápida" que algunos investigadores vieron en redes más profundas que anchas usando configuraciones anteriores era en realidad una ilusión causada por la inestabilidad; esas configuraciones se rompen a medida que la red crece. Además, aunque el artículo sugiere que el cerebro podría usar una regla de aprendizaje local similar a la codificación predictiva para lograr el poder de la retropropagación, señala que esto solo funciona eficientemente si el cerebro es "mucho más ancho que profundo", una hipótesis que se alinea con la comprensión biológica actual de la corteza.

En última instancia, este trabajo no solo dice "la codificación predictiva funciona"; establece un límite estricto alrededor de cómo puede funcionar. Nos dice que para escalar este método biológicamente plausible al tamaño de la IA moderna, no podemos simplemente retocarlo al azar; tenemos que adoptar el mismo riguroso escalado matemático que hace que la IA estándar funcione. Este es un paso crucial hacia adelante, sugiriendo que el cerebro podría estar utilizando, de hecho, una danza local de minimización de energía para resolver los mismos problemas complejos que nuestros computadores entrenados con retropropagación global resuelven hoy en día.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →