← Últimos artículos
🤖 machine learning

A projection-based framework for gradient-free and parallel learning

Este artículo presenta PJAX, un marco basado en JAX que reformula el entrenamiento de redes neuronales como un problema de factibilidad paralelizable y libre de gradientes mediante operadores de proyección iterativos, ofreciendo una alternativa convincente a la optimización convencional basada en gradientes con ventajas en el manejo de operaciones no diferenciables y la habilitación de paralelismo masivo.

Autores originales: Andreas Bergmeister, Manish Krishan Lal, Stefanie Jegelka, Suvrit Sra

Publicado 2026-04-30
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Andreas Bergmeister, Manish Krishan Lal, Stefanie Jegelka, Suvrit Sra

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un rompecabezas masivo y complejo, como un gigantesco rompecabezas en 3D o un cubo de Rubik, pero no conoces la imagen final.

La Vieja Forma (Aprendizaje Basado en Gradientes)
Actualmente, la mayoría de los modelos de IA aprenden utilizando un método llamado "retropropagación". Piensa en esto como un excursionista que intenta encontrar el fondo de un valle neblinoso (la mejor solución). El excursionista siente la pendiente bajo sus pies (el gradiente) y da un paso cuesta abajo. Sigue haciendo esto, paso a paso, hasta llegar a un punto bajo.

  • El Problema: A veces el excursionista se queda atrapado en una pequeña hondonada (un mínimo local) que no es el fondo verdadero. A veces el camino es tan empinado o plano que el excursionista se pierde o se mueve demasiado lento. Además, para saber hacia dónde está "abajo", el excursionista tiene que enviar una señal todo el camino de regreso desde el fondo del valle hasta la cima, lo cual es lento y requiere un camino muy específico y simétrico.

La Nueva Forma (Aprendizaje Basado en Proyecciones)
Los autores de este artículo proponen una estrategia completamente diferente. En lugar de intentar encontrar el fondo de un valle, tratan el entrenamiento como un problema de factibilidad.

Imagina que tienes una habitación llena de paredes, cada una con una regla específica.

  • La Pared A dice: "El bloque rojo debe estar junto al bloque azul".
  • La Pared B dice: "El bloque verde debe estar encima del bloque rojo".
  • La Pared C dice: "El peso total debe ser igual a 50 kg".

Tu objetivo no es deslizarte cuesta abajo; es encontrar una sola disposición de bloques donde la regla de cada pared se satisfaga al mismo tiempo.

Cómo Funciona: La Metáfora de la "Proyección"
Los autores llaman a su método "Basado en Proyecciones". Así es como lo hacen:

  1. Desglosarlo: Descomponen el rompecabezas gigante (la red neuronal) en piezas pequeñas y simples llamadas "funciones primitivas" (como operaciones matemáticas simples: sumar números, multiplicarlos o decidir si un número es positivo).
  2. La Solución Local: En lugar de mirar todo el rompecabezas, miran solo una pared (una regla). Si los bloques no cumplen la regla de esa pared, "proyectan" los bloques sobre la pared. Imagina proyectar una luz sobre los bloques; la sombra que proyectan sobre la pared es la posición "correcta" para esa regla específica.
  3. Poder Paralelo: Esta es la parte mágica. Como cada pared solo se preocupa por sus vecinos inmediatos, puedes arreglar la Pared A, la Pared B y la Pared C al mismo tiempo. No tienes que esperar a que la Pared A termine para empezar con la Pared B. Esto es como tener un equipo de 100 personas arreglando diferentes partes de una casa simultáneamente, en lugar de una persona arreglando el techo, luego la cocina, luego el baño, uno por uno.
  4. Repetir: Lo hacen una y otra vez. Cada vez, empujan los bloques para que se ajusten mejor a las reglas locales. Eventualmente, los bloques se asientan en una posición donde satisfacen todas las reglas simultáneamente. Esa es tu IA entrenada.

Por Qué Esto es Genial (Según el Artículo)

  • No se necesita "Pendiente": No necesitas calcular una "pendiente" (gradiente). Esto significa que puedes usar reglas que son "ásperas" o rotas (no diferenciables), como un interruptor que está encendido o apagado. El método antiguo lucha con esto; este nuevo método los maneja fácilmente.
  • Plausibilidad Biológica: En el cerebro, las neuronas no envían una "señal de error" global todo el camino de regreso desde el final de un pensamiento hasta el principio. Solo se ajustan en función de lo que hacen sus vecinos inmediatos. Este nuevo método imita ese ajuste local, de vecino a vecino.
  • Velocidad: Como todos trabajan en paralelo, puede ser mucho más rápido en chips de computadora modernos (GPUs/TPUs) diseñados para hacer muchas cosas a la vez.

La Compensación: El Costo de "Memoria"
El artículo admite que hay una trampa. Para hacer esto, la computadora debe recordar la posición de cada "borde" en el rompecabezas en cada paso.

  • Analogía: En el método antiguo, solo recuerdas la ubicación actual del excursionista. En este nuevo método, tienes que recordar la posición de cada bloque en la habitación, y cada conexión entre ellos, para cada persona de tu equipo.
  • Resultado: Esto utiliza mucha más memoria de computadora (RAM). Los autores tuvieron que reducir algunos de sus modelos de prueba para que cupieran en la memoria de su computadora, mientras que el método antiguo podía manejar modelos más grandes con mayor facilidad.

Los Resultados
Los autores construyeron una herramienta de software llamada PJAX (Projection JAX) para probar esto. Lo probaron en diferentes tipos de rompecabezas:

  • Patrones simples (MLP)
  • Reconocimiento de imágenes (CNN)
  • Predicción de lenguaje (RNN)

Descubrieron que, aunque la "vieja forma" (usando optimizadores Adam o SGD) sigue siendo el campeón en velocidad bruta y precisión final en muchos casos, esta nueva forma de "Proyección" funciona sorprendentemente bien. Es una alternativa viable que:

  1. Aprende sin necesidad de gradientes.
  2. Maneja reglas "ásperas" que confunden a otros métodos.
  3. Aprende de manera muy eficiente en hardware paralelo, especialmente para tareas como el modelado de lenguaje donde el método antiguo lucha con los "gradientes que se desvanecen" (olvidar el principio de una oración).

En Resumen
El artículo dice: "Deja de intentar deslizarte cuesta abajo para encontrar la respuesta. En su lugar, trata el problema como un conjunto de reglas locales. Arregla cada regla localmente y simultáneamente, y eventualmente, todo el sistema se acomodará". Es una nueva forma de entrenar IA que es más paralela, más flexible con diferentes tipos de matemáticas, pero que actualmente requiere más memoria.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →