← Últimos artículos
⚡ electrical engineering

Improving Performance of Spike-based Deep Q-Learning using Ternary Neurons

Este artículo propone una Red Q de Picos Ternaria Asimétrica Profunda (DATSQN, por sus siglas en inglés) que utiliza un novedoso modelo de neurona de picos ternaria para mitigar el sesgo de estimación de gradiente, superando así la degradación del rendimiento de los modelos ternarios existentes y aventajando a las líneas base binarias en tareas de aprendizaje Q profundo a través de siete juegos de Atari.

Autores originales: Aref Ghoreishee, Abhishek Mishra, John Walsh, Anup Das, Nagarajan Kandasamy

Publicado 2026-08-13
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Aref Ghoreishee, Abhishek Mishra, John Walsh, Anup Das, Nagarajan Kandasamy

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a jugar videojuegos. Para tomar decisiones, el robot necesita un cerebro, y en el mundo de la inteligencia artificial, a menudo construimos estos cerebros utilizando "redes neuronales". Estas redes están inspiradas en el cerebro humano, donde unidades diminutas llamadas neuronas pasan señales entre sí. En los cerebros de computadoras tradicionales, estas señales son como ondas eléctricas suaves y continuas. Pero en un tipo especial de cerebro llamado "Red Neuronal de Picos" (SNN, por sus siglas en inglés), las neuronas se comunican mediante ráfagas diminutas y agudas de electricidad llamadas "picos", de forma muy similar a cómo disparan las neuronas biológicas reales. Este método es increíblemente eficiente en términos de energía, lo que lo hace perfecto para robots móviles o dispositivos que no pueden cargar con baterías pesadas.

Sin embargo, hay un inconveniente. La mayoría de estos cerebros de picos, que son tan eficientes, solo tienen dos estados: o disparan un pico (1) o permanecen en silencio (0). Es como un interruptor de luz que solo puede estar encendido o apagado. Esto limita la cantidad de información que el robot puede retener en su cabeza a la vez. Recientemente, los científicos intentaron actualizar estos interruptores a neuronas "ternarias", que tienen tres estados: dispara positivamente (+1), permanece en silencio (0) o dispara negativamente (-1). Podrías pensar que añadir un interruptor "negativo" haría al robot más inteligente, pero sorprendentemente, cuando probaron esto en un entorno de videojuegos, los robots en realidad empeoraron al jugar. Este artículo profundiza en este misterio, preguntándose por qué tener más opciones hizo al robot más tonto, y cómo lo arreglaron para convertir al robot en un campeón de los videojuegos otra vez.


El Misterio del Robot más Tonto

Los investigadores, un equipo de la Universidad de Drexel, se propusieron probar estas nuevas neuronas "ternarias" en un sistema de aprendizaje profundo diseñado para jugar videojuegos de Atari (los clásicos juegos de arcade como Breakout y Space Invaders). Tenían la sospecha de que el problema no era el estado adicional en sí, sino cómo estaban aprendiendo las neuronas.

Piensa en entrenar a un robot como enseñarle trucos a un perro. Le das una orden, lo intenta, y le das un premio (una recompensa) o un "no" (una penalización). En el mundo de la IA, este "premio" se calcula observando la diferencia entre lo que el robot esperaba y lo que realmente sucedió. Esta diferencia se llama "gradiente", y le dice al robot cómo ajustar su cerebro para hacerlo mejor la próxima vez.

El equipo descubrió que las neuronas ternarias estándar eran como un profesor al que solo le importaba la dirección del error, no el tamaño del mismo. Si el robot cometía un error, la neurona ternaria solo podía decir: "¡Fuiste en la dirección equivocada!" (+1 o -1), pero ignoraba por completo la pregunta de "¿Qué tanto te equivocaste?" (la actividad). En las etapas iniciales del aprendizaje de un videojuego, el robot suele adivinar de forma errática, por lo que la "dirección" del error es confusa y aleatoria. Debido a que las neuronas ternarias estándar estaban tan enfocadas en la dirección, se perdieron en el ruido y dejaron de aprender por completo. Era como si el robot estuviera intentando navegar en un laberinto con niebla mientras solo escuchaba una brújula que giraba aleatoriamente; simplemente se quedaba quieto.

El Arreglo Asimétrico

Para resolver esto, los autores propusieron un nuevo diseño llamado Red Q de Picos Ternaria Asimétrica Profunda (DATSQN). Se dieron cuenta de que la naturaleza tenía la respuesta desde el principio. En el cerebro humano, no todas las neuronas son iguales. Cerca del 80% de nuestras neuronas son "excitatorias" (empujan al cerebro a actuar), y solo alrededor del 20% son "inhibitorias" (le dicen al cerebro que se detenga). Los viejos modelos ternarios trataban a estos dos tipos como imágenes especulares perfectas, lo cual es biológicamente poco realista.

El nuevo modelo del equipo rompió esta simetría. Crearon una neurona donde los umbrales "positivo" (excitatorio) y "negativo" (inhibitorio) eran diferentes. Una forma de visualizar esto es imaginar una puerta con dos cerraduras distintas. El modelo antiguo tenía dos cerraduras idénticas; si empujabas con mucha fuerza en cualquiera de los lados, la puerta se abría de la misma manera. El nuevo modelo tiene una cerradura pesada y difícil de abrir en el lado de "detenerse" y una cerradura fácil de abrir en el lado de "ir". Esta asimetría significó que, incluso cuando el robot estaba confundido sobre la dirección de su error, la neurona aún podía enviar una señal clara sobre cuánto debía estar activa. Mantuvo el "control de volumen" funcionando incluso cuando la "flecha de dirección" giraba sin control.

Los Resultados: De Estancado a Superestrella

El equipo probó este nuevo cerebro en siete juegos diferentes de Atari, enfrentándolo a los robots binarios (encendido/apagado) y a los robots ternarios estándar. Hicieron la tarea más difícil obligando a los robots a tomar decisiones más rápido (usando una ventana de tiempo de simulación más corta de 20 pasos en lugar de 40), lo que usualmente dificulta mucho el aprendizaje.

Los resultados fueron impactantes. Los robots ternarios estándar (DTSQN) funcionaron terriblemente, puntuando mucho más bajo que los robots binarios básicos. Efectivamente, estaban atrapados en la niebla del aprendizaje. Sin embargo, los nuevos robots asimétricos (DATSQN) no solo alcanzaron el nivel, sino que se dispararon. En seis de los siete juegos, el nuevo modelo superó la línea base binaria, logrando una mejora del 30% en el puntaje promedio del juego. Por ejemplo, en Beam Rider, el nuevo robot anotó 4,000 puntos frente a los 2,069 del robot binario. En Breakout, anotó 252 puntos frente a 207.

Los investigadores también revisaron el "latido" del proceso de entrenamiento. Descubrieron que las señales de aprendizaje del nuevo modelo se mantenían fuertes y estables, evitando el problema del "gradiente desvaneciente" donde el robot olvida cómo aprender. También observaron que las neuronas en su nuevo modelo evolucionaron naturalmente para ser mayoritariamente excitatorias, tal como ocurre en un cerebro humano real, con los picos positivos superando a los negativos en una proporción de al menos 60%.

Lo Que Esto Significa

Este artículo sugiere que simplemente añadir más estados a una neurona no es suficiente; tienes que diseñar cómo aprenden esos estados. Al imitar el desequilibrio natural de las neuronas excitatorias e inhibitorias en el cerebro humano, el equipo creó una red de picos que no solo es más eficiente energéticamente, sino también más inteligente para aprender tareas complejas. Aunque el estudio se realizó en simulaciones de videojuegos, los hallazgos sugieren que este enfoque "asimétrico" podría ser la clave para construir mejores y más eficientes cerebros de IA para robots y otros dispositivos en el futuro. Los autores señalan que, aunque su modelo funciona de maravilla en estos juegos, sigue siendo una sugerencia de cómo construir mejores sistemas, y será interesante ver si este enfoque ayuda en otras áreas como la visión o el procesamiento del lenguaje.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →