Illuminating the Three Dogmas of Reinforcement Learning under Evolutionary Light
Este artículo sostiene que la comunidad de la vida artificial puede abordar las críticas fundamentales a los principios básicos del aprendizaje por refuerzo integrando la búsqueda de novedad de código abierto con teorías termodinámicas de la agencia para proponer un marco biológicamente fiel que redefina el aprendizaje como adaptación en lugar de optimización de recompensas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando enseñarle a un robot cómo actuar como un ser vivo. Durante décadas, la receta estándar para esto (llamada Aprendizaje por Refuerzo, o RL) se ha basado en tres reglas estrictas, o "dogmas":
- El mundo es un tablero de juego: El entorno es una cuadrícula predecible donde cada movimiento conduce a un resultado específico.
- El aprendizaje es encontrar el mejor camino: El robot aprende buscando la solución única y perfecta a un problema, como encontrar la ruta más corta hacia un cofre del tesoro.
- La meta es una puntuación única: El robot se mueve por un número simple (una puntuación de recompensa). Quiere obtener el número más alto posible, tal como un jugador de un videojuego que intenta conseguir la puntuación más alta.
Los autores de este artículo, Mani Hamidi y Terrence Deacon, argumentan que estas tres reglas son demasiado rígidas. Dicen que la vida real no es un videojuego con una única puntuación alta. En su lugar, sugieren que miremos el aprendizaje a través de la lente de la evolución y la física para entender qué significa realmente ser un "agente" (un ser que actúa por sí mismo).
Aquí hay un desglose sencillo de su argumento utilizando analogías cotidianas:
1. El aprendizaje no es solo "Búsqueda"; es "Exploración" (La analogía del jardín)
La visión antigua dice que aprender es como un excursionista tratando de encontrar la cima de una sola montaña (la mejor solución). Si encuentras la cima, te detienes.
Los autores dicen que la adaptación real es más parecida a un jardinero cuidando un jardín salvaje y abierto.
- La forma antigua: Solo plantas flores que crecen más alto. Una vez que tienes la flor más alta, has terminado.
- La nueva forma: No solo buscas la "mejor" flor. Fomentas que crezcan diferentes tipos de plantas en diferentes rincones del jardín para que no compitan entre sí. Algunas plantas pueden ser bajas pero muy coloridas; otras pueden ser altas pero escasas.
- Por qué importa: En el mundo real, a menudo no sabes cuál es la "mejor" solución todavía. Necesitas seguir explorando y creando nuevos tipos de soluciones (novedad) en lugar de solo perfeccionar una solución vieja. Esto se llama "Búsqueda de Novedad de Final Abierto" (Open-Ended Novelty Search). Se trata de crear un ecosistema diverso de ideas, no solo de encontrar un ganador.
2. La "Puntuación" no funciona para los seres vivos (La analogía de la multitarea)
La visión antigua dice que un agente es impulsado por un único número (como una puntuación en un juego). Los autores argumentan que esto es imposible para los seres vivos porque la vida es multitarea.
Imagina que eres un humano intentando sobrevivir. No solo estás intentando "maximizar la felicidad". Estás simultáneamente:
- Intentando mantenerte caliente (termorregulación).
- Intentando mantener tus niveles de sal adecuados (osmorregulación).
- Intentando encontrar comida.
- Intentando evitar a un depredador.
Todos estos son diferentes "objetivos" que a veces chocan entre sí. Si aparece un tigre, tu objetivo de "encontrar comida" de repente se vuelve menos importante que tu objetivo de "huir".
- El problema: No puedes comprimir todas estas necesidades diferentes y cambiantes en un solo número (un escalar de recompensa).
- La solución: Los seres vivos operan mediante la homeostasis (mantener el equilibrio interno). No están tratando de obtener una puntuación alta; están tratando de mantener su "termostato" interno y su "medidor de combustible" dentro de un rango seguro. La "recompensa" no es un número; es la sensación de alivio cuando se satisface una necesidad.
3. ¿De dónde vienen las metas? (La analogía de "¿Quién construyó la casa?")
Si decimos que un robot aprende porque quiere maximizar una puntuación, ¿quién le dio esa puntuación? En la IA actual, un ingeniero humano escribe el código. En la biología, decimos que la "evolución" nos dio nuestras metas.
Pero los autores preguntan: ¿De dónde obtuvo la evolución sus metas?
Argumentan que no puedes simplemente decir "evolución" y detenerte ahí. La evolución necesita algo sobre lo que trabajar. Necesita un sistema que pueda copiarse a sí mismo y mantenerse con vida el tiempo suficiente para reproducirse.
- La física de la vida: Antes de que puedas tener evolución, necesitas un sistema físico que luche contra la tendencia natural de las cosas a desmoronarse (entropía). Piensa en una fogata frente a una bacteria.
- Una fogata quema combustible y crea orden por un momento, pero simplemente se apaga. No intenta mantenerse viva.
- Una bacteria es una máquina que construye activamente sus propias paredes y se repara a sí misma para mantener la quema de combustible. Es un bucle de "autopreservación".
- La gran idea: Los autores argumentan que la verdadera agencia (la capacidad de actuar en beneficio propio) solo existe cuando un sistema está construido físicamente para mantenerse a sí mismo contra las leyes de la física. La "meta" no es un número; la meta es simplemente mantenerse vivo.
La metáfora del "Trinquete" (Ratchet)
El artículo termina con una imagen poderosa. Imagina un trinquete (una herramienta que gira un tornillo en una dirección pero no permite que retroceda).
- La mayoría de las teorías del aprendizaje son como una pelota rodando por una colina; puede rodar hacia abajo fácilmente.
- Los autores sugieren que la verdadera agencia es como un trinquete. Es un sistema que se construye a sí mismo, mantiene su forma contra el viento (la segunda ley de la termodinámica) y luego transmite esa forma a la siguiente generación.
- Este "trinquete" es lo que permite que la evolución ocurra en primer lugar. Sin un sistema que pueda mantenerse unido, no hay "yo" que pueda evolucionar.
Resumen
El artículo afirma que para construir máquinas verdaderamente inteligentes y autónomas, debemos dejar de pensar en ellas como personajes de videojuegos persiguiendo una puntuación alta. En su lugar, debemos pensar en ellas como sistemas vivos que:
- Exploran muchas posibilidades diferentes (no solo un camino perfecto).
- Equilibran múltiples necesidades internas (no solo una puntuación).
- Están construidos físicamente para mantenerse a sí mismos y reproducirse (luchando contra la tendencia natural a desmoronarse).
Al comprender la física de cómo un sistema se mantiene vivo, finalmente podemos entender de dónde vienen realmente las "metas" y el "aprendizaje".
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.