← Últimos artículos
💻 computer science

Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning

Este artículo propone un marco de Aprendizaje por Refuerzo Jerárquico neurosimbólico que integra el Conocimiento Incremental (InK) y la Búsqueda en Árbol de Creencia del Mundo para permitir una planificación simbólica actualizable y un aprendizaje neuronal con modelado de recompensa, mejorando así significativamente la eficiencia de muestreo en tareas de navegación de largo horizonte y recompensa dispersa.

Autores originales: Subrat Prasad Panda, Blaise Genest, Arvind Easwaran

Publicado 2026-08-05
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Subrat Prasad Panda, Blaise Genest, Arvind Easwaran

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot a navegar por un laberinto gigante y cambiante. En el mundo de la inteligencia artificial, este es un desafío clásico conocido como Aprendizaje por Refuerzo (RL, por sus siglas en inglés). Piensa en ello como entrenar a un perro: le das un premio (una recompensa) cuando hace algo bien, y así aprende a repetir esa acción. Pero aquí está el truco: si el laberinto es enorme y los premios están escondidos muy lejos, el perro podría deambular durante un millón de años antes de encontrar accidentalmente el camino. Este es el problema de la "eficiencia de muestreo": ¿cuántos intentos necesita la IA para aprender?

Para solucionar esto, los científicos suelen utilizar el "Aprendizaje por Refuerzo Jerárquico" (HRL). En lugar de que un robot intente comprender cada paso individual a la vez, le das un jefe y un trabajador. El jefe (el planificador de alto nivel) decide grandes objetivos, como "ir a la cocina", mientras que el trabajador (el controlador de bajo nivel) descubre los movimientos musculares diminutos para llegar allí. Por lo general, el jefe es un mapa rígido y preprogramado que nunca cambia. Pero, ¿qué pasa si el laberinto tiene paredes secretas que solo aparecen cuando chocas con ellas? Un jefe rígido seguiría intentando atravesar una pared que acaba de aparecer, perdiendo el tiempo. Este artículo explora una forma más inteligente: un robot que aprende el mapa mientras se mueve, actualizando el mapa de su jefe en tiempo real basándose en lo que el trabajador descubre.


La gran idea del artículo: Un robot que aprende sobre la marcha

Los autores, Subrat Prasad Panda y su equipo, proponen un nuevo sistema llamado Neurosymbolic HRL with Incremental Knowledge (InK) (HRL Neurosimbólico con Conocimiento Incremental). Vamos a desglosar el nombre: "Neurosimbólico" significa que están mezclando dos tipos de cerebros. La parte "neuronal" es un cerebro flexible de aprendizaje (como una red neuronal de aprendizaje profundo) que gestiona los movimientos físicos. La parte "simbólica" es un cerebro lógico basado en reglas que gestiona la planificación, como un jugador de ajedrez pensando con antelación.

En los sistemas tradicionales, el cerebro lógico construye un mapa perfecto del mundo antes de que el robot empiece a moverse. Es como intentar memorizar todo el mapa del metro de Londres antes de salir de casa. Si una línea de tren está cerrada o se abre una nueva estación, tu mapa no sirve de nada hasta que empieces de nuevo. Los autores argumentan que esto es ineficiente. En su lugar, su robot utiliza Conocimiento Incremental (InK). Comienza con una hoja en blanco o una suposición aproximada. A medida que el robot "trabajador" intenta moverse y choca con una pared, le dice al "jefe": "¡Oye, hay una pared aquí!". El jefe actualiza inmediatamente su mapa y recalcula la mejor ruta. Es como tener un GPS que actualiza tu ruta en el segundo en que te encuentras con un atasco, en lugar de quedarse atrapado esperando a que se imprima un nuevo mapa.

El "Mundo de Creencia" y la Búsqueda en Árbol

El artículo introduce un truco ingenioso para manejar la incertidumbre. Imagina que estás en una habitación oscura y sabes que hay exactamente una pared en algún lugar, pero no sabes dónde. Podrías suponer que está a la izquierda, o a la derecha, o en el medio. El robot no solo elige una suposición; mantiene un "conjunto de creencias": una lista mental de todos los mundos posibles donde la pared podría estar.

Para tomar decisiones en esta niebla de incertidumbre, los autores desarrollaron un algoritmo llamado Belief World Tree Search (BWTS) (Búsqueda en Árbol de Mundo de Creencia). Imagina un árbol gigante creciendo en tu mente. El tronco es tu ubicación actual. Cada vez que tienes que elegir una dirección, el árbol se ramifica. Pero aquí está el giro: en lugar de solo adivinar un camino, el BWTS simula miles de futuros posibles a la vez. Pregunta: "Si la pared está aquí, ¿cuál es el mejor movimiento? Si la pared está allá, ¿cuál es el mejor movimiento?". Luego elige el movimiento que funciona mejor en promedio a través de todas esas posibilidades.

El artículo argumenta explícitamente contra el uso de métodos de adivinación "aleatorios" estándar (como algunos algoritmos antiguos que simplemente lanzan dados para ver qué sucede). Los autores descubrieron que la adivinación aleatoria en un laberinto a menudo hace que el robot gire en círculos, perdiendo el tiempo. En su lugar, el BWza usa "rollouts estratégicos": simula caminos utilizando estrategias inteligentes y preplanificadas (como "siempre barre hacia la izquierda si chocas con una pared") para descubrir rápidamente la mejor ruta sin perderse.

Lo que encontraron: Velocidad e Inteligencia

El equipo probó su idea en simulaciones por computadora de laberintos, que van desde cuadrículas simples hasta entornos 3D complejos con un robot "hormiga" que tiene muchos órganos/articulaciones.

  1. Ganancias masivas de velocidad: Al compararlo con el viejo método de "construir el mapa primero" (llamado RGL en el artículo), el nuevo método InK fue increíblemente más rápido para aprender. En un laberinto de "Cuatro Habitaciones", el método antiguo necesitó unos 2.080 pasos para alcanzar la meta por primera vez desde cero. El nuevo método InK necesitó solo 64,9 pasos. Eso es aproximadamente entre 30 y 100 veces menos intentos.
  2. Ahorro de tiempo: La diferencia de tiempo fue aún más evidente. El método antiguo tardó más de 96 segundos solo en descifrar el primer camino. El nuevo método lo hizo en 0,02 segundos.
  3. El poder del conocimiento previo: Cuando se le dio al robot una pista sobre el mundo (como "hay una pared en algún lugar, pero no sé dónde"), el algoritmo BWTS brilló. En estos casos, utilizó la mitad del número de muestras (intentos) en comparación con el planificador estándar, aunque requirió un poco más de tiempo de computación para realizar los cálculos complejos.
  4. Entornos complejos: El sistema funcionó incluso en el "Ant-Maze U-Room", un desafío de alta dimensión con 29 dimensiones de movimiento. El método antiguo necesitó alrededor de 10.000 pasos para construir su mapa, mientras que el nuevo método alcanzó la meta en unos 1.507 pasos (o incluso 1.134 pasos con el planificador BWTS).

Lo que no encontraron (y lo que rechazaron)

El artículo es cuidadoso al decir qué no funciona bien en este montaje específico. Probaron un algoritmo popular llamado BAMCP, que intenta manejar la incertidumbre asumiendo que cada parte del laberinto es independiente (como asumir que la pared en la cocina no tiene nada que ver con la pared en el dormitorio). Los autores descubrieron que este enfoque falló estrepitosamente en sus pruebas de laberinto. Debido a que las paredes estaban estructuralmente vinculadas (si hay una pared aquí, no puede haber una allí), la suposición de independencia llevó a malas decisiones y pérdida de tiempo. BAMCP tomó entre 28 y 40 pasos en promedio, donde el nuevo método tomó de 21 a 23, y funcionó mucho más lento.

Los autores también señalan que, aunque su método es más rápido, el algoritmo BWTS es computacionalmente pesado. Si no tienes ningún conocimiento previo sobre el mundo, el planificador "D*" más simple (un planificador incremental estándar) es en realidad más rápido y suficiente. Solo necesitas el complejo árbol de búsqueda BWTS si tienes pistas estructurales específicas sobre el mundo para explotar.

La conclusión

Este artículo sugiere que, al mezclar un cerebro de aprendizaje flexible con un planificador lógico que actualiza su mapa en tiempo real, los robots pueden aprender a navegar por mundos complejos y desconocidos mucho más rápido que antes. No solo simularon un robot; demostraron que, en estos escenarios específicos de laberinto, el nuevo método supera consistentemente al viejo enfoque de "aprender todo primero", ahorrando cantidades masivas de tiempo y esfuerzo. Es un paso hacia robots que puedan explorar una casa nueva, aprender dónde están los muebles y encontrar la cocina sin necesidad de un manual para cada habitación.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →