← Últimos artículos
⚡ electrical engineering

Deep Reinforcement Learning for Reach-Avoid-Stay Problems

Este artículo propone un marco de aprendizaje por refuerzo profundo de dos etapas que aprende conjuntamente el conjunto de Alcance-Evitación-Permanencia (Reach-Avoid-Stay) máximo y robusto y una política de control de conmutación correspondiente, demostrando una precisión y un rendimiento superiores para asegurar que los sistemas alcancen y permanezcan de forma segura dentro de los conjuntos objetivo bajo perturbaciones acotadas en comparación con los métodos existentes.

Autores originales: Gabriel Chenevert, Jingqi Li, Achyuta kannan, Sangjae Bae, Donggun Lee

Publicado 2026-09-03
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Gabriel Chenevert, Jingqi Li, Achyuta kannan, Sangjae Bae, Donggun Lee

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la robótica y las máquinas autónomas, la seguridad no se trata solo de evitar un choque; se trata de saber exactamente hacia dónde puede ir una máquina y, lo que es más importante, dónde debe detenerse. Imagine un coche autónomo o un dron de reparto navegando por una ciudad concurrida. Los ingenieros utilizan herramientas matemáticas para mapear "zonas seguras", asegurando que, si la máquina parte de un determinado punto, pueda llegar a su destino sin chocar con nada. Sin embargo, un fallo común en los mapas de seguridad es que a menudo le dicen a la máquina cómo llegar a un objetivo, pero no le indican cómo permanecer allí. Un vehículo podría llegar a un lugar de estacionamiento pero, debido al viento o a una velocidad repentina, ser incapaz de frenar lo suficiente como para permanecer estacionado, lo que provocaría que se desplace fuera de la zona segura y hacia el peligro. Esta brecha entre llegar y permanecer ha sido durante mucho tiempo un problema difícil para los científicos de la computación que intentan hacer que las máquinas sean verdaderamente fiables en entornos impredecibles.

Para resolver esto, un equipo de investigadores de la Universidad Estatal de North Carolina y la Universidad de Texas en Austin desarrolló una nueva forma de enseñar a las máquinas a alcanzar una meta y mantener su posición frente a cualquier perturbación. Se centraron en un desafío específico llamado el problema de "alcanzar-evitar-permanecer" (reach-avoid-stay). En términos sencillos, esto pregunta: desde qué puntos de partida puede una máquina alcanzar de forma segura un objetivo, evitar todos los obstáculos y luego permanecer dentro de ese objetivo para siempre, incluso si sopla el viento o la carretera está resbaladiza. Los métodos anteriores tenían dificultades con esto porque dependían de diseños matemáticos complejos que eran difíciles de crear para máquinas complicadas, o hacían suposiciones poco realistas, como asumir que un vehículo podía detenerse instantáneamente. Los investigadores propusieron un proceso de aprendizaje de dos pasos utilizando un tipo de inteligencia artificial conocida como aprendizaje por refuerzo profundo (deep reinforcement learning), donde una computadora aprende mediante ensayo y error en un mundo simulado.

El enfoque del equipo funciona como un viaje de dos etapas. Primero, la computadora aprende a identificar una zona interior especial dentro del área del objetivo. Esta zona interior es un lugar donde la máquina puede permanecer segura para siempre, sin importar las perturbaciones que enfrente. Los investigadores llaman a esto el "núcleo de viabilidad robusta" (robust viability kernel). Para encontrar esto, la IA aprende una política, o un conjunto de reglas, que mantiene a la máquina moviéndose de una manera que nunca le permita salirse de este círculo interior seguro. Una vez que la computadora ha dominado este comportamiento de "permanecer", pasa al segundo paso. Aquí, aprende cómo llevar a la máquina desde cualquier punto de partida hasta esa zona interior segura lo más rápido posible, evitando al mismo tiempo todos los obstáculos en el camino. Los investigadores demostraron matemáticamente que si una máquina puede alcanzar esta zona interior y luego permanecer allí, ha completado con éxito la tarea completa. Al combinar estos dos comportamientos aprendidos en un único sistema de conmutación, la máquina sabe exactamente cuándo conducir hacia el objetivo y cuándo cambiar a un modo que la mantenga fija en su lugar.

Los investigadores probaron este método en varios escenarios diferentes, que van desde un simple carro bidimensional en una pista hasta simulaciones complejas de alta dimensión de un taxi de despegue y aterrizaje vertical volando a través de una ciudad y un tractor descargando cultivos de una cosechadora en movimiento. En el caso del carro simple, compararon su nuevo método con una técnica antigua que utiliza funciones matemáticas complejas. Su nuevo enfoque identificó un área de inicio segura que era casi quince veces más grande que el área encontrada por el método anterior, lo que significa que permitía que la máquina comenzara desde muchas más posiciones sin riesgo de fallo. En las simulaciones más complejas que involucraban al taxi volador y al tractor, el nuevo método identificó las áreas de inicio seguras con una precisión superior al 95 por ciento, incluso cuando el proceso de aprendizaje incluyó pequeños errores típicos del entrenamiento computacional.

Los resultados mostraron una diferencia marcada entre las máquinas entrenadas con los métodos antiguos y aquellas entrenadas con este nuevo marco de dos pasos. Cuando se probó en el taxi volador, el método antiguo de "alcanzar y evitar" (reach-and-avoid), que solo se preocupa por llegar al objetivo, falló completamente en la tarea de permanecer allí, logrando una tasa de éxito del cero por ciento. En contraste, el nuevo método tuvo éxito el 93 por ciento de las veces. Del mismo modo, para el escenario del tractor, el nuevo método tuvo éxito el 99,3 por ciento de las veces, mientras que el método anterior tuvo éxito solo el 73,5 por ciento de las veces. Los investigadores descubrieron que los métodos antiguos a menudo conducían a las máquinas hacia el área del objetivo a plena velocidad, dejándolas sin forma de frenar y quedarse quietas. El nuevo método, sin embargo, aprendió a frenar la máquina temprano, asegurando que entrara en la zona interior segura a una velocidad en la que pudiera permanecer indefinidamente.

Si bien las simulaciones fueron altamente exitosas, los investigadores señalaron que su sistema depende de tener una comprensión precisa del entorno y de la física de la máquina antes de comenzar el entrenamiento. Si el mundo real se comporta de manera diferente al modelo computacional —por ejemplo, si el viento es más fuerte de lo previsto o el suelo es más resbaladizo— la máquina entrenada podría no ser capaz de garantizar la seguridad. El equipo sugiere que el trabajo futuro deberá integrar datos de sensores del mundo real para manejar estas incógnitas. Por ahora, este marco de aprendizaje de dos pasos ofrece un avance significativo, proporcionando una forma de enseñar a las máquinas no solo cómo llegar, sino cómo permanecer, convirtiendo una garantía de seguridad teórica en una herramienta práctica para aplicaciones compleas del mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →