← Últimos artículos
💻 computer science

Multi-UAV Path Planning in 3D based on APF-MADDPG

Este artículo propone un marco de aprendizaje por refuerzo profundo jerárquico que integra una función de recompensa densa basada en un campo de potencial artificial mejorado con el algoritmo Multi-Agent Deep Deterministic Policy Gradient (MADDPG) para lograr una planificación de trayectorias 3D eficiente y óptima para múltiples UAV en entornos desconocidos con obstáculos complejos.

Autores originales: Ming Bai, Yan Chen, Yi Liu

Publicado 2026-08-27
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ming Bai, Yan Chen, Yi Liu

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un cielo lleno de pequeñas aeronaves autónomas, cada una con la tarea de volar desde diferentes puntos de partida hacia un único punto de encuentro. Su misión no es solo llegar allí, sino arribar al mismo tiempo, zigzagueando a través de un mundo tridimensional que podría estar lleno de paredes invisibles, zonas peligrosas y otras aeronaves en movimiento. Este es el desafío de la planificación de trayectorias de múltiples drones. Durante décadas, los ingenieros han intentado resolver esto utilizando reglas basadas en la geometría o en el simple ensayo y error, pero estos métodos a menudo se estancan o fallan cuando el entorno se vuelve demasiado complejo o cambia inesperadamente. En años recientes, ha surgido un enfoque diferente: enseñar a estas máquinas a aprender haciendo. Al permitirles interactuar con un mundo simulado y recompensarlas por las buenas decisiones, los investigadores pueden ayudarlas a descubrir cómo navegar por su cuenta. Sin embargo, este proceso de aprendizaje suele ser lento y difícil, especialmente cuando las máquinas tienen que coordinarse entre sí sin chocar.

Un equipo de investigadores de la Universidad de Yan'an ha desarrollado un nuevo método para hacer que este proceso de aprendizaje sea más rápido y fiable para grupos de drones que vuelan en tres dimensiones. Combinaron dos ideas existentes: una forma de que múltiples máquinas aprendan juntas mientras se observan entre sí, y un concepto de navegación clásico que utiliza fuerzas invisibles para guiar el movimiento. En su enfoque, crearon un sistema donde los drones reciben retroalimentación constante, en lugar de solo una señal única de "buen trabajo" o "mal trabajo" al final de un vuelo. Esta retroalimentación constante actúa como un pequeño y continuo empujón, diciéndoles a los drones exactamente qué tan cerca están de su objetivo y qué tan lejos están de los obstáculos en cada momento. Esto ayuda a los drones a aprender mucho más rápido que antes.

Los investigadores probaron su método en una simulación informática que involucraba a tres drones. Los drones comenzaron en diferentes ubicaciones dentro de un espacio que mide 10 kilómetros por 10 kilómetros por 10 kilómetros. Su objetivo era volar a un punto de encuentro específico ubicado en las coordenadas 7, 4 y 1 kilómetros, todo ello mientras evitaban dos grandes obstáculos esféricos y un obstáculo cilíndrico alto. El equipo comparó su nuevo método con otros dos enfoques comunes. Uno de los métodos de comparación tenía a los drones aprendiendo enteramente por su cuenta sin compartir información, mientras que el otro les permitía aprender juntos pero sin el sistema especial de retroalimentación continua. Los resultados mostraron que los drones que utilizaban el nuevo método aprendieron la mejor estrategia con mayor rapidez. Llegaron al objetivo con éxito y evitaron todos los obstáculos, mientras que los drones que aprendían solos no lograron evitar las colisiones en varios intentos.

Al observar la eficiencia de los vuelos, el nuevo método también produjo distancias de viaje totales más cortas. El grupo de drones que utilizó el nuevo enfoque voló una distancia total combinada de 24.7056 kilómetros para completar su misión. En contraste, el grupo que utilizó el método de aprendizaje cooperativo estándar voló una distancia más larga de 25.9426 kilómetros. Los drones que aprendieron sin cooperación no lograron completar la misión de manera segura en absoluto. Los investigadores descubrieron que, al proporcionar a los drones un flujo constante de información sobre su progreso y seguridad, el sistema podía encontrar una mejor ruta más rápidamente. También estructuraron el entrenamiento en dos capas: una capa se centraba en planificar la ruta general y otra se centraba en ejecutar los movimientos específicos, lo que ayudó a los drones a aprender la compleja tarea de manera más efectiva.

Este trabajo sugiere que, al refinar la forma en que las máquinas reciben retroalimentación durante el entrenamiento, podemos ayudarlas a resolver problemas de navegación complejos mucho más rápido. El estudio no probó estos drones en el mundo físico real, pero las simulaciones proporcionaron una imagen clara de cómo se desempeña el método bajo condiciones controladas. Los hallazgos indican que, para que grupos de vehículos autónomos trabajen juntos de forma segura en un espacio tridimensional congestionado, necesitan una forma de comprender su progreso continuamente, en lugar de esperar hasta el final de una tarea para saber si tuvieron éxito. El nuevo método ofrece una forma de proporcionar esa comprensión, conduciendo a vuelos más seguros y eficientes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →