← Últimos artículos
🤖 machine learning

Learning to Control Coupled-Dynamics Environments with Joint Markov Decision Processes

Este artículo introduce métodos de control óptimo para Procesos de Decisión de Markov Conjuntos (JMDPs) mediante la definición de un operador de optimalidad de Bellman distributivo no paramétrico y la demostración de su convergencia hacia la ley de retorno conjunta óptima, preservando así las dependencias entre resultados contrafácticos que los MDPs estándar descartan.

Autores originales: Ege C. Kaya, Aliasghar Pourghani, Mahsa Ghasemi, Vijay Gupta, Abolfazl Hashemi

Publicado 2026-08-25
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ege C. Kaya, Aliasghar Pourghani, Mahsa Ghasemi, Vijay Gupta, Abolfazl Hashemi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, los agentes aprenden a tomar decisiones interactuando con un entorno, de forma muy similar a como un niño aprende a navegar por una habitación. Durante décadas, el marco matemático estándar para este aprendizaje ha sido el proceso de decisión de Markov. En este modelo, un agente prueba una acción específica, observa el único resultado que ocurre y utiliza esa experiencia para mejorar. Este enfoque funciona bien cuando el objetivo es simplemente maximizar la recompensa promedio a lo largo del tiempo. Sin embargo, esta visión estándar trata cada acción posible como si existiera en un universo separado e aislado. Asume que si el agente hubiera elegido un camino diferente, el resultado habría sido generado por un lanzamiento de dados completamente independiente. En muchas situaciones del mundo real, este supuesto es demasiado simple. A menudo, los resultados potenciales de las diferentes elecciones están vinculados por una realidad subyacente compartida. Una ráfaga repentina de viento, por ejemplo, podría afectar la trayectoria de un dron independientemente de la dirección que el piloto pretendiera volar. Cuando estos resultados están ligados por una causa común, el modelo estándar desecha información crucial sobre cómo se relacionan esas posibilidades entre sí.

Investigadores de la Universidad de Purdue han desarrollado una nueva forma de manejar estos escenarios vinculados, yendo más allá de la idea de elecciones aisladas hacia un marco donde los futuros potenciales de todas las acciones se calculan conjuntamente. Lo llaman un proceso de decisión de Markov conjunto. En lugar de preguntar, "¿Qué pasa si giro a la izquierda?" y luego preguntar por separado, "¿Qué pasa si giro a la derecha?", como si el mundo se reiniciara entre preguntas, su método pregunta: "Si giro a la izquierda y el viento sopla desde el norte, ¿qué sucede? Y si giro a la derecha mientras ese mismo viento sopla desde el norte, ¿qué sucede entonces?". Al mantener estos resultados contrafácticos —lo que habría sucedido si se hubiera tomado una decisión diferente— vinculados al mismo momento de aleatoriedad, los investigadores pueden ver cómo las diferentes acciones se influyen entre sí. Esto es vital para tareas críticas de seguridad o de asignación de recursos, donde comprender la relación entre las opciones es tan importante como conocer el valor de una sola opción.

El trabajo del equipo se centra en enseñar a un agente cómo encontrar la mejor estrategia en estos entornos complejos y vinculados. Demostraron que, si existe una acción claramente superior en cada paso, el proceso de aprendizaje del agente eventualmente se asentará en la estrategia perfecta, y la descripción matemática de todas las recompensas futuras posibles convergerá en la respuesta correcta. También demostraron que, incluso cuando dos acciones parecen igualmente buenas en promedio, el agente aún puede aprender las relaciones correctas entre ellas, siempre que dichas relaciones se estabilicen de una manera específica. Esto permite al sistema calcular no solo la recompensa promedio, sino también cómo las recompensas de diferentes acciones se mueven juntas. Por ejemplo, puede determinar si una recompensa alta para una acción tiende a venir acompañada de una recompensa baja para otra, o si tienden a subir y bajar en sincronía.

Para probar estas ideas, los investigadores realizaron simulaciones en diversos entornos, desde cadenas simples de estados hasta mundos de cuadrícula complejos e incluso una tarea de control continuo que involucraba una pértiga de equilibrio. En un experimento, examinaron un problema de elección de ruta en el que un conductor podía elegir entre un camino seguro y dos caminos riesgosos. Los caminos riesgosos estaban vinculados por una condición climática compartida: si el viento era favorable para uno, a menudo era desfavorable para el otro. Al utilizar su nuevo método, el agente aprendió a dividir el tráfico entre los dos caminos riesgosos. Debido a que los riesgos estaban vinculados negativamente, esta estrategia de división eliminó la posibilidad de un fallo total, un resultado que los métodos estándar, que ignoran el vínculo entre los caminos, no podrían haber logrado. En otra prueba, entrenaron redes neuronales para aprender estas relaciones a partir de datos. Las redes recuperaron con éxito las conexiones ocultas entre las acciones, demostrando que la información conjunta no es solo un concepto teórico, sino algo que puede ser aprendido y utilizado por los sistemas modernos de aprendizaje automático.

Los hallazgos sugieren que, al preservar la estructura de cómo se conectan las diferentes posibilidades, la inteligencia artificial puede tomar decisiones más robustas y matizadas. Los investigadores demostraron que sus herramientas matemáticas funcionan de manera confiable, convergiendo a las respuestas correctas tanto en escenarios simples como complejos. Mostraron que, mientras que los métodos estándar podrían pasar por alto la sutil interacción entre las elecciones, su enfoque captura la imagen completa de cómo el mundo responde a diferentes acciones bajo las mismas condiciones. Esto no solo mejora la puntuación promedio que un agente puede obtener; cambia fundamentalmente la forma en que el agente comprende el panorama del riesgo y la recompensa, permitiéndole navegar en entornos donde los destinos de las diferentes elecciones están inextricablemente ligados.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →