← Últimos artículos
🤖 AI

Decoupling Planning and Control for Instructable Agents

Este artículo presenta Instruct-to-Act, un marco desacoplado que combina la planificación de alto nivel de los modelos de visión y lenguaje con controladores de modelos de mundo rápidos y condicionados por el lenguaje para lograr un control corporizado robusto y de baja latencia a través de diversos entornos de agente único y de múltiples agentes.

Autores originales: Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr

Publicado 2026-08-28
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, existe una división persistente entre pensar y hacer. Por un lado, tenemos los modelos de lenguaje extensos, los sistemas capaces de leer una instrucción compleja, comprender un objetivo y desglosarlo en una secuencia lógica de pasos. Estos modelos son excelentes en el razonamiento de alto nivel, de forma muy similar a un humano dando direcciones, pero a menudo son demasiado lentos y torpes para realizar los movimientos físicos de una fracción de segundo requeridos para navegar en un mundo real o virtual. Por otro lado, tenemos sistemas de control especializados que pueden reaccionar instantáneamente a su entorno, moviéndose con velocidad y precisión, pero carecen de la capacidad de comprender objetivos abstractos o seguir una conversación. Son como un atleta altamente capacitado que puede correr rápido pero no sabe a dónde ir sin un entrenador gritando comandos específicos. Para que un robot o un agente digital sea verdaderamente útil en entornos complejos y cambiantes, necesita tanto la capacidad de planificar como la capacidad de actuar, aunque combinar estas dos capacidades distintas ha sido históricamente un desafío de ingeniería difícil.

Un equipo de investigadores ha abordado esta división con un nuevo sistema llamado Instruct-to-Act, que separa con éxito la tarea de planificar de la tarea de controlar. En lugar de intentar forzar a un único modelo masivo a hacer todo a la vez, construyeron una asociación entre dos componentes especializados. El primero es un planificador, que utiliza un modelo de visión y lenguaje preentrenado para observar el entorno y el objetivo del usuario, y luego escribe una instrucción sencilla de alto nivel. El segundo es un controlador, un sistema ligero entrenado específicamente para tomar esas instrucciones y convertirlas en un flujo rápido de acciones físicas. La innovación clave es que estas dos partes operan de forma independiente pero sincronizada. El planificador puede tomarse su tiempo para pensar, razonar e incluso comunicarse con otros agentes, mientras que el controlador ejecuta los movimientos necesarios a alta velocidad, sin esperar a que el planificador termine cada uno de sus pensamientos. Este diseño permite al sistema manejar tareas complejas y de largo plazo en videojuegos y mundos simulados con un nivel de velocidad y fiabilidad que intentos anteriores no pudieron igualar.

Los investigadores probaron este enfoque en siete entornos diferentes, que van desde juegos de arcade clásicos hasta escenarios cooperativos complejos donde múltiples agentes deben trabajar juntos. En estas pruebas, el planificador actúa como el cerebro, observando el mundo y decidiendo qué debe hacerse a continuación, mientras que el controlador actúa como las manos y los pies, llevando a cabo el plan en tiempo real. Para enseñar al controlador cómo seguir estas instrucciones, los investigadores no dependieron de expertos humanos para demostrar cada movimiento. En su lugar, utilizaron al propio planificador para observar de nuevo las acciones exitosas del controlador y escribir un resumen de lo que estaba sucediendo. Este proceso permitió al controlador aprender cómo traducir comandos de lenguaje natural vagos en movimientos precisos de bajo nivel. El resultado es un sistema que puede emparejarse con diferentes planificadores sin necesidad de ser reentrenado, lo que lo hace altamente flexible.

Los hallazgos muestran que esta separación de funciones funciona notablemente bien. Cuando los investigadores compararon su sistema con otros que intentan generar acciones directamente a partir de un modelo de lenguaje extenso, su enfoque fue significativamente más rápido y preciso. Los métodos de generación directa a menudo tropezaban, produciendo acciones que eran demasiado lentas o irrelevantes para la situación inmediata. En contraste, el sistema Instruct-to-Act mantuvo una alta velocidad de ejecución y, al mismo tiempo, siguió instrucciones complejas. En las pruebas multiagente, donde dos o más personajes digitales tenían que coordinarse para resolver acertijos, el sistema les permitió comunicarse mediante el lenguaje, negociar roles y lograr objetivos compartidos sin estorbarse entre sí. El sistema se desempeñó de manera competitiva contra los métodos existentes más fuertes en seis de los siete entornos probados, demostrando que un enfoque desacoplado puede manejar las demandas tanto del razonamiento de alto nivel como del control de baja latencia.

Uno de los aspectos más sorprendentes del trabajo es su eficiencia. Debido a que el controlador es un modelo pequeño y especializado, puede procesar información visual y emitir acciones miles de veces por segundo, mientras que el planificador se ejecuta en segundo plano, actualizando su estrategia solo cuando es necesario. Esto significa que el sistema no se queda estancado por el tiempo de procesamiento lento del modelo de lenguaje extenso. Los investigadores encontraron que esta configuración asíncrona permitió a los agentes escalar eficazmente; a medida que añadían más agentes a una tarea cooperativa, el sistema mantenía su rendimiento sin los cuellos de botella de comunicación que suelen afectar a otros sistemas multiagente. El controlador se mantuvo fiable, siguiendo las instrucciones con una tasa de precisión entre el 86% y el 97% a través de diferentes tareas y planificadores, demostrando que el sistema aprendió a entender la intención detrás de las palabras en lugar de solo memorizar frases específicas.

El estudio también exploró cómo la calidad de las instrucciones afecta el resultado. Descubrieron que incluso cuando las instrucciones eran generadas por diferentes planificadores o tenían una complejidad variable, el controlador podía adaptarse y desempeñarse bien. Esto sugiere que el sistema ha aprendido una forma robusta de interpretar el lenguaje, en lugar de solo memorizar un conjunto específico de comandos. Los investigadores señalaron que el sistema funciona mejor cuando las instrucciones son claras y están fundamentadas en la situación inmediata, pero aún puede manejar la ambigüedad mejor que los métodos anteriores. Al mantener las capas de planificación y control separadas, los investigadores crearon un marco que no solo es poderoso, sino también modular, permitiéndoles intercambiar diferentes planificadores o controladores según las necesidades específicas de la tarea.

En última instancia, este trabajo demuestra un camino práctico para construir agentes inteligentes que puedan operar en el mundo real. Al reconocer que pensar y actuar requieren diferentes velocidades y diferentes tipos de inteligencia, los investigadores han creado un sistema que aprovecha las fortalezas de ambos. El planificador proporciona la visión y la estrategia, mientras que el controlador proporciona la velocidad y la precisión. Este enfoque evita los errores de intentar forzar a un solo modelo a hacer todo, resultando en un sistema que es inteligente y rápido a la vez. A medida que los investigadores avanzan, ven el potencial para aplicar este marco a escenarios más complejos, incluyendo la colaboración humano-robot y tareas que requieren planificación a largo plazo en entornos dinámicos. El éxito de Instruct-to-Act sugiere que el futuro de la IA incorporada puede no residir en la construcción de modelos monolíticos más grandes, sino en el diseño de asociaciones más inteligentes y eficientes entre diferentes tipos de inteligencia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →