← Últimos artículos
🤖 AI

Real-Time Execution with Autoregressive Policies

Este artículo demuestra que las políticas autorregresivas pueden lograr una ejecución en tiempo real con límites de latencia estrictos mediante el ajuste de los horizontes de tokenización y la aplicación de una decodificación restringida, superando así a sus contrapartes de ajuste de flujo tanto en la velocidad de finalización de tareas como en la generalización.

Autores originales: Sangkyu Lee, Seohyeon Park, Tackgeun You, Avi Caciularu, Idan Szpektor, Hwasup Lim, Youngjae Yu

Publicado 2026-06-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sangkyu Lee, Seohyeon Park, Tackgeun You, Avi Caciularu, Idan Szpektor, Hwasup Lim, Youngjae Yu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a realizar una tarea, como apilar vasos o recoger un juguete. Para hacer esto, el robot utiliza un "cerebro" (un modelo de IA grande) que observa el mundo, piensa qué hacer y luego envía comandos a sus brazos.

El problema con estos cerebros de IA grandes es que son pensadores lentos. Necesitan tiempo para procesar la información antes de poder hablar. En la forma antigua de hacer las cosas (Inferencia Síncrona), el robot tenía que detenerse por completo, esperar a que el cerebro terminara de pensar y luego moverse de nuevo. Es como un conductor que tiene que detener el coche en cada semáforo en rojo, esperar a que la luz cambie a verde y luego arrancar de nuevo. Esto hace que el robot sea torpe, lento e incapaz de responder a cambios repentinos.

Para solucionar esto, los investigadores normalmente intentaban usar un tipo de "cerebro" diferente (llamado Políticas de Difusión) que pudiera pensar más rápido. Pero los autores de este artículo se preguntaron: ¿Qué pasaría si hiciéramos que el cerebro "Autorregresivo" original, que es más lento, funcionara igual de bien en tiempo real?

Así es como lo hicieron, utilizando una analogía sencilla:

La analogía del "Chef y el Camarero"

Imagina que el cerebro del robot es un Chef (el modelo de IA) y el brazo del robot es un Camarero.

El viejo problema (Síncrono):
El Camarero le pregunta al Chef: "¿Qué debo hacer a continuación?". El Chef deja de cocinar, piensa durante mucho tiempo, escribe una receta completa de 10 pasos en un papel y se la entrega al Camarero. El Camarero lee todo y luego comienza a realizar los pasos. Mientras el Camarero está ocupado realizando los primeros 5 pasos, el Chef se queda ahí sentado sin hacer nada, esperando a que el Camarero termine antes de pensar la siguiente receta. Esto causa que el robot se "pause" y se quede rezagado.

La nueva solución (Ejecución en tiempo real con Políticas Autorregresivas):
Los autores se dieron cuenta de que podían cambiar la forma en que el Chef y el Camarero se comunican sin cambiar el cerebro del Chef.

  1. Lotes más pequeños (El horizonte de tokenización):
    En lugar de pedirle al Chef que escriba una receta completa de 10 pasos a la vez, le piden solo 2 pasos a la vez. Esto es mucho más rápido de escribir.

    • Analogía: El Chef escribe una nota diminuta: "Paso 1: Recoger el vaso. Paso 2: Mover hacia el plato". El Camarero agarra esta nota inmediatamente y comienza a moverse.
  2. La cola de acciones (La cinta transportadora):
    El Camarero mantiene una pequeña bandeja (una cola) de estas notas diminutas. Tan pronto como el Camarero termina la primera nota, agarra la siguiente nota de la bandeja.

    • Analogía: El Camarero nunca deja de moverse porque siempre hay una nota lista en la bandeja. El Chef está ocupado escribiendo la siguiente nota mientras el Camarero ya está realizando la nota actual. Esto es Inferencia Asíncrona (pensar mientras se mueve).
  3. El guardián de seguridad (Decodificación con restricciones):
    Dado que el Chef está escribiendo más rápido, existe el riesgo de que escriba una nota que sea demasiado larga o que no tenga sentido (como una receta que dice "saltar a la luna"). Los autores añadieron un "Guardián de Seguridad" que revisa el trabajo del Chef.

    • Analogía: El Guardián de Seguridad asegura que el Chef solo escriba notas que sean lo suficientemente cortas como para ser leídas antes de que el Camarero se quede sin tiempo. Si el Chef intenta escribir una frase demasiado larga, el Guardián la corta o la obliga a ser una versión más simple. Esto garantiza que el Camarero nunca tenga que detenerse a esperar.
  4. La estrategia de "Mejor suposición" (Decodificación de múltiples trayectorias):
    Mientras el Camarero está ocupado, el Chef tiene un poco de tiempo extra. En lugar de solo escribir una nota, el Chef redacta rápidamente cuatro versiones diferentes del siguiente paso y elige la mejor.

    • Analogía: El Chef piensa: "Opción A: Mover a la izquierda. Opción B: Mover a la derecha. Opción C: Levantar alto. Opción D: Levantar bajo". El Guardián de Seguridad revisa las cuatro rápidamente, y el Camarero elige la mejor para ejecutarla. Esto hace que el robot sea más inteligente y preciso sin ralentizarlo.

¿Qué descubrieron?

Los investigadores probaron este nuevo método en robots tanto en simulaciones por computadora como en el mundo real.

  • Más rápido que el cerebro "lento": Aunque el cerebro "Autorregresivo" original era conocido por ser lento, este nuevo método hizo que funcionara de forma tan fluida que, de hecho, superó el rendimiento de los cerebros de Difusión más nuevos y "rápidos" en muchas tareas.
  • Mejor siguiendo instrucciones: Debido a que el cerebro Autorregresivo es naturalmente bueno entendiendo lenguaje complejo (como un humano leyendo una receta), siguió las instrucciones mejor que otros tipos de robots, incluso cuando se movía rápidamente.
  • Sin más pausas: El robot nunca dejó de moverse. Reaccionaba a los cambios instantáneamente porque el "Chef" siempre iba un paso por delante, escribiendo la siguiente nota mientras el "Camarero" aún se estaba moviendo.

La gran conclusión

Este artículo demuestra que no es necesario cambiar a un tipo de cerebro de IA completamente diferente para lograr que un robot se mueva en tiempo real. Solo necesitas cambiar cómo le pides las instrucciones al cerebro. Al dividir las instrucciones en trozos diminutos, revisarlas para asegurar la velocidad y permitir que el cerebro piense mientras el robot se mueve, puedes hacer que incluso los pensadores "lentos" se vuelvan rápidos, fluidos y altamente reactivos.

En resumen: No cambies el motor; solo cambia la transmisión.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →