← Últimos artículos
🤖 AI

DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?

El artículo presenta DIRECT, un marco de enrutamiento que optimiza la planificación encarnada mediante la asignación dinámica de cómputo en tiempo de prueba a través de diferentes ejes de escalado (tales como la profundidad de razonamiento, el tamaño del modelo y la memoria) basándose en el contexto multimodal, logrando así tasas de éxito de nivel de frontera con una latencia y un costo significativamente menores en comparación con el escalado ingenuo o la selección fija de modelos.

Autores originales: Jadelynn Dao, Milan Ganai, Yasmina Abukhadra, Ajay Sridhar, Mozhgan Nasr Azadani, Katie Luo, Clark Barrett, Jiajun Wu, Chelsea Finn, Marco Pavone

Publicado 2026-06-11
📖 4 min de lectura☕ Lectura para el café

Autores originales: Jadelynn Dao, Milan Ganai, Yasmina Abukhadra, Ajay Sridhar, Mozhgan Nasr Azadani, Katie Luo, Clark Barrett, Jiajun Wu, Chelsea Finn, Marco Pavone

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres el gerente de la cocina de un restaurante con mucho movimiento. Tienes un equipo de chefs con diferentes niveles de habilidad y velocidad:

  • El Ayudante de Cocina Veloz: Rápido, económico y excelente para tareas sencillas como picar cebollas o lavar platos.
  • El Chef Maestro: Lento, costoso y brillante en tareas complejas como deshuesar un pescado o crear una salsa delicada.

En el mundo de la robótica, los Modelos de Visión y Lenguaje (VLM) actúan como el "chef principal" o el planificador. Observan una escena (como una mesa desordenada) y un comando (como "limpia la mesa"), luego desglosan la tarea en pasos que un brazo robótico debe seguir.

El problema es que muchos desarrolladores han estado tratando todas las tareas por igual: simplemente contratan al Chef Maestro para absolutamente todo. Piensan: "Si el Chef Maestro es el mejor, debemos usarlo para cada trabajo".

Pero, como señala el artículo DIRECT, esto es un desperdicio. Usar al Chef Maestro para lavar una sola taza toma demasiado tiempo y cuesta una fortuna, incluso cuando el Ayudante de Cocina Veloz podría hacerlo en un abrir y cerrar de ojos.

La idea central: El Mesero Inteligente

Los autores presentan DIRECT (Ruteador Dinámico de Inferencia para Compensaciones de Cómputo Encarnado). Piensa en DIRECT como un mesero superinteligente parado en la puerta de la cocina.

Cuando un cliente pide un plato (una tarea robótica), el mesero no se lo entrega directamente al Chef Maestro. En su lugar, el mesero analiza el pedido y el estado actual de la cocina:

  1. ¿Es simple? (ej. "Recoge la taza roja") -> El mesero se lo envía al Ayudante de Cocina Veloz.
  2. ¿Es complejo? (ej. "Clasifica estos libros por tamaño, luego ponlos en el estante sin tirar nada") -> El mesero se lo envía al Chef Maestro.

Este "ruteo" ocurre instantáneamente, ahorrando tiempo y dinero mientras se realiza el trabajo perfectamente.

Tres formas de "mejorar" al Chef

El artículo probó tres formas de hacer a un chef más "inteligente" (lo que llaman "escalar el cómputo en tiempo de ejecución") y descubrieron que cada mejora ayuda en situaciones diferentes:

  1. Pensar más tiempo (Cadena de Pensamiento / Chain-of-Thought):

    • La analogía: Pedirle a un chef que "piense en voz alta" antes de actuar.
    • El hallazgo: Esto es excelente para acertijos complicados donde necesitas razonar sobre la física o el espacio (ej. "¿Qué bloque está debajo del otro?"). Pero para tareas simples como "recoger la cuchara", pensar solo te retrasa. DIRECT aprende a saltarse el pensamiento para trabajos sencillos.
  2. Contratar a un Chef más grande (Tamaño del Modelo):

    • La analogía: Un Chef Maestro conoce 500 recetas; un chef junior solo conoce 50.
    • El hallazgo: Los chefs más grandes son mejores en habilidades raras o complejas (como "doblar una toalla" o "cerrar un cajón"). Pero para tareas comunes (como "poner la taza en la caja"), el gran chef no es mucho mejor que el pequeño. DIRECT usa al chef pequeño para tareas comunes y reserva al grande para las raras.
  3. Recordar el pasado (Memoria):

    • La analogía: Un chef que recuerda lo que pasó hace 10 minutos frente a uno que solo ve lo que hay en el mostrador en este momento.
    • El hallazgo: Si una tarea requiere recordar una secuencia (ej. "pon el primer bloque en la caja, luego el segundo"), necesitas al chef con memoria. Pero si la tarea es de un solo paso, la memoria es una carga. DIRECT solo activa la memoria cuando la tarea realmente la necesita.

Los resultados: Más rápidos y económicos

El equipo probó este sistema de "Mesero Inteligente" en robots reales (un brazo Franka) y en simulaciones.

  • El resultado: DIRECT logró igualar la tasa de éxito de los sistemas más caros y potentes, pero lo hizo hasta un 65% más rápido en promedio.
  • La conclusión: No necesitas usar la herramienta más poderosa para cada trabajo. Al emparejar inteligentemente la herramienta adecuada con la tarea adecuada, puedes obtener un rendimiento de "nivel de frontera" (los mejores resultados posibles) a una fracción del costo y el tiempo.

En resumen, DIRECT enseña a los robots a ser inteligentes sobre cómo piensan, asegurando que no piensen demasiado en problemas simples ni piensen poco en los complejos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →