← Últimos artículos
⚡ electrical engineering

Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson

Este artículo demuestra que un sistema de manipulación bimanual entrenado en una GPU de escritorio puede ejecutarse con éxito de forma íntegra en un Jetson Orin Nano Super de nivel básico de 8 GB mediante el empleo de detección GStreamer de copia cero para liberar recursos de la CPU y ACT cuantizado con TensorRT (que supera a Diffusion Policy en convergencia y latencia) para lograr la recogida y colocación en tiempo real de objetos deformables.

Autores originales: Ekansh Singh, Eva Samuel, Alessandra Reneau, Ryan Schmeelk, Yashvi Gandhi

Publicado 2026-08-05
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Ekansh Singh, Eva Samuel, Alessandra Reneau, Ryan Schmeelk, Yashvi Gandhi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde los robots no son solo máquinas toscas en una fábrica, sino ayudantes ágiles que pueden doblar la ropa, entregarte una bebida o recoger un cojín de frijoles blandito con dos manos a la vez. Durante mucho tiempo, enseñar a estos robots a realizar tareas tan delicadas requería "teleoperación", donde un humano guía remotamente los brazos del robot para mostrarle cómo se hace. El robot aprende entonces copiando estos movimientos, un proceso llamado "aprendizaje por imitación". Pero aquí está el truco: hasta ahora, el "cerebro" de estos robots solía necesitar una computadora masiva y costosa —como una estación de trabajo supercargada con una tarjeta gráfica gigante— para pensar y moverse. Esto significaba que el robot a menudo estaba encadenado a una máquina pesada y hambrienta de energía, lo que dificultaba su uso en hogares reales o sobre la marcha. La gran pregunta que los investigadores se plantean es: ¿Podemos encoger este cerebro gigante para que quepa dentro de un chip de computadora diminuto y económico que viva directamente en el propio robot?

Este artículo da un paso audaz en esa dirección. Los investigadores construyeron un sistema robótico de dos manos que se ejecuta enteramente en un NVIDIA Jetson Orin Nano Super, un chip de computadora pequeño y de nivel de entrada con solo 8 GB de memoria (aproximadamente el tamaño del almacenamiento de un smartphone grande). Lo probaron en una tarea complicada: recoger un saco de frijoles deformable con dos brazos y moverlo a un punto objetivo. Querían ver si podían hacer que el robot fuera lo suficientemente rápido e inteligente como para trabajar sin ayuda de una computadora grande.

Las tres grandes sorpresas

El equipo comenzó con tres grandes suposiciones sobre cuál sería la parte más difícil de hacer que esto funcionara. Esperaban encontrarse con límites de memoria, esperaban tener que elegir entre dos tipos diferentes de arquitecturas de "cerebro" y esperaban que hacer al robot más rápido requiriera sacrificar la precisión. Pero sus experimentos dieron la vuelta a estas suposiciones.

1. El mito de la memoria: No fue la RAM, fue la CPU
Los investigadores pensaron que la transmisión de video desde tres cámaras (una en la cabeza del robot, dos en sus muñecas) llenaría la memoria de 8 GB del robot, causando que se bloqueara o perdiera fotogramas. Construyeron un canal de "copia cero" especial para mantener los datos de video en la memoria de gráficos sin moverlos de ida y vuelta al procesador principal, con la esperanza de ahorrar espacio.

  • La realidad: Se equivocaron sobre la memoria. La forma estándar de mover los datos de video en realidad encajaba perfectamente dentro del límite de 8 GB y no perdió ni un solo fotograma.
  • La verdadera victoria: El truco de "copia cero" no ahorró espacio; ahorró tiempo y capacidad de procesamiento. Al evitar que el procesador principal del robot desperdiciara energía moviendo los datos de video, liberaron una enorme cantidad de potencia de la CPU. El uso pico de un solo núcleo del procesador cayó de un sudoroso 98.0% a un relajado 77.0%. Esto es como quitarle una mochila pesada a un corredor; el corredor no se hace más grande, pero puede correr mucho más rápido y fluido. Este margen de maniobra adicional fue crucial para mantener el bucle de control del robot funcionando suavemente sin perder el ritmo.

2. La carrera del cerebro: Velocidad vs. Paciencia
El equipo entrenó dos tipos diferentes de cerebros robóticos con el mismo conjunto de demostraciones: ACT (Action Chunking with Transformers) y Diffusion Policy.

  • La configuración: Le dieron a ACT 100,000 pasos de entrenamiento (una cantidad estándar para este tipo de cerebro) y le dieron a Diffusion Policy 200,000 pasos (el doble, porque la Difusión suele necesitar más tiempo para aprender).
  • El resultado: ACT aprendió la tarea perfectamente, teniendo éxito en 19 de 20 ensayos. Diffusion Policy, a pesar de recibir el doble de tiempo de entrenamiento, no logró aprender una estrategia utilizable en absoluto (0 de 10 ensayos).
  • La conclusión: Esto no se debió a que la Difusión sea un "mal" cerebro. Es porque la Difusión es costosa de entrenar. Con un presupuesto ajustado, el "aprendiz más rápido" (ACT) fue el único que pudo terminar la carrera. Los investigadores enfatizan que esto no significa que la Difusión sea peor para siempre, solo que cuesta demasiados "pasos de gradiente" (tiempo de entrenamiento) para ser práctica para esta configuración específica en este momento.

3. El truco de velocidad: Cuando "suficientemente bueno" es en realidad perfecto
Para hacer al robot lo suficientemente rápido como para reaccionar en tiempo real, el equipo convirtió el cerebro ACT para que se ejecutara en un motor especializado llamado TensorRT e intentó ejecutarlo con una precisión menor (usando matemáticas FP16 e INT8 en lugar de las superprecisas FP32).

  • El aumento de velocidad: Bajar la precisión hizo que el robot pensara mucho más rápido. El tiempo que tardó en tomar una decisión cayó de 114.02 ms (milisegundos) con precisión completa a 17.93 ms con FP16, y bajó a 12.65 ms con INT8. Eso es casi 9 veces más rápido.
  • La sorpresa: Normalmente, cuando haces que una computadora sea más "torpe" al usar una precisión menor, comete errores. Pero aquí, incluso con las matemáticas más "torpes" (INT8), el robot todavía tuvo éxito en 19 de 20 ocasiones. Los errores numéricos fueron enormes (hasta un 16.98% de desviación en algunos números), pero el robot aun así atrapó el saco de frijoles.
  • El detalle: Los investigadores descubrieron que si necesitas este truco de velocidad depende de cómo el robot planee sus movimientos. Si el robot planea un bloque entero de 100 movimientos a la vez (que fue lo que hizo), puede permitirse ser lento. Pero si necesita replanificar cada paso (una técnica llamada "ensamblaje temporal"), entonces la versión lenta de precisión completa incumpliría su plazo, y la versión rápida de menor precisión se vuelve obligatoria.

El veredicto final

El artículo concluye que, de hecho, se puede ejecutar un robot complejo de dos manos en una computadora diminuta de $8 GB. El secreto no es solo ahorrar memoria; se trata de gestionar la carga de trabajo del procesador para que no se vea abrumado.

Recomiendan una configuración específica para cualquiera que intente construir un robot similar:

  • Usar el canal de video GStreamer para liberar potencia de la CPU.
  • Entrenar la política ACT (es más rápida de aprender que la Difusión para esta tarea).
  • Ejecutar la política en precisión FP16 (que es lo suficientemente rápida y precisa) o INT8 si se necesita aún más velocidad.

¿La lección más importante? No asumas que la computadora más grande es la única opción. A veces, la mejor manera de hacer que un robot sea inteligente es dejar de hacer que desperdicie energía en cosas que no necesita hacer, y dejar que se concentre en el trabajo que tiene entre manos. El robot no necesitaba una supercomputadora; solo necesitaba un poco de eficiencia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →