← Últimos artículos
🤖 machine learning

Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference

Deltoris es un marco de co-diseño de algoritmo y hardware que permite la inferencia en tiempo real y con eficiencia energética para modelos de Visión-Lenguaje-Acción basados en difusión en dispositivos de borde, aprovechando la dispersión de bits con conciencia temporal, la inferencia especulativa y un acelerador sistólico de bits seriales personalizado para lograr aceleraciones significativas sobre las soluciones existentes.

Autores originales: Zheng Liu, Zeyu Guo, Zihan Liu, Anbang Wu, Han Zhao, Fangxin Liu, Zhezhi He, Yinhe Han, Jingwen Leng, Minyi Guo, Yiming Gan, Yu Feng

Publicado 2026-08-06
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zheng Liu, Zeyu Guo, Zihan Liu, Anbang Wu, Han Zhao, Fangxin Liu, Zhezhi He, Yinhe Han, Jingwen Leng, Minyi Guo, Yiming Gan, Yu Feng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina a un robot intentando aprender a jugar a atrapar la pelota. Para hacer esto, necesita un cerebro que pueda ver la pelota, entender las reglas y decidir exactamente cómo mover su brazo. En el mundo de la robótica, este "cerebro" es a menudo un tipo especial de programa informático llamado modelo de Visión-Lenguaje-Acción (VLA). Piensa en ello como un traductor superinteligente que convierte lo que el robot ve y oye en movimientos físicos. Durante mucho tiempo, estos robots fueron un poco lentos y torpes porque las matemáticas necesarias para hacerlos mover eran increíblemente pesadas, como intentar correr un maratón cargando una mochila llena de ladrillos.

Recientemente, los científicos descubrieron una nueva forma de enseñar a los robots a moverse llamada "difusión". Imagina a un robot aprendiendo a caminar primero tropezando en una habitación con niebla y luego despejando la niebla lentamente, paso a paso, hasta que encuentra el camino perfecto. Este método hace que los robots se muevan de forma mucho más fluida y manejen mejor las situaciones nuevas que antes. Sin embargo, hay un inconveniente: este proceso de "despejar la niebla" es tan computacionalmente pesado que es demasiado lento para su uso en tiempo real. Un robot necesita tomar decisiones de 50 a 200 veces cada segundo para mantenerse equilibrado y seguro, pero estos nuevos modelos tardaban demasiado, como un caracol intentando ganar una carrera contra un guepardo. Este es el problema que un equipo de investigadores se propuso resolver: ¿cómo hacemos que estos robots superinteligentes y de movimiento fluido sean lo suficientemente rápidos como para seguir el ritmo del mundo real?

Entra en escena Deltoris, un nuevo y astuto sistema diseñado para acelerar estos cerebros robóticos sin hacerlos más tontos. Los investigadores se dieron cuenta de que los robots no viven en un mundo donde todo cambia instantáneamente. Si un robot está alcanzando una taza, la vista de la taza de un milisegundo al siguiente es casi exactamente la misma. Es como ver una película donde el 98% de los fotogramas son idénticos; no necesitas redibujar toda la imagen cada vez, solo necesitas dibujar la pequeña parte que cambió.

Deltoris aprovecha esta observación a través de una técnica llamada dispersión a nivel de bits con conciencia temporal (temporal-aware bit-level sparsity). En lugar de recalcular todo el problema matemático para cada movimiento, el sistema solo calcula la diferencia entre el momento actual y el anterior. Es como enviar un mensaje de texto que solo dice "moví mi mano 2 pulgadas hacia arriba" en lugar de reescribir toda tu biografía cada vez que te mueves. Esto evita una enorme cantidad de trabajo innecesario, reduciendo los cálculos en más del 90%.

Sin embargo, hubo un contratiempo. Al enviar solo la "diferencia", el sistema tenía que buscar constantemente la información "antigua" en la memoria para compararla con la información "nueva", lo que creaba un atasco en el flujo de datos. Para solucionar esto, el equipo añadió un segundo truque llamado inferencia especulativa. Imagina a un entrenador que tiene un asistente pequeño y rápido que predice los próximos movimientos del juego, y luego un entrenador grande, lento y superinteligente que verifica esas predicciones todas a la vez en grupo. Esto permite que el sistema cargue los datos pesados una sola vez y los utilice para verificar múltiples pasos, suavizando el atasco de tráfico.

Para que toda esta magia suceda, los investigadores no solo escribieron software; construyeron un chip de hardware personalizado (un acelerador) diseñado específicamente para manejar estos cálculos de "diferencia". Crearon una línea de montaje especial de diminutos procesadores que trabajan juntos perfectamente, asegurando que nadie se quede inactivo mientras espera los datos.

Los resultados de sus experimentos son impresionantes. Cuando probaron Deltoris contra chips informáticos móviles estándar (como los de los teléfonos de alta gama) y otros chips especializados para robots, fue una victoria aplastante. Deltoris fue hasta 34,2 veces más rápido que las GPU móviles y 6,1 veces más rápido que los aceleradores especializados anteriores. Quizás incluso más importante, utilizó hasta 822 veces menos energía, lo cual es un gran avance para los robots que funcionan con baterías. El equipo también comprobó que el robot no se confundiera debido a estos atajos; la precisión se mantuvo casi exactamente igual, con solo una caída de rendimiento mínima y despreciable.

En resumen, Deltoris demuestra que, siendo inteligentes sobre qué calculamos (solo los cambios) y cómo lo calculamos (agrupando las predicciones), podemos finalmente dar a la IA incorporada la velocidad y la eficiencia que necesita para moverse por nuestro mundo en tiempo real. Es un paso significativo hacia robots que no solo pueden pensar, sino también actuar tan rápido como nosotros.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →