← Últimos artículos
🤖 machine learning

NAC: Neural Action Codec for Vision-Language-Action Models

Este artículo presenta el Neural Action Codec (NAC), una arquitectura inspirada en los códecs de audio neuronales que trata las trayectorias de acciones robóticas como señales unidimensionales multicanal para lograr una compresión de alta fidelidad y un rendimiento superior en modelos de Visión-Lenguaje-Acción en comparación con los métodos de tokenización existentes.

Autores originales: Ahad Jawaid, Yu Xiang

Publicado 2026-06-23
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ahad Jawaid, Yu Xiang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un brazo robótico a realizar una tarea delicada, como apilar bloques o servir una bebida. El robot necesita moverse de forma suave y precisa, pero el cerebro informático que lo controla (un modelo de "Visión-Lenguaje-Acción") se utiliza para pensar en palabras e imágenes, no en el flujo suave y continuo del movimiento físico.

Para que puedan comunicarse, tenemos que traducir los movimientos suaves del robot a un lenguaje que la computadora entienda: una lista de pasos discretos o "tokens". Piensa en esto como convertir una canción fluida y suave en una serie de notas musicales.

El Problema: El método antiguo era tosco

Anteriormente, los científicos intentaron realizar esta traducción de dos maneras principales:

  1. El método de "Binning" (Agrupación): Imagina intentar describir una curva suave usando solo una regla con muy pocas marcas. Tendrías que fragmentar el movimiento en pasos diminutos y dentados. Esto crea una lista masiva de instrucciones que es lenta de procesar y a menudo inexacta.
  2. El método de "Frecuencia": Algunos intentaron comprimir el movimiento como un archivo zip, pero utilizaron herramientas diseñadas para la voz humana. Aunque esto ayudó, no era perfecto porque los movimientos de un robot y las voces humanas son fundamentalmente diferentes.

La Solución: Tomando prestado de la música (NAC)

Los autores de este artículo, Ahad Jawaid y Yu Xiang, tuvieron una idea ingeniosa: ¿Por qué no usar la tecnología que comprime la música?

Los modelos de IA modernos para audio (como los que generan música o comprimen archivos de Spotify) son increíblemente buenos para tomar una onda de sonido compleja y convertirla en una lista compacta de códigos, para luego reconstruir el sonido perfectamente después. A esto lo llaman un "Códec de Audio Neuronal".

El equipo se dio cuenta de que el movimiento de un robot es, en realidad, una onda de sonido disfrazada.

  • Audio: Una onda de presión de aire cambiando a lo largo del tiempo (alta frecuencia).
  • Acción del Robot: Una onda de ángulos de articulación cambiando a lo largo del tiempo (frecuencia más baja).

Construyeron un nuevo sistema llamado NAC (Neural Action Codec). Tomaron el motor de "compresión de música" y lo adaptaron para "comprimir" los movimientos del robot.

El Giro: No escuches al robot

Aquí está el descubrimiento más importante que hace el artículo: No puedes enseñar a un robot a moverse escuchándolo.

Los códecs de audio están entrenados para sonar bien para los oídos humanos. Utilizan un filtro especial llamado "espectrograma Mel" que imita cómo el oído humano percibe el tono. Los autores descubrieron que si usaban este filtro de audición humana para los robots, el robot fallaría por completo. Es como intentar afinar una guitarra escuchando el ladrido de un perro; las herramientas no coinciden.

En su lugar, eliminaron los filtros del "oído humano" y los reemplazaron con matemáticas simples que solo se preocupan por la precisión. Le dijeron a la IA: "No te preocupes por cómo suena; solo asegúrate de que la mano del robot termine exactamente en el lugar correcto".

Cómo funciona (La analogía)

Piensa en el movimiento del robot como una película larga y compleja.

  1. El Codificador (El Resumidor): El sistema NAC observa la película y la descompone en algunas escenas clave (estructura gruesa) y luego rellena los detalles diminutos (movimientos finos). Convierte toda la película en una lista corta y eficiente de códigos.
  2. El Decodificador (El Proyector): Cuando el robot necesita moverse, toma esa lista corta de códigos y utiliza un proyector especial (llamado cabezal ISTFT) para convertirla de nuevo en una película de movimiento suave y de alta definición.
  3. El "Discriminador" (El Crítico): Para asegurar que el movimiento sea fluido y no brusco, el sistema utiliza una IA "crítica" que coteja el movimiento con el original. Si el movimiento parece demasiado entrecortado, el crítico grita "¡No!" y obliga al sistema a intentarlo de nuevo hasta que sea suave.

Los Resultados

El equipo probó este nuevo método contra los métodos antiguos en simulaciones por computadora y en el mundo real.

  • En Simulaciones: El robot que utilizaba NAC fue significativamente mejor completando tareas (como apilar bloques) que los robots que usaban los métodos antiguos. Fue más preciso y cometió menos errores.
  • En el Mundo Real: Cuando lo probaron en robots físicos reales, el NAC también ganó, logrando una tasa de éxito del 50% en comparación con las tasas mucho más bajas de otros métodos.

La Conclusión

El artículo afirma que, al tratar los movimientos de los robots como ondas de audio y utilizar las mejores herramientas de la industria musical (pero eliminando los filtros del "oído humano"), podemos enseñar a los robots a moverse de manera mucho más eficiente. Convierte un problema físico, continuo y desordenado en una lista de instrucciones ordenada y organizada que la IA moderna puede aprender y predecir fácilmente.

En resumen: Enseñaron a los robots a moverse enseñándoles a "cantar" sus movimientos, pero se aseguraron de que el robot cantara en su propio lenguaje, no en uno humano.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →