← Últimos artículos
💻 computer science

Beyond Transformers: Linear Attention Policy for Open-Vocabulary Object Goal Navigation

Este artículo presenta LANav, una política de navegación que reemplaza la atención selectiva estándar basada en Transformers con un mecanismo de atención lineal estructurada —específicamente mejorado por la Atención Lineal de Expansión de Estado Ponderada (WSLA)— para lograr un rendimiento superior en navegación de objetivos de objetos de vocabulario abierto, eficiencia computacional y una transferencia de simulación a realidad robusta en comparación con las líneas base existentes.

Autores originales: Jiahong Zhang, Yifan Lin, Yandong Zhang, Sijun Shen, Kexin Wang, Yuqi Pan, Hongjuan Pei, Wei Wang, Guoqi Li

Publicado 2026-07-22
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Jiahong Zhang, Yifan Lin, Yandong Zhang, Sijun Shen, Kexin Wang, Yuqi Pan, Hongjuan Pei, Wei Wang, Guoqi Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de encontrar un objeto específico, como una "tostadora vintage", en una casa que nunca has visto antes. Solo puedes ver lo que tienes directamente enfrente a través de una ventana estrecha, y tienes que recordar por dónde has estado, qué has visto y qué es lo que estás buscando para dar tu siguiente paso. Esta es la vida diaria de un robot navegando por el mundo, un campo de la ciencia llamado IA Embodied (IA con cuerpo). Para hacer esto, los robots utilizan un "cerebro" (una red de política) que actúa como una memoria a corto plazo, actualizando constantemente su estado interno basándose en nuevas vistas y sonidos. Durante mucho tiempo, los científicos intentaron construir este tipo de memoria de dos formas principales: una que comprime la historia en un único resumen que se va encogiendo (como un cuaderno de la vieja escuela), y otra que mantiene una lista larga de todo lo visto recientemente y vuelve a leer toda la lista cada vez para encontrar conexiones (como un bibliotecario súper organizado pero lento). La gran pregunta era: ¿qué método ayuda mejor a un robot a encontrar su camino cuando el objeto que busca puede tener un nombre extraño o estar en una casa completamente nueva?

Este artículo presenta un nuevo enfoque llamado LANav (Navegación basada en Atención Lineal) y una mejora especial llamada WSLA. Los investigadores descubrieron que el método del "súper-bibliotecario" (usar Transformers con auto-atención), que se pensaba que era el estado del arte, en realidad choca contra un muro cuando el robot necesita recordar un viaje largo. Sorprendentemente, hacer que el robot mirara una historia más larga no ayudó al Transformer a mejorar; de hecho, a veces empeoraba. En cambio, el equipo descubrió que un método llamado Atención Lineal, que actualiza su memoria como un flujo constante y estructurado en lugar de volver a leer una lista completa, funciona mucho mejor. Tomaron esta idea y la potenciaron con WSLA, que divide la memoria en múltiples "sub-flujos" y aprende qué peso darle a cada uno. En las pruebas, este nuevo sistema encontró objetos el 36.4% de las veces en una simulación desafiante, superando por un margen claro a los mejores modelos Transformer. Lo que es aún más genial es que lo probaron en un robot perro real en una habitación real, y tuvo éxito el 82% de las veces, demostrando que esta idea de "memoria de flujo" (streaming memory) funciona no solo en computadoras, sino en el mundo real.

El Problema: La crisis de memoria del robot

Imagina que estás caminando a través de un laberinto gigante y desconocido buscando una "silla azul". Solo puedes ver unos pocos pasos por delante. Cada vez que doblas una esquina, ves algo nuevo, pero también olvidas lo que viste hace diez segundos. Para encontrar la silla, tu cerebro necesita retener pistas: "Pasé por una puerta roja", "Escuché un ventilador", "Giré a la izquierda dos veces".

Durante años, los científicos de los robots intentaron resolver esto con dos tipos principales de memoria:

  1. El Compresor (RNNs): Estos son como un robot que aplasta todos sus recuerdos pasados en una bola diminuta y densa. Es rápido, pero a medida que el viaje se alarga, la bola se vuelve tan pequeña y desordenada que el robot olvida los detalles importantes.
  2. El Re-lector (Transformers): Estos son como un robot que guarda un pergamino perfecto y largo de todo lo que ha visto. Cada vez que necesita decidir hacia dónde ir, vuelve a leer el pergamino entero de principio a fin para encontrar conexiones. Esto es poderoso, pero es lento y se vuelve caótico si el pergamino se hace demasiado largo.

Los investigadores se preguntaron: "Si le damos al robot un pergamino más largo (una historia más larga), ¿mejorará su capacidad para encontrar cosas?". Probaron esto con el enfoque del "Re-lector" (Transformer) en una tarea llamada Navegación de Objetivo de Objeto de Vocabulario Abierto. Esta es una forma elegante de decir: "Encuentra un objeto que te describo, incluso si uso un nombre extraño que nunca has oído antes, como 'una cosa que contiene sopa' en lugar de 'una olla'".

La Sorpresa: Más historia no ayudó

El equipo realizó una serie de experimentos controlados. Mantuvieron todo igual —los ojos del robot, los mapas, las reglas de entrenamiento— y solo cambiaron el sistema de memoria. Esperaban que, si le daban al robot Transformer un pergamino más largo para leer, este encontraría los objetos con más frecuencia.

Pero aquí está el giro: No funcionó.

Cuando aumentaron la longitud de la historia que el Transformer podía ver, el rendimiento del robot no mejoró. De hecho, en algunos casos, empeoró ligeramente. Era como si el robot se estuviera ahogando en sus propios recuerdos, incapaz de descifrar qué partes del largo pergamino realmente importaban. El método del "Re-lector" parecía haber alcanzado un techo. Resulta que, para un robot que deambula por un laberinto, estar releyendo constantemente toda la historia no es la mejor forma de actualizar su estado.

La Solución: La memoria de "Flujo" (Streaming)

Los investigadores probaron entonces un enfoque diferente: la Atención Lineal. En lugar de re-leer todo el pergamino, imagina un robot que tiene una "memoria de flujo". Mientras camina, actualiza su estado interno paso a paso, como un río fluyendo. No mira hacia atrás a todo el río; simplemente actualiza el nivel del agua basándose en la nueva lluvia (nueva observación) y el flujo actual.

Construyeron un sistema llamado LANav utilizando este método de flujo. Los resultados fueron inmediatos e impresionantes.

  • Mejor que los métodos antiguos: LANav superó tanto a los modelos "Compresores" (RNN) como a los "Re-lectores" (Transformer).
  • Más largo es mejor: A diferencia del Transformer, cuando le dieron al robot LANav una historia más larga para aprender, este en realidad mejoró. Cuanto más larga era la historia de entrenamiento, más inteligente se volvía el robot.

La Mejora: WSLA (El cerebro de múltiples flujos)

Los investigadores no se detuvieron ahí. Se dieron cuenta de que incluso una memoria de flujo podía mejorarse. Se preguntaron: "¿Qué pasaría si nuestro robot no tuviera solo un flujo de memoria, sino varios, y pudiera aprender a qué flujo escuchar?".

Crearon WSLA (Weighted State-Expansion Linear Attention - Atención Lineal de Expansión de Estado Ponderada).

  • La Analogía: Imagina que el cerebro del robot tiene cuatro "cuadernos" (sub-estados) en lugar de uno. Un cuaderno registra colores, otro formas, otro giros y otro sonidos.
  • La Magia: Un "director de orquesta" especial (ponderación aprendible) decide cuánto escuchar a cada cuaderno en cada momento dado. Si el robot está buscando una "caja roja", el director podría subir el volumen del cuaderno de "color" y bajar el del "sonido".

Este sistema WSLA resultó ser el campeón.

  • En la simulación HM3D-OVON (un conjunto de datos de casas 3D masivo y realista), el robot WSLA logró una tasa de éxito del 36.4%.
  • El mejor modelo Transformer solo obtuvo un 30.1%.
  • Eso es una mejora de 6.3 puntos porcentuales, lo cual es enorme en este campo.

Por qué Importa: Distancia y la Vida Real

Los investigadores también observaron cómo navegaba el robot. Descubrieron que el nuevo sistema era especialmente bueno en viajes largos.

  • Viajes cortos: Ambos robots lo hicieron bien.
  • Viajes largos: El robot Transformer a menudo se perdía o se rendía pronto. El robot WSLA, sin embargo, mantuvo la calma. Navegó con éxito distancias de 15 metros o más con una tasa de éxito del 14.36%, mientras que el Transformer solo logró un 6.68%.

Pero la verdadera prueba fue sacarlo de la computadora y llevarlo al mundo real. El equipo instaló su sistema LANav en un robot perro Unitree Go2 (un robot físico real). Le pidieron que buscara cosas como un bote de basura, una planta o una silla en una habitación real.

  • Realizaron 50 pruebas.
  • El robot tuvo éxito 41 veces.
  • ¡Eso es una tasa de éxito del 82% en el mundo real!

Esto demuestra que la idea de la "memoria de flujo" no es solo un truco informático genial; realmente funciona cuando se pone en un robot perro en una habitación real.

La Conclusión

El artículo sugiere que, para los robots que intentan encontrar su camino en entornos complejos y desconocidos, el viejo método de "re-leer todo" (Transformers) podría no ser la mejor herramienta. En su lugar, un método que actualiza su memoria de una forma estructurada y fluida (Atención Lineal), especialmente cuando se potencia con múltiples memorias especializadas (WSLA), es mucho más efectivo. Es más rápido, escala mejor con viajes largos y, lo más importante, realmente funciona cuando se coloca en un robot perro en una habitación real. El futuro de la navegación robótica podría no tratarse de recordar más historia, sino de recordarla mejor.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →