← Últimos artículos
🤖 AI

PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model

Este artículo presenta PGN, un sistema de navegación visual-lingüística fuera de línea construido sobre el modelo fundacional OpenPangu-7B que emplea una estrategia de entrenamiento de dos etapas para alinear las modalidades visual y lingüística y adaptarse a las trayectorias de expertos, logrando un Coincidencia de Acción Normalizada del 62.29% en datos no utilizados durante el entrenamiento mientras utiliza computación de precisión mixta y DeepSpeed en hardware Ascend 910B.

Autores originales: Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao

Publicado 2026-07-21
📖 4 min de lectura☕ Lectura para el café

Autores originales: Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde los robots no solo siguen listas rígidas de comandos preprogramados, sino que pueden entenderte como un amigo humano. Este es el sueño de la "IA encarnada" (embodied AI): darle a una máquina un cuerpo (o una cámara y ruedas) y un cerebro que pueda ver la habitación, escuchar tu voz y descubrir cómo moverse. El gran desafío es conectar dos lenguajes muy diferentes: el mundo visual de los píxeles y los colores, y el mundo lingüístico de las oraciones e instrucciones. Piensa en ello como intentar enseñarle a un perro a navegar por una casa usando solo un mapa escrito en poesía. Necesitas una forma de traducir "camina pasando la cocina" en una serie de giros físicos y pasos. Este es el núcleo del rompecabezas de la Navegación de Visión-Lenguaje (VLN). No se trata solo de reconocer objetos; se trata de comprender la historia de una habitación a lo largo del tiempo, recordar por dónde has pasado y decidir qué hacer a continuación basándose en una simple oración.

Presentamos PGN, un nuevo sistema construido por investigadores de la Universidad de Ciencia y Tecnología Electrónica de China, diseñado para resolver este rompecabezas utilizando un "cerebro" poderoso llamado OpenPangu-7B. Puedes pensar en OpenPangu como un modelo de lenguaje preentrenado y superinteligente que ya sabe hablar y escribir, pero que no sabe ver ni moverse. El objetivo de los investigadores era enseñar a este gigante del lenguaje a navegar por una casa virtual mostrándole imágenes e instrucciones. No lanzaron al robot directamente a lo profundo; construyeron un campamento de entrenamiento de dos etapas. Primero, enseñaron al robot cómo "ver" conectando su cerebro lingüístico a un ojo de cámara especializado (un codificador de visión) mediante un módulo traductor llamado Q-Former. Esto permitió al robot entender que la imagen de un jarrón está relacionada con la palabra "jarrón".

Una vez que el robot pudo comprender la conexión entre las imágenes y las palabras, comenzó la segunda etapa: aprender a moverse. El equipo alimentó el sistema con miles de ejemplos de rutas de navegación perfectas realizadas por un "experto" (un programa informático que nunca comete errores). El robot aprendió a observar una secuencia de cinco instantáneas recientes de la habitación, leer la instrucción y luego, crucialmente, pensar antes de actuar. En lugar de simplemente soltar un "gira a la izquierda", el modelo fue entrenado para generar primero un pequeño texto de razonamiento, como un humano diciendo: "Bien, veo la cocina a mi izquierda, así que debería girar a la izquierda", antes de comprometerse con la acción. Probaron este sistema en 500 rutas de prueba ocultas donde se le dio al robot el historial correcto de lo que había visto y se le pidió que predijera el siguiente movimiento. Los resultados fueron prometedores: en la versión más reciente (V9), el robot coincidió con la acción del experto el 62.29% de las veces y casi siempre dio una respuesta no vacía (el 100% de las veces). Sin embargo, los autores son muy cuidadosos al señalar que esta es una prueba de "forzado de profesor" (teacher-forced). Es como un estudiante tomando un examen de opción múltiple donde el profesor sostiene la clave de respuestas correcta en cada paso. El robot no ha sido probado realmente para ver si puede recuperarse si comete un error o si puede alcanzar con éxito un objetivo en un entorno real y desordenado sin ayuda. Si bien el sistema muestra que un gran modelo de lenguaje puede adaptarse para comprender instrucciones de navegación y alinearse con acciones de expertos, el artículo concluye que la verdadera prueba de si este robot puede realmente navegar por una casa por su cuenta es todavía un trabajo para el futuro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →