← Últimos artículos
💻 computer science

ReLI: Cross-Lingual Language-to-Action Grounding for Human-Robot Interaction

ReLI es un marco de trabajo multilingüe que adapta modelos fundacionales a gran escala para permitir que los agentes autónomos comprendan instrucciones en lenguaje natural, razonen semánticamente y ejecuten tareas de manera efectiva en más de 140 lenguas diversas, incluyendo variedades de bajos recursos y criollas, superando así las limitaciones de los sistemas existentes centrados únicamente en lenguas de altos recursos.

Autores originales: Linus Nwankwo, Bjoern Ellensohn, Ozan Özdenizci, Elmar Rueckert

Publicado 2026-09-09
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Linus Nwankwo, Bjoern Ellensohn, Ozan Özdenizci, Elmar Rueckert

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde un robot pueda entender un comando dado en cualquier idioma, desde las lenguas más habladas hasta los dialectos raros hablados por pequeñas comunidades. Durante décadas, el sueño de la colaboración natural entre humanos y robots ha sido frenado por una barrera simple: el lenguaje. Mientras que los robots modernos se están volviendo cada vez más capaces de ver su entorno y moverse a través de él, en gran medida han sido entrenados para entender solo un puñado de idiomas principales, como el inglés o el mandarín. Esta limitación excluye a miles de millones de usuarios potenciales que hablan otros idiomas, dialectos o criollos, bloqueándolos efectivamente del futuro de la automatización. El campo de la interacción humano-robot depende de la capacidad de traducir una petición hablada o escrita en una acción física, un proceso conocido como fundamentación (grounding). Hasta ahora, esta traducción ha sido una calle de sentido único, funcionando bien solo para aquellos con acceso a idiomas de altos recursos, dejando atrás al resto del mundo.

Un equipo de investigadores ha desarrollado un nuevo sistema llamado ReLI, diseñado para derribar estos muros lingüísticos. ReLI permite que los agentes autónomos conversen naturalmente, razonen sobre su entorno y ejecuten tareas independientemente del idioma en el que se dé la instrucción. El sistema no depende de traducir el habla del usuario al inglés primero, ni requiere que el robot sea reentrenado para cada nuevo idioma. En su lugar, aprovecha la capacidad inherente de los modelos computacionales preentrenados a gran escala para comprender el significado detrás de las palabras a través de cientos de idiomas diferentes simultáneamente. Al combinar estos modelos de lenguaje con sensores visuales que permiten al robot "ver" objetos y espacios, ReLI puede tomar un comando como "busca la silla roja" dicho en un dialecto raro y convertirlo en un movimiento físico preciso, todo sin que el usuario necesaite saber ningún código técnico o hablar un idioma dominante global.

Los investigadores probaron este sistema tanto en entornos simulados como en entornos del mundo real utilizando robots con ruedas y máquinas de cuatro patas equipadas con cámaras y sensores de profundidad. Desafiaron a los robots con más de 70,000 conversaciones de múltiples turnos en más de 140 idiomas diferentes. Estos idiomas fueron cuidadosamente seleccionados para representar un amplio espectro de la diversidad lingüística del mundo, incluyendo idiomas de altos recursos con vastos datos digitales, idiomas de bajos recursos con datos limitados, e idiomas vulnerables o criollos que a menudo son ignorados por la tecnología. Las tareas variaron desde comandos simples de un solo paso, como avanzar una distancia específica, hasta misiones complejas de varios pasos que requerían que el robot navegara a través de una habitación, identificara un objeto basado en una descripción y reportara lo que encontró.

Los resultados mostraron que el sistema funcionó con una consistencia notable a través de este vasto paisaje lingüístico. En casi todos los idiomas probados, el robot comprendió correctamente la intención del usuario y ejecutó la tarea con una tasa de éxito superior al 83 por ciento. Para muchos de los idiomas más comunes, la tasa de éxito superó el 97 por ciento. Incluso para los idiomas más vulnerables y con menos recursos, el sistema mantuvo altos niveles de precisión, procesando exitosamente las instrucciones y guiando al robot hacia su objetivo. El tiempo que le tomó al robot procesar un comando y comenzar a moverse se mantuvo estable, promediando entre 2.1 y 2.6 segundos, independientemente de si la instrucción fue dada en un idioma importante del mundo o en un dialecto raro. Esta velocidad y fiabilidad sugieren que el sistema no es solo un concepto teórico, sino una herramienta práctica capaz de funcionar en tiempo real.

Para asegurar que la tecnología fuera verdaderamente inclusiva, los investigadores también realizaron un estudio con participantes humanos que interactuaron con los robots en sus lenguas nativas. Treinta y cuatro evaluadores, fluidos en 13 idiomas diferentes, probaron el sistema en un entorno de laboratorio del mundo real. Informaron que las interacciones se sentían naturales y receptivas, y la gran mayoría señaló que no percibieron ninguna diferencia en el rendimiento basada en el idioma que utilizaron. Este hallazgo es crucial, ya que indica que el sistema no favorece a un idioma sobre otro, ni crea una brecha oculta donde los usuarios de ciertos idiomas reciban una experiencia de menor calidad. El sistema manejó con éxito el cambio de código (code-switching), donde un usuario podría mezclar palabras de dos idiomas diferentes en una sola oración, y gestionó el razonamiento espacial complejo, como navegar hacia una ubicación descrita solo por su función, como "el lugar donde se cocina la comida".

El núcleo de este logro reside en cómo el sistema conecta el lenguaje con la acción. Cuando un usuario habla o escribe un comando, el sistema primero normaliza la entrada, convirtiendo el habla en texto si es necesario, y luego la pasa a un modelo de lenguaje de gran escala que actúa como el cerebro del robot. Este modelo interpreta la intención del comando, desglosándolo en una secuencia de pasos lógicos. Luego consulta los sensores visuales del robot para identificar los objetos y espacios mencionados en el comando. Si un usuario pide al robot que vaya a una silla específica, el sistema utiliza la visión por computadora para localizar esa silla en la habitación, determinar su posición exacta en el espacio tridimensional y calcular la ruta que el robot debe tomar para alcanzarla. Finalmente, el sistema genera un plan y, por seguridad, a menudo pide la confirmación del usuario antes de ejecutar movimientos complejos o de larga distancia. Todo este proceso ocurre de manera fluida, cerrando la brecha entre el pensamiento humano y la acción de la máquina sin la necesidad de una traducción explícita o un entrenamiento especializado para cada nuevo idioma.

El estudio también exploró los límites de esta tecnología, revelando que, aunque el sistema es robusto, no es infalible. Los desafíos más significativos surgieron cuando el robot tenía que identificar objetos que se veían muy similares entre sí o cuando el entorno visual estaba desordenado, lo que dificultaba distinguir el objetivo. Además, las tareas que requerían navegar a través de secuencias complejas de múltiples pasos fueron ligeramente más propensas al error que los comandos simples y directos, simplemente porque había más oportunidades para que ocurriera un error en la cadena de razonamiento. Sin embargo, incluso en estos escenarios difíciles, el desempeño del sistema se mantuvo fuerte, y los investigadores señalaron que los errores a menudo estaban relacionados con las limitaciones físicas de los sensores del robot o la complejidad del entorno, más que con un fallo en la comprensión del lenguaje.

Al demostrar que un solo marco de trabajo puede manejar más de 140 idiomas con alta precisión, este trabajo sugiere un nuevo camino a seguir para la interacción humano-robot. Se aleja de la idea de que los robots deben aprender un idioma específico para ser útiles, y se mueve hacia un modelo donde el robot se adapta a la lengua nativa del usuario. Los investigadores lanzaron sus datos y código al público, invitando a otros a construir sobre esta base. El objetivo final no es solo hacer que los robots puedan hablar muchos idiomas, sino crear un futuro donde la capacidad de comandar una máquina sea un derecho universal, accesible para cualquier persona, en cualquier lugar, en el idioma que mejor conozca. Este cambio promete democratizar el acceso a la automatización, asegurando que los beneficios de la robótica sean compartidos por toda la humanidad, y no solo por aquellos que hablan los idiomas de la élite digital.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →