← Últimos artículos
💻 computer science

Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy

Este artículo investiga la adición del griego a una política de visión-lenguaje-acción robótica utilizando únicamente instrucciones reformuladas por máquinas, revelando que una evaluación robusta requiere de referentes nulos y replicación de semillas para evitar conclusiones falsas, al tiempo que demuestra que el entrenamiento bilingüe produce mejoras consistentes sobre los controles a pesar del sobreajuste a formulaciones específicas.

Autores originales: Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos

Publicado 2026-09-09
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots que pueden ver, comprender y moverse se están convirtiendo en una realidad, pero actualmente solo hablan un idioma: el inglés. Estas máquinas aprenden observando vídeos de humanos realizando tareas, donde las instrucciones están escritas en inglés. El software que les ayuda a entender estas palabras ha sido entrenado con cantidades masivas de texto en inglés, lo que lo hace increíblemente bueno en ese idioma específico. Para cualquier persona que hable griego, o cualquier otro idioma, esto crea una barrera difícil de superar. No existen bibliotecas de vídeo de robots moviendo objetos con instrucciones en griego, y construir una desde cero requeriría meses de guiar manualmente un brazo robótico para cada acción individual. La pregunta que se hicieron los investigadores fue sencilla: ¿podían tomar los datos existentes en inglés, traducir las instrucciones al griego mediante un ordenador y enseñar al robot a entender el nuevo idioma sin reconstruir todo el sistema?

La respuesta resultó ser más complicada que una simple traducción. Un equipo de investigadores de Sophea AI y KIEFER SA en Atenas tomó un sistema robótico de código abierto y le suministró miles de instrucciones en griego generadas por una máquina. No cambiaron el cerebro del robot ni su estructura física; simplemente sustituyeron el texto en inglés por texto en griego. El proceso de traducción fue rápido y fácil, durando solo unas horas. Sin embargo, el verdadero trabajo comenzó cuando intentaron medir si el robot realmente comprendía lo que se le decía. En el mundo de la robótica, es sorprendentemente fácil engañar a un sistema para que parezca exitoso cuando en realidad solo está adivinando. Los investigadores descubrieron que las pruebas estándar, que normalmente ofrecen un aprobado o un suspenso claro, fueron completamente engañadas. Descubrieron que un robot podía seguir una orden en griego con altas tasas de éxito incluso cuando la orden era un sinsentido, o incluso cuando el robot nunca había aprendido griego. Esto sucedía porque el robot estaba aprendiendo a reconocer la escena y los objetos en lugar de leer las palabras.

Para resolver esto, el equipo tuvo que inventar nuevas formas de probar al robot. Construyeron un grupo de control donde dieron deliberadamente instrucciones incorrectas al robot en griego para ver si aun así intentaba realizar la tarea. Descubrieron que, en un pequeño conjunto de diez tareas, un robot entrenado con instrucciones en griego traducidas por máquina parecía tener éxito aproximadamente el ochenta y cuatro por ciento de las veces. Pero cuando lo probaron con las instrucciones incorrectas, seguía teniendo éxito aproximadamente el ochenta y dos por ciento de las veces. Esto demostró que el robot no estaba leyendo el griego; simplemente estaba reaccionando a la configuración visual. El robot estaba ignorando el idioma por completo.

Los investigadores probaron entonces un enfoque diferente. Utilizaron un conjunto más grande de noventa tareas donde el robot tenía que elegir entre múltiples objetivos posibles en la misma escena. Aquí, el lenguaje se convirtió en la única señal para decirle al robot qué hacer. Descubrieron que un robot entrenado tanto con instrucciones en inglés como en griego podía seguir las órdenes en griego aproximadamente el veintisiete por ciento de las veces, lo cual era significativamente mejor que el azar. Sin embargo, un robot entrenado únicamente con instrucciones en griego, sin ningún dato en inglés que lo respaldara, apenas mejoró respecto al azar. Aunque el entrenamiento bilingüe funcionó mejor en promedio que el entrenamiento solo en griego, los rangos estadísticos de su rendimiento se solapaban significativamente, lo que significa que los datos no podían confirmar definitivamente que el entrenamiento en inglés actuara como un andamiaje necesario para el aprendizaje del griego. El hallazgo más sólido fue que las demostraciones en la lengua objetivo son necesarias, pero por sí solas, suelen ser insuficientes; una política entrenada solo en griego apenas sigue el lenguaje, manteniéndose a tres puntos de su propio umbral de fallo en múltiples ejecuciones de prueba.

El estudio también reveló que el robot no estaba aprendiendo el idioma griego de la misma manera que un humano. En su lugar, estaba memorizando la redacción específica utilizada por el traductor automático. Cuando los investigadores probaron el robot con frases en griego escritas por un programa informático diferente, el rendimiento del robot cayó drásticamente. Había aprendido el estilo del primer traductor, no el idioma en sí. Para solucionar esto, enseñaron al robot la misma tarea utilizando siete redacciones diferentes en griego. Este simple cambio hizo que el robot fuera mucho más robusto, reduciendo a la mitad la caída del rendimiento al ser probado con nuevas redacciones. Esto demostró que la variedad en los datos de entrenamiento es esencial para que el robot pueda generalizar más allá del estilo de escritura de una sola máquina.

Quizás el hallazgo más sorprendente fue que algunas mejoras de sentido común hicieron que el robot empeorara. El equipo intentó comenzar el entrenamiento del robot con un modelo que ya había sido adaptado al griego, pensando que esto le daría una ventaja inicial. En cambio, el robot funcionó peor tanto en inglés como en griego. También intentaron dejar que la parte del cerebro del robot que procesa el lenguaje aprendiera libremente, en lugar de mantenerla congelada. Esto también degradó el rendimiento. Los resultados sugieren que, para estos sistemas específicos, la mejor estrategia es mantener la parte de la comprensión del lenguaje exactamente como fue entrenada, y solo enseñar al robot cómo moverse utilizando las nuevas instrucciones de lenguaje.

Los investigadores también intentaron probar estos métodos en una colección masiva de datos robóticos del mundo real, mucho más grande que sus pruebas simuladas. Tradujeron más de cincuenta mil episodios robóticos reales al griego. Sin embargo, no pudieron medir el éxito de estos datos porque carecían del hardware físico necesario para ejecutar las pruebas. Esto puso de relieve un cuello de botella importante en el campo: traducir los datos es barato y rápido, pero verificar que el robot realmente aprendió es lento, costoso y requiere equipos físicos.

En última instancia, el artículo concluye que añadir un nuevo idioma a un robot es posible, pero no es tan simple como una traducción. Requiere un tipo específico de modelo base que ya comprenda el idioma, una mezcla de datos de entrenamiento tanto en el nuevo idioma como en inglés, y un proceso de prueba muy cuidadoso que incluya fallos deliberados para asegurar que el robot realmente está escuchando. El robot no aprende el idioma de una manera profunda y humana; aprende a asociar patrones específicos de palabras con acciones, y necesita la estabilidad del entrenamiento en inglés para hacerlo, aunque el mecanismo exacto de cómo el inglés respalda al griego sigue siendo una pregunta abierta en lugar de una regla confirmada. El trabajo sirve como una advertencia para otros en el campo: no confíen en la tasa de éxito de un robot a simple vista, y prueben siempre con un grupo de control que demuestre que el robot no solo está adivinando. El camino hacia un robot multilingüe está pavimentado no solo con datos, sino con la disciplina rigurosa de demostrar que los datos fueron realmente comprendidos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →