← Últimos artículos
💻 computer science

LACE: Latent Visual Representation for Cross-Embodiment Learning

LACE es un marco que cierra la brecha visual entre las encarnaciones humana y robótica al alinear sus representaciones visuales latentes mediante correspondencias de partes del cuerpo escasas y generadas automáticamente, lo que permite a los robots aprovechar eficazmente los abundantes datos de demostración humana para el aprendizaje de políticas incluso con datos de entrenamiento específicos de robots escasos.

Autores originales: Yoo Sung Jang, Kanchana Ranasinghe, Cristina Mata, Yichi Zhang, Jorge Mendez-Mendez, Michael S. Ryoo

Publicado 2026-05-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yoo Sung Jang, Kanchana Ranasinghe, Cristina Mata, Yichi Zhang, Jorge Mendez-Mendez, Michael S. Ryoo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un robot cómo recoger un juguete. Tienes miles de videos de humanos haciéndolo perfectamente, pero solo tienes un puñado de videos del robot haciéndolo.

El problema es que los humanos y los robots se ven muy diferentes. Una mano humana tiene piel, arrugas y cinco dedos que se doblan de maneras específicas. Una mano de robot podría estar hecha de metal, tener cuatro dedos o parecer una pinza. Debido a que se ven tan diferentes, el "cerebro" del robot (su visión por computadora) se confunde. Ve una mano humana en un video y piensa: "Eso es un humano", pero cuando ve su propia mano de metal, piensa: "Eso es algo completamente diferente". No puede conectar los dos, por lo que no puede aprender de los videos humanos.

Este artículo presenta una solución llamada LACE (Alineación Latente para el Aprendizaje de Encarnación Cruzada). Así es como funciona, usando analogías simples:

1. El problema del "lenguaje"

Piensa en el cerebro del robot como un estudiante que habla un lenguaje complejo llamado "Espacio Latente". Este lenguaje se usa para describir lo que ve.

  • El problema: Cuando el robot mira una mano humana, la describe en un dialecto de este lenguaje. Cuando mira su propia mano de metal, la describe en un dialecto totalmente diferente. Aunque ambas son "manos", el robot piensa que son palabras no relacionadas.
  • El resultado: El robot ignora los videos humanos porque no entiende el "dialecto" en el que habla el humano.

2. La solución LACE: Un traductor universal

LACE actúa como un traductor universal que enseña al robot a hablar el mismo dialecto tanto para manos humanas como para manos robóticas.

En lugar de intentar hacer que las imágenes de la cámara del robot se vean exactamente como las fotos humanas (lo cual es difícil y a menudo falla), LACE trabaja dentro del cerebro del robot. Dice: "Oye, aunque el pulgar humano y el pulgar del robot se ven diferentes, hacen el mismo trabajo. Asegurémonos de que el cerebro del robot los describa usando exactamente el mismo código interno."

3. Cómo aprende: El truco de las "partes compartidas"

Para enseñar a este traductor, no necesitas miles de videos del robot. Solo necesitas un solo video del robot moviéndose, más algunos videos existentes de humanos.

  • El mapa: El sistema utiliza un "mapa" de las partes del cuerpo. Sabe que un pulgar humano corresponde a un pulgar robótico, una muñeca humana a una muñeca robótica, etc.
  • La lección: Toma una foto de una mano humana y una foto de una mano robótica. Señala el pulgar en ambas imágenes y dice: "Estos dos píxeles deben significar lo mismo para el cerebro del robot".
  • La magia: Ajusta el cerebro del robot para que, cuando vea un pulgar robótico, "sienta" la misma sensación interna que cuando ve un pulgar humano.

4. Dos reglas para aprender

El artículo menciona dos reglas específicas que sigue el sistema para asegurar que aprenda correctamente sin olvidar todo lo demás:

  • Regla 1: El "emparejador" (Pérdida de Alineación Semántica): Esta regla obliga al robot a emparejar las partes del cuerpo humanas y robóticas. Es como un profesor que dice: "Si ves un pulgar humano, debes pensar en la 'pulgaridad' exactamente de la misma manera en que piensas en un pulgar robótico".
  • Regla 2: El "ancla" (Pérdida Gram): Esto es crucial. Si solo enseñas al robot sobre los pulgares, podría olvidar cómo reconocer una taza o una silla. La regla del "ancla" dice: "Mantén tu conocimiento general sobre el mundo (como cómo se ve una mesa) exactamente igual que antes. Solo cambia cómo piensas sobre las manos". Esto evita que el robot se confunda con todo lo demás.

5. Los resultados: De cero a héroe

Los investigadores probaron esto en el mundo real:

  • Sin LACE: Si le daban al robot cero videos de entrenamiento robótico y solo videos humanos, el robot fallaba casi el 100% de las veces. No podía entender dónde estaba su propia mano.
  • Con LACE: Usando la misma configuración (cero videos robóticos), el robot tuvo éxito el 60% de las veces. Podía mirar un video humano, entender la acción y aplicarla con éxito a su propia mano de metal.
  • Bajos datos: Incluso cuando le daban al robot una pequeña cantidad de su propio video (solo el 10% de lo que normalmente se necesita), LACE le ayudó a rendir mucho mejor que antes.

Resumen

LACE es un método que enseña a los robots a dejar de ver a los humanos y a los robots como dos especies diferentes. Al enseñar al cerebro del robot a usar el mismo "código interno" para las partes del cuerpo compartidas (como pulgares y muñecas), permite que los robots aprendan habilidades complejas de la enorme cantidad de datos de video humanos disponibles en internet, incluso si nunca han visto a un robot realizar esa tarea específica antes. Funciona con muy pocos datos y no requiere que el robot se parezca a un humano.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →