← Últimos artículos
💻 computer science

Self Supervised Learning from Automatically Generated Demonstrations for Visual Robotic Manipulation

Este artículo presenta un método de manipulación visual autosupervisado que utiliza demostraciones generadas automáticamente en simulación para entrenar una red convolucional para la corrección de pose relativa a partir de imágenes RGB montadas en la muñeca, permitiendo que un robot UR5e logre agarres exitosos con un esfuerzo de configuración reducido y una precisión planar mejorada tanto en entornos simulados como en el mundo real.

Autores originales: Andres Rivas, Anselmo R. Cukla, Rodrigo S. Guerra, Bruna V. Guterres, Ricardo B. Grando

Publicado 2026-08-11
📖 4 min de lectura☕ Lectura para el café

Autores originales: Andres Rivas, Anselmo R. Cukla, Rodrigo S. Guerra, Bruna V. Guterres, Ricardo B. Grando

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina intentar enseñarle a un robot cómo recoger una taza de café. En los viejos tiempos, los ingenieros tenían que escribir miles de líneas de código, medir la forma exacta de la taza y calibrar los ojos del robot con precisión láser. Era como intentar enseñarle a alguien a montar en bicicleta dándole un manual sobre la presión de los neumáticos y la aerodinámica en lugar de simplemente dejar que se suba y se tambalee. Esto hacía que los robots fueran excelentes para los trabajos de fábrica, pero terribles para manejar el mundo desordenado e impredecible de nuestros hogares.

Recientemente, los científicos descubrieron una mejor manera: el "Aprendizaje por Demostración". En lugar de programar cada movimiento, dejas que un humano le muestre al robot cómo hacerlo, y el robot aprende observando. Pero hay un inconveniente: lograr que un humano guíe físicamente el brazo del robot o lo controle con un joystick es lento, aburrido y difícil de escalar. ¿Qué pasaría si el robot pudiera enseñarse a sí mismo? ¿Qué pasaría si pudiera simplemente mirar un objeto, adivinar dónde agarrarlo, darse cuenta de que está ligeramente desviado y luego practicar corrigiendo sus propios errores una y otra vez hasta que lo logre? Esta es la frontera del "Aprendizaje Auto-Supervisado", donde el robot actúa tanto como alumno como maestro, generando sus propios problemas de práctica sin necesidad de que un humano le lleve de la mano.

Este artículo presenta un nuevo y astuto método donde un robot hace precisamente eso. Los investigadores construyeron un sistema en el que un robot con una cámara en su muñeca crea automáticamente sus propias "demostraciones". En lugar de que un humano le muestre cómo agarrar un objeto, el robot comienza en un punto aleatorio, mira el objeto y luego se mueve hacia la posición de agarre perfecta. Registra este movimiento como una lección: "Cuando vi el objeto de esta manera, tuve que moverme de esa forma para llegar al objetivo". Al repetir esto miles de veces alrededor de diferentes objetos, el robot construye una enorme biblioteca de lecciones de "imagen-a-movimiento" sin una sola etiqueta humana o calibración compleja de cámara.

El equipo probó esta idea de dos maneras. Primero, la ejecutaron en un simulador de videojuegos de alta tecnología llamado Isaac Sim. Le enseñaron al robot a acercarse a un objeto de forma aproximada y luego a perfeccionar su posición. Los resultados fueron prometedores: la puntería final del robot se volvió mucho más aguda. En la simulación, la "dispersión" de dónde terminaba el robot (qué tan lejos estaba del punto perfecto) se redujo de 9.69 mm a solo 5.38 mm tras el paso de ajuste fino. Fue como pasar de lanzar un dardo que cae en el vecindario general a dar en el centro de la diana.

Después, llevaron el sistema al mundo real utilizando un brazo robótico UR5e equipado con una pinza y una cámara USB estándar. No utilizaron reglas especiales ni guías láser para calibrar la cámara; el robot simplemente aprendió de las imágenes que tomó. Lo probaron con tres objetos físicos diferentes con distintas formas y texturas. El robot intentó agarrarlos sin rotar el objeto primero, y tuvo éxito el 66.6% de las veces para un objeto y el 63.6% para otro. Cuando añadieron un giro —literalmente rotando los objetos para que el robot tuviera que reconocerlos desde un nuevo ángulo—, las tasas de éxito bajaron (a 36.4% y 55.5% respectivamente), pero el robot aún lograba agarrarlos a veces.

El artículo sugiere que, si bien este método de auto-enseñanza funciona bien para acercar el robot y refinar su puntería en superficies planas, todavía tiene dificultades para adivinar qué tan profundo es un objeto (predicción de profundidad) y se confunde cuando los objetos están girados de formas extrañas. Sin embargo, la idea central se mantiene: los robots pueden, de hecho, generar sus propios datos de entrenamiento para aprender manipulación visual, saltándose la necesidad de costosos maestros humanos o configuraciones de laboratorio perfectas. Es un paso hacia robots que puedan simplemente mirar una mesa desordenada, descifrar cómo agarrar una taza y aprender de sus propios errores, todo sin necesidad de que un humano escriba las reglas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →