← Últimos artículos
🤖 machine learning

Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline)

Este artículo presenta un sistema de plegado de prendas bimanual galardonado para el LeHome Challenge 2026 que logra los primeros puestos mediante la mejora de una política de visión-lenguaje-acción con un bucle de aprendizaje por refuerzo auto-supervisado, donde las propias predicciones de éxito y progreso de la política impulsan la estimación de la ventaja y la detección de fallos, respaldadas por un conjunto integral de optimizaciones de ingeniería que incluyen el ajuste de flujo (flow-matching), el entrenamiento distribuido y una transferencia robusta de simulación a realidad.

Autores originales: Ilia Larchenko

Publicado 2026-06-26
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Ilia Larchenko

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina a un robot intentando doblar una camiseta desordenada o un par de pantalones. Suena simple para nosotros, pero para un robot, un trozo de tela es como una serpiente caótica y resbaladiza que cambia de forma cada vez que la tocas. Este artículo describe cómo el autor, Ilia Larchenko, construyó un cerebro robótico que obtuvo el primer lugar en un concurso de simulación y el segundo lugar en un concurso del mundo real para esta misma tarea.

Aquí está la historia de cómo lo logró, desglosada en conceptos simples.

1. El Problema: El "Fantasma" en la Máquina

El robot tenía que doblar cuatro tipos de ropa (manga larga/corta, pantalones largos/cortos) usando dos brazos.

  • El Gancho: El robot no sabía qué estaba sujetando. Tenía que mirar la camisa y determinar: "¿Es una camiseta o un par de pantalones?" antes de poder empezar a doblar.
  • La Recompensa: El robot solo recibía una "Estrella de Oro" (una recompensa) si la camisa estaba perfectamente doblada al final. Si cometía un error a mitad del proceso, no recibía nada. Esto es como intentar aprender a montar en bicicleta pero solo recibir una galleta si llegas a la meta sin haberte caído nunca.

2. La Solución: Un Bucle de "Autoaprendizaje"

En lugar de simplemente copiar demostraciones humanas (que es como intentar aprender a nadar viendo un video), el autor construyó un sistema que aprende haciendo, fallando e intentándolo de nuevo. Él lo llama un "Volante de Inercia" (Flywheel).

Piensa en esto como un equipo de tres personas trabajando en una fábrica:

  1. El Entrenador: El maestro que estudia los datos y actualiza el cerebro del robot.
  2. Los Corredores: Una flota de robots en un videojuego (simulación) que intentan doblar ropa miles de veces al día.
  3. El Ayudante Humano: Una persona que interviene solo cuando el robot se queda atascado, arregla la prenda y deja que el robot lo intente de nuevo.

Estos tres no hablan directamente entre sí; solo dejan notas en un buzón digital compartido (HuggingFace Hub). El Entrenador lee las notas, aprende y deja una nueva "actualización de cerebro" de vuelta en la caja. Los Corredores la recogen y lo intentan de nuevo.

3. El Ingrediente Secreto: El Robot es su propio Marcador

Normalmente, en la robótica, se necesita un cerebro para decidir qué hacer y un cerebro separado para adivinar qué tan bien lo está haciendo. Este autor los fusionó.

  • El Truco de Magia: La misma red neuronal que decide "agarrar la manga" también predice "tengo un 80% de probabilidad de éxito" y "estoy al 40% del camino".
  • Por qué ayuda: Debido a que el robot conoce su propio puntaje en tiempo real, puede aprender más rápido. Si predice que va a fallar, sabe que debe intentar un movimiento diferente. Es como un estudiante que no solo toma el examen, sino que también califica sus propias respuestas inmediatamente para ver en qué se equivocó.

4. Aprender de los Errores (La Estrategia de "Replay")

El autor se dio cuenta de que solo practicar es aburrido. Necesitas practicar las partes difíciles.

  • Minería de lo Difícil (Hard Mining): Cuando el robot falla, el sistema guarda ese momento exacto (como un "Estado de Guardado" en un videojuego). Luego carga ese estado fallido e intenta de nuevo, pero esta vez con "ruido" adicional (cambios aleatorios en la iluminación o la textura de la tela) para hacerlo más difícil.
  • El Toque Humano: Cuando el robot se queda realmente atascado, el humano toma el control por solo unos segundos para arreglar la prenda, y luego le devuelve el control al robot. El robot aprende de esta pequeña corrección. Esto se llama DAgger (un nombre elegante para "aprender de las correcciones humanas").

5. Las "Gafas Mágicas" (Optimización de la Inferencia)

Incluso con un cerebro inteligente, un robot puede ser torpe si se mueve demasiado rápido o demasiado lento. El autor descubrió que, al ajustar cómo el robot "piensa" en el último segundo, el rendimiento se disparó.

  • La Analogía: Imagina que estás tomando un examen de opción múltiple. En lugar de elegir la primera respuesta que te viene a la mente, generas rápidamente tres respuestas diferentes en tu mente, compruebas cuál se siente "mejor" basándote en tu instinto (el puntaje), y luego eliges esa.
  • Muestreo de Thompson (Thompson Sampling): El autor utilizó un juego matemático (como una máquina tragamonedas) para averiguar automáticamente la configuración perfecta para cada tipo de prenda (por ejemplo: "Para los pantalones cortos, muévete más lento; para los pantalones largos, agarra con más fuerza") sin necesidad de probar manualmente cada combinación.

6. El Desafío del Mundo Real: Del Videojuego a la Realidad

La parte más difícil fue pasar de la simulación por computadora a un robot real en una habitación real.

  • El "Valle Inquietante" de la Física: En la simulación, la ropa se veía perfecta. En la realidad, la iluminación era diferente, la cámara estaba ligeramente torcida y los brazos del robot tenían un poco de "holgura" (backlash).
  • La Solución: El autor no intentó que el robot fuera perfecto. En su lugar, hizo que los datos de entrenamiento fueran caóticos. Enseñó al robot a doblar ropa en la oscuridad, bajo el sol brillante, con la cámara inclinada y con el robot moviéndose a diferentes velocidades.
  • El Resultado: Al entrenar al robot para que estuviera cómodo con el caos, este no entró en pánico cuando vio el mundo real. Fue como entrenar a un surfista en un océano tormentoso para que una playa tranquila le parezca fácil.

7. El Resultado

  • Simulación: El robot dobló la ropa con éxito el 79.6% de las veces, superando a 61 otros equipos.
  • Mundo Real: Obtuvo el 2º lugar en la competencia final, doblando con éxito ropa real en un robot real.

La Gran Lección

El autor admite que esto no fue un experimento científico perfecto con variables controladas. Fue un enfoque de "todo el arsenal" (kitchen sink approach): lanzar todas las herramientas útiles (aprendizaje por refuerzo, retroalimentación humana, fuerte aumento de datos y conjetura inteligente) a la olla hasta que funcionó.

La principal conclusión es que, para que los robots manejen cosas desordenadas e impredecibles como la ropa, deben ser capaces de predecir su propio éxito, aprender de las correcciones humanas y ser entrenados en entornos caóticos y variados para que no se confundan cuando la realidad no se parezca al videojuego.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →