← Últimos artículos
🤖 AI

What Matters for Simulation to Online Reinforcement Learning on Real Robots

A través de un estudio empírico a gran escala que involucra 100 ejecuciones de entrenamiento en el mundo real a través de tres plataformas robóticas, este artículo identifica elecciones de diseño específicas y robustas que permiten el aprendizaje por refuerzo en línea estable en robots físicos, al tiempo que desmitifica la efectividad de ciertos valores predeterminados ampliamente utilizados.

Autores originales: Yarden As, Dhruva Tirumala, René Zurbrügg, Chenhao Li, Stelian Coros, Andreas Krause, Markus Wulfmeier

Publicado 2026-07-24
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yarden As, Dhruva Tirumala, René Zurbrügg, Chenhao Li, Stelian Coros, Andreas Krause, Markus Wulfmeier

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina enseñar a un robot a caminar, a recoger una taza o a conducir un coche. Durante mucho tiempo, los científicos han intentado hacer esto dejando que el robot practique millones de veces dentro de un mundo de videojuego: un simulador digital perfecto. Es como un piloto entrenando en un simulador de vuelo: seguro, rápido y económico. Pero hay un inconveniente. El mundo real es desordenado. Los suelos no son perfectamente lisos, los neumáticos resbalan de formas que la computadora no predijo y las cámaras ven las cosas de manera diferente a un renderizador digital. Cuando tomas a un robot entrenado en un videojuego perfecto y lo pzas sobre un suelo real, a menudo tropieza, suelta cosas o choca. Este vacío entre el juego "perfecto" y la realidad "desordenada" es el mayor obstáculo en la robótica.

Para solucionar esto, los investigadores utilizan una técnica llamada Aprendizaje por Refuerzo (RL, por sus siglas en inglés). Piensa en el RL como un estudiante muy determinado que aprende mediante el ensayo y error. El robot intenta una acción, recibe una "recompensa" (como un punto por éxito) o un "castigo" (como un choque), y ajusta su cerebro para hacerlo mejor la próxima vez. La gran pregunta es: ¿Podemos dejar que este robot aprenda mientras se está moviendo realmente en el suelo real, no solo en el juego? Esto se llama "aprendizaje en línea" (online learning). Es el santo grial porque significa que los robots podrían adaptarse a nuevas situaciones instantáneamente, como un humano aprendiendo a montar en bicicleta en un camino con baches después de haber practicado solo en uno liso. Pero hasta ahora, intentar enseñar a un robot de esta manera en hardware real ha sido arriesgado, inestable y, a menudo, una pérdida de tiempo y dinero.

Este artículo, escrito por investigadores de ETH Zurich y Google DeepMind, plantea una pregunta muy práctica: "Si ya tenemos un robot que aprendió en un simulador, ¿qué ajustes específicos debemos retocar para que aprenda de forma segura y exitosa en el mundo real?". No inventaron un nuevo algoritmo mágico. En su lugar, actuaron como mecánicos, tomando herramientas de aprendizaje estándar y listas para usar, y probando más de 100 ejecuciones de entrenamiento en tres robots muy diferentes: un brazo robótico (Franka Emika Panda), un robot perro de cuatro patas (Unitree Go1) y un coche de carreras a control remoto.

Descubrieron que los ajustes "predeterminados" habituales para estos robots de aprendizaje son en realidad peligrosos cuando se pasa de la simulación a la realidad. Si simplemente conectas un cerebro entrenado en un simulador en un robot real y comienzas a aprender de inmediato, el robot suele olvidar todo lo que sabía y entra en un espiral de caos. Los autores descubrieron que esto sucede porque el "crítico" del robot (la parte que juzga qué tan buena es una acción) se confunde por el cambio repentino en la física. Para detener esto, desarrollaron una receta simple y confiable.

Primero, descubrieron que debes mantener una "memoria" de los datos antiguos del simulador mezclada con los nuevos datos del mundo real. Es como mantener un libro de texto abierto mientras haces tu tarea; si tiras el libro de texto en el momento en que empiezas, podrías olvidar las reglas básicas. Segundo, descubrieron que el robot necesita un periodo de "calentamiento" donde practica algunas veces con su antiguo cerebro de simulador antes de que se le permita cambiar de opinión. Finalmente, y lo más importante, descubrieron que el "cerebro" del robot (la parte que decide qué hacer) necesita actualizarse mucho más lentamente que su "juicio" (la parte que aprende de los errores). Si el cerebro cambia demasiado rápido, se confunde con el mundo real desordenado. Al ralentizar las actualizaciones del cerebro y mantener el juicio estable, el robot puede aprender a agarrar cubos, caminar sin caerse y estacionar un coche de carreras con alta precisión, todo en solo unos minutos de entrenamiento en el mundo real.

El artículo muestra que, con estos ajustes específicos y cuidadosos, los métodos de aprendizaje estándar pueden funcionar de manera confiable en hardware real. No solo simularon esto; lo ejecutaron en máquinas reales, demostrando que no necesitas un nuevo superalgoritmo para hacer que los robots aprendan en el mundo real, solo necesitas ser más inteligente sobre cómo les suministras los datos y qué tan rápido les permites cambiar de opinión.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →