← Últimos artículos
💻 computer science

Passivity-Centric Safe Reinforcement Learning for Contact-Rich Robotic Tasks

Este artículo aborda las limitaciones de seguridad y estabilidad del aprendizaje por refuerzo tradicional en tareas robóticas con alto contacto mediante la propuesta de un marco que integra el entrenamiento consciente de la pasividad con restricciones basadas en la energía y un filtro de pasividad para el despliegue, garantizando así la estabilidad del control y mejorando la eficiencia energética.

Autores originales: Heng Zhang, Gokhan Solak, Sebastian Hjorth, Arash Ajoudani

Publicado 2026-09-03
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Heng Zhang, Gokhan Solak, Sebastian Hjorth, Arash Ajoudani

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un brazo robótico extendiéndose para tocar una pared, no para empujarla, sino para sentir su camino a través de un laberinto oscuro y sinuoso. Este es el mundo de la robótica de contacto rico, donde las máquinas deben interactuar físicamente con su entorno para resolver problemas. Durante años, los científicos han utilizado una poderosa herramienta llamada aprendizaje por refuerzo para enseñar a los robots a hacer esto. Piensa en ello como un proceso digital de ensayo y error: el robot intenta un movimiento, recibe una recompensa si tiene éxito y aprende de sus errores. Si bien este método ha producido resultados impresionosos en simulaciones por computadora, un obstáculo importante persiste al trasladar estos robots al mundo real. Los algoritmos son excelentes para encontrar un camino hacia una meta, pero a menudo ignoran una regla fundamental de la física: la energía. Si un robot aprende una estrategia que requiere que bombee demasiada energía en sus articulaciones o en el entorno, puede volverse inestable, sacudirse violentamente o incluso dañarse a sí mismo y a los objetos que toca. Garantizar que los movimientos de un robot sean seguros y estables no es solo una preocupación teórica; es una necesidad práctica para cualquier máquina que alguna vez trabaje junto a los humanos.

Investigadores del Istituto Italiano di Tecnologia en Génova, Italia, se propusieron resolver este problema específico. Se plantearon una pregunta simple pero crítica: ¿podemos enseñar a un robot no solo a ser bueno en una tarea, sino también a ser inherentemente seguro respecto a cómo utiliza la energía? Su trabajo se centra en un concepto llamado pasividad. En términos sencillos, la pasividad significa que un sistema no puede crear energía de la nada; solo puede almacenar lo que recibe o disiparlo. Un robot pasivo es aquel que se comporta como un resorte bien amortiguado, absorbiendo los impactos en lugar de amplificarlos. El equipo descubrió que las políticas de aprendizaje por refuerzo estándar, que son entrenadas para maximizar el éxito de la tarea, a menudo fallan al no respetar esta regla. En sus experimentos, estas políticas estándar aprendieron a completar tareas rápidamente, pero lo hicieron generando comandos de control que violaban los límites de energía, lo que provocaba inestabilidad al ser desplegadas en el mundo real.

Para solucionar esto, los investigadores desarrollaron un nuevo enfoque que combina el poder de aprendizaje de la inteligencia artificial con reglas estrictas de energía. Crearon un sistema con dos partes distintas trabajando juntas. La primera parte ocurre durante la fase de entrenamiento. Aquí, enseñaron al robot a ser "consciente de la pasividad". En lugar de solo recompensar al robot por alcanzar la salida de un laberinto, añadieron restricciones invisibles que lo penalizaban por usar demasiada energía o por cambiar su rigidez demasiado rápido. Esto obligó al robot a aprender una forma más económica de moverse, descubriendo estrategias que eran naturalmente más suaves y estables. La segunda parte ocurre cuando el robot está realmente trabajando. Incluso con un mejor entrenamiento, los investigadores sabían que un programa de computadora aún podría cometer un error. Por ello, añadieron un filtro de seguridad, una capa final de protección que se sitúa entre el cerebro del robot y sus músculos. Este filtro monitorea constantemente el flujo de energía. Si el robot intenta realizar un movimiento que inyectaría demasiada energía en el sistema, el filtro lo reduce automáticamente, asegurando que el robot se mantenga dentro de los límites seguros.

El equipo probó este método en un escenario desafiante: una tarea de exploración de laberintos donde un brazo robótico tenía que encontrar la salida tocando las paredes a ciegas. Compararon cuatro tipos diferentes de robots: uno que ignoraba las reglas de energía por completo, uno que fue entrenado para cuidar la energía pero no tenía filtro de seguridad, uno que tenía un filtro de seguridad pero fue entrenado sin reglas de energía, y finalmente, su nuevo método que combinaba tanto el entrenamiento consciente de la energía como el filtro de seguridad. Los resultados fueron claros. El robot entrenado sin reglas de energía pudo terminar el laberinto en simulaciones, pero cuando intentaron ejecutarlo en un robot físico real, falló. Se movía con demasiada agresividad, aplicando una fuerza excesiva en las curvas, lo que causó que perdiera el control. En contraste, los robots que fueron entrenados con restricciones de energía aprendieron a moverse de manera más conservadora. Tardaron un poco más en aprender la tarea durante la fase de entrenamiento, pero una vez desplegados, fueron mucho más fiables.

Cuando los investigadores pusieron a prueba los mejores modelos entrenados en el mundo real, la diferencia fue abrumadora. El robot que utilizaba su método combinado completó el laberinto con éxito en cada uno de los ensayos, sin violar nunca los límites de fuerza ni agotar su presupuesto de energía. El robot estándar, incluso estando protegido por el filtro de seguridad, tuvo dificultades porque no había aprendido a gestionar su energía de manera eficiente en primer lugar. El filtro de seguridad por sí solo podía detener un desastre, pero no podía hacer que el robot fuera eficiente. El entrenamiento consciente de la energía por sí solo hizo que el robot fuera eficiente, pero no podía garantizar la seguridad si el robot cometía un error repentino e impredecible. Solo combinando ambos lograron un sistema que fuera tanto seguro como eficiente. Los investigadores descubrieron que el robot entrenado con límites de energía estrictos utilizó su presupuesto de energía de manera mucho más lenta y uniforme, permitiéndole manejar giros complejos y obstáculos sin quedarse sin fuerzas.

Este trabajo destaca un cambio crucial en la forma en que construimos máquinas inteligentes. Sugiere que, para que los robots trabajen de forma segura en nuestro mundo físico, no basta con enseñarles a ser inteligentes; deben ser enseñados a ser físicamente responsables. Al integrar las leyes de conservación de la energía directamente en el proceso de aprendizaje y respaldarlas con un filtro de seguridad en tiempo real, los investigadores han mostrado un camino hacia robots que no solo son capaces, sino también confiables. Sus experimentos, realizados en un brazo robótico de siete articulaciones, demuestran que es posible enseñar a una máquina a navegar en un entorno difícil y con mucho contacto sin arriesgar su propia estabilidad o la seguridad de su entorno. El método no depende de modelos matemáticos complejos del mundo que podrían estar equivocados; en su lugar, se basa en que el robot aprenda los límites de su propia energía a través de la experiencia, guiado por reglas que lo mantienen anclado en la realidad física.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →