← Últimos artículos
🤖 machine learning

Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons

El artículo presenta Robometer, un marco de modelado de recompensas escalable que combina la supervisión del progreso a nivel de cuadro con el aprendizaje de preferencias por comparación de trayectorias, entrenado en el conjunto de datos RBM-1M a gran escala para aprender eficazmente funciones de recompensa generalizables a partir de trayectorias diversas de expertos y subóptimas.

Autores originales: Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Ste
Publicado 2026-05-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Stephen Tu, Erdem Biyik, Jesse Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot a cocinar la cena. En el pasado, para enseñarle al robot, tenías que actuar como un juez estricto, observando cada segundo de sus movimientos y asignándole una puntuación precisa (como "7.5 sobre 10") por lo bien que cortaba las cebollas. Si el robot dejaba caer el cuchillo, tenías que determinar exactamente cuándo cayó la puntuación y en qué medida. Esto es increíblemente difícil de hacer, especialmente cuando el robot falla, y significa que no puedes utilizar los miles de intentos "fallidos" que los robots realizan en el mundo real porque son demasiado desordenados para calificarlos.

ROBOMETER es un nuevo sistema que cambia la forma en que enseñamos a los robots mediante un enfoque de calificación más inteligente y similar al humano.

La idea central: Comparar en lugar de calificar

En lugar de intentar dar una puntuación perfecta a cada momento individual, ROBOMETER aprende comparando dos intentos diferentes de la misma tarea.

Piensa en ello como un juez de un concurso de talentos. En lugar de darle a un concursante una puntuación de 8.2 sobre 10, el juez simplemente observa dos actuaciones y dice: "La actuación A fue claramente mejor que la actuación B".

  • La vieja forma: Tienes que observar a un robot fallar al poner una taza sobre una mesa e intentar calcular exactamente cuán "mala" fue la falla.
  • La forma ROBOMETER: Muestras al robot un video de un humano haciéndolo perfectamente y un video del robot dejando caer la taza. El sistema aprende: "El video humano es mejor". No necesita saber por qué ni dar un número específico; simplemente aprende el orden de "bueno" frente a "malo".

La "biblioteca gigante" de errores (RBM-1M)

Para enseñar este sistema, los investigadores construyeron una biblioteca masiva llamada RBM-1M.

  • El viejo problema: La mayoría de las bibliotecas de entrenamiento de robots solo tienen videos "perfectos". Si un robot deja caer una taza, ese video se tira a la basura porque es difícil de calificar.
  • La nueva solución: Esta biblioteca contiene 1 millón de videos de 21 tipos diferentes de robots (desde brazos individuales hasta manos similares a las humanas). Crucialmente, está llena de errores, fallos y intentos torpes. Como ROBOMETER aprende comparando (por ejemplo, "este intento fallido es peor que ese exitoso"), en realidad puede aprender de la pila de basura de videos fallidos. Trata los fallos como lecciones valiosas sobre lo que no hay que hacer.

Cómo funciona (el baile de dos pasos)

ROBOMETER aprende utilizando dos trucos específicos al mismo tiempo:

  1. La verificación de "Progreso": Observa un solo video e intenta adivinar: "¿Qué tan avanzado está esta tarea?" (del 0% al 100%). Esto ancla la comprensión del robot sobre el tiempo y el progreso.
  2. La verificación de "Preferencia": Observa dos videos lado a lado y decide: "¿Cuál hizo el trabajo mejor?". Esto enseña al robot a entender la calidad de la acción, incluso si es un fracaso total.

Al combinar estos elementos, el robot aprende una "sensación" de éxito que funciona incluso cuando está observando a un robot que nunca ha visto antes, en una habitación donde nunca ha estado.

Lo que realmente hace (resultados probados)

El documento demuestra que este sistema funciona mejor que los métodos anteriores en cuatro escenarios específicos del mundo real:

  1. Aprendizaje en línea automático: Cuando un robot está aprendiendo una tarea en tiempo real (como poner un bol sobre una mesa), ROBOMETER actúa como un entrenador que le dice al robot instantáneamente: "Lo estás haciendo mal", y lo guía para corregir el error. Ayudó a un robot a mejorar su tasa de éxito del 20% al 85% en una cocina desordenada, mientras que los métodos antiguos se estancaron en el 55%.
  2. Aprendizaje a partir de datos desordenados (RL fuera de línea): Si tienes una mezcla de videos perfectos y videos desordenados y fallidos, ROBOMETER puede ordenarlos para enseñar a un nuevo robot. Mejoró las tasas de éxito en 2.4 veces en comparación con las mejores herramientas anteriores.
  3. Encontrar lo bueno (filtrado de datos): Imagina que tienes una pila enorme de clips de video y necesitas encontrar los 10 mejores para enseñar a un robot a "remover una olla". ROBOMETER es mucho mejor encontrando los clips relevantes y exitosos e ignorando los fallos que otras herramientas de búsqueda. Esto llevó a una mejora de 4.5 veces en la capacidad del robot para aprender la tarea.
  4. Detectar fallos: Si un robot está atascado, oscilando (moviéndose de un lado a otro sin avanzar) o dejando caer un objeto, ROBOMETER puede detectar este fallo inmediatamente sin necesidad de que se le diga cómo se ve un fallo. Identificó correctamente los fallos en el 81% de los casos, superando a otros sistemas.

La conclusión

ROBOMETER es un "modelo de recompensa universal" que evita que los robots necesiten que un humano califique cada segundo de su trabajo. Al aprender a comparar "mejor" frente a "peor" utilizando una biblioteca masiva de éxitos y fracasos, ayuda a los robots a aprender más rápido, manejar mejor los errores y adaptarse a nuevas tareas y nuevos cuerpos de robots sin necesidad de volver a entrenarlos desde cero.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →