← Últimos artigos
🤖 machine learning

Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons

O artigo apresenta o Robometer, um framework escalável de modelagem de recompensa que combina supervisão de progresso em nível de quadro com aprendizado de preferência por comparação de trajetórias, treinado no conjunto de dados RBM-1M em grande escala para aprender efetivamente funções de recompensa generalizáveis a partir de trajetórias diversas de especialistas e subótimas.

Autores originais: Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Ste
Publicado 2026-05-15
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Stephen Tu, Erdem Biyik, Jesse Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a cozinhar o jantar. No passado, para ensinar o robô, você tinha que atuar como um juiz rigoroso, observando cada segundo de seus movimentos e atribuindo-lhe uma pontuação precisa (como "7,5 de 10") para avaliar o quão bem ele estava picando cebolas. Se o robô deixasse cair a faca, você precisava descobrir exatamente quando a pontuação caiu e em quanto. Isso é incrivelmente difícil de fazer, especialmente quando o robô falha, e significa que você não pode usar os milhares de tentativas "fracassadas" que os robôs fazem no mundo real, porque são muito bagunçadas para serem avaliadas.

ROBOMETER é um novo sistema que muda a forma como ensinamos robôs, utilizando uma abordagem mais inteligente e semelhante à humana para avaliação.

A Ideia Central: Comparar em vez de Avaliar

Em vez de tentar atribuir uma pontuação perfeita a cada momento, o ROBOMETER aprende comparando duas tentativas diferentes da mesma tarefa.

Pense nisso como um juiz de um show de talentos. Em vez de dar a um participante uma pontuação de 8,2 de 10, o juiz simplesmente observa duas apresentações e diz: "A Apresentação A foi claramente melhor que a Apresentação B".

  • O Jeito Antigo: Você precisa assistir a um robô falhar ao colocar uma xícara em uma mesa e tentar calcular exatamente quão "ruim" foi o fracasso.
  • O Jeito ROBOMETER: Você mostra ao robô um vídeo de um humano fazendo isso perfeitamente e um vídeo do robô deixando a xícara cair. O sistema aprende: "O vídeo do humano é melhor". Ele não precisa saber por que ou dar um número específico; apenas aprende a ordem de "bom" versus "ruim".

A "Gigantesca Biblioteca" de Erros (RBM-1M)

Para ensinar esse sistema, os pesquisadores construíram uma biblioteca massiva chamada RBM-1M.

  • O Problema Antigo: A maioria das bibliotecas de treinamento de robôs possui apenas vídeos "perfeitos". Se um robô deixa cair uma xícara, esse vídeo é jogado no lixo porque é difícil de avaliar.
  • A Nova Solução: Esta biblioteca contém 1 milhão de vídeos de 21 tipos diferentes de robôs (de braços únicos a mãos semelhantes às humanas). Crucialmente, ela está cheia de erros, falhas e tentativas desajeitadas. Como o ROBOMETER aprende comparando (por exemplo, "essa tentativa falhada é pior que aquela bem-sucedida"), ele pode realmente aprender com a pilha de vídeos fracassados. Ele trata as falhas como lições valiosas sobre o que não fazer.

Como Funciona (A Dança de Dois Passos)

O ROBOMETER aprende usando dois truques específicos ao mesmo tempo:

  1. Verificação de "Progresso": Ele observa um único vídeo e tenta adivinhar: "Quão avançada está essa tarefa?" (de 0% a 100%). Isso ancora a compreensão do robô sobre o tempo e o progresso.
  2. Verificação de "Preferência": Ele observa dois vídeos lado a lado e decide: "Qual deles fez o trabalho melhor?". Isso ensina o robô a entender a qualidade da ação, mesmo que seja um fracasso total.

Ao combinar isso, o robô desenvolve um "sentimento" de sucesso que funciona mesmo quando está observando um robô que nunca viu antes, em um quarto onde nunca esteve.

O Que Ele Realmente Faz (Resultados Comprovados)

O artigo mostra que este sistema funciona melhor que métodos anteriores em quatro cenários específicos do mundo real:

  1. Aprendizado Online Automático: Quando um robô está aprendendo uma tarefa em tempo real (como colocar uma tigela em uma mesa), o ROBOMETER atua como um treinador que diz instantaneamente ao robô: "Você está fazendo errado", e o guia para corrigir o erro. Ele ajudou um robô a melhorar sua taxa de sucesso de 20% para 85% em uma cozinha bagunçada, enquanto métodos antigos ficavam presos em 55%.
  2. Aprendizado com Dados Bagunçados (RL Offline): Se você tem uma mistura de vídeos perfeitos e vídeos bagunçados e falhos, o ROBOMETER pode organizá-los para ensinar um novo robô. Ele melhorou as taxas de sucesso em 2,4 vezes comparado às melhores ferramentas anteriores.
  3. Encontrar o Bom Material (Filtragem de Dados): Imagine que você tem uma enorme pilha de clipes de vídeo e precisa encontrar os 10 melhores para ensinar um robô a "mexer uma panela". O ROBOMETER é muito melhor em encontrar os clipes relevantes e bem-sucedidos e ignorar as falhas do que outras ferramentas de busca. Isso levou a uma melhoria de 4,5 vezes na capacidade do robô de aprender a tarefa.
  4. Identificar Falhas: Se um robô estiver preso, oscilando (balançando para frente e para trás sem se mover) ou deixando cair um objeto, o ROBOMETER pode detectar essa falha imediatamente sem precisar que lhe seja dito como uma falha se parece. Ele identificou corretamente falhas em 81% dos casos, superando outros sistemas.

A Conclusão

O ROBOMETER é um "modelo de recompensa universal" que impede que os robôs precisem de um humano para avaliar cada segundo de seu trabalho. Ao aprender a comparar "melhor" versus "pior" usando uma biblioteca massiva de sucessos e falhas, ele ajuda os robôs a aprender mais rápido, lidar melhor com erros e adaptar-se a novas tarefas e novos corpos de robôs sem necessidade de ser re-treinado do zero.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →