← Últimos artigos
💻 computer science

RHO: Your Coding Agent is Secretly a Roboticist

O artigo apresenta o Robotics Harness Optimization (RHO), um novo paradigma de treinamento onde agentes de codificação habilitados para ferramentas buscam repositórios de políticas neurosimbólicas de múltiplos arquivos e interpretáveis por meio de feedback ambiental, alcançando desempenho de estado da arte e eficiência superior em relação aos sistemas agênticos de múltiplos turnos existentes em tarefas robóticas em tempo real.

Autores originais: Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

Publicado 2026-06-16
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a pegar uma xícara e colocá-la sobre uma mesa.

O Jeito Antigo: O Programador "Em Tempo Real"
Antigamente, a melhor maneira de fazer isso envolvia uma IA superinteligente (um Modelo de Linguagem Grande) agindo como um programador frenético. Toda vez que o robô derrubava a xícara ou errava a mesa, a IA parava, pensava, escrevia um novo código para corrigir o erro e tentava novamente. Isso é como ter um chef que prova a sopa, percebe que falta sal, para de cozinhar, escreve uma nova receita e então começa tudo de novo. Funciona, mas é lento, bagunçado e o robô não consegue se mover rápido o suficiente para ser útil no mundo real porque está constantemente pausando para reescrever suas próprias instruções.

O Novo Jeito: RHO (O Treinador de "Pré-Jogo")
O RHO (Robotics Harness Optimization) introduz o RHO. Em vez de deixar a IA escrever código enquanto o robô se move, o RHO atua como um treinador rigoroso e reflexivo durante o treinamento.

Veja como o RHO funciona, usando uma analogia simples:

1. O "Repositório" (A Caixa de Ferramentas Completa, Não Apenas Uma Nota)

A maioria dos sistemas de IA tenta consertar um robô ajustando uma única frase ou uma pequena função (como mudar apenas um ingrediente em uma receita). O RHO é diferente. Ele trata o cérebro do robô como um repositório completo de arquivos (um "Repositório").

  • Analogia: Imagine que o cérebro do robô não é apenas um post-it com instruções; é uma oficina completa com um manual, um conjunto de ferramentas, uma lista de verificação de segurança e um mapa de navegação. O RHO não apenas edita o post-it; ele reorganiza toda a oficina, troca as ferramentas e reescreve os manuais de uma só vez.

2. O "Agente Habilitado para Ferramentas" (O Aprendiz Que Realmente Consegue Construir)

O RHO usa um agente de IA especial que não é apenas um gerador de texto. É um agente de codificação com mãos.

  • Analogia: Em vez de apenas falar sobre como consertar o robô, este agente tem permissão para abrir os arquivos de código do robô, executar testes, olhar para a "transmissão de vídeo" do robio para ver o que deu errado, verificar os registros de erro e, então, realmente reescrever o código. É como um aprendiz que pode ler o manual, pegar uma chave inglesa, consertar o motor e depois fazer um teste drive, tudo de uma vez.

3. A "Busca Evolutiva" (Sobrevivência do Mais Apto)

O RHO não tenta apenas um conserto. Ele executa um processo evolutivo.

  • Analogia: Imagine um torneio. A IA cria 100 versões diferentes do "cérebro" do robô (repositórios de código diferentes). Ela envia todos eles para uma simulação para tentar a tarefa.
    • Alguns falham miseravelmente.
    • Alguns vão bem.
    • Alguns poucos são excelentes.
    • A IA pega os "vencedores", mistura seus melhores recursos e cria uma nova geração de 100 robôs. Ela repete isso centenas de vezes.
    • Crucialmente, ela mantém uma "Fronteira de Pareto". Isso significa que ela não mantém apenas o robô que é o melhor em tudo. Ela mantém o robô que é o melhor para esta tarefa específica, mesmo que seja ruim em outra. Isso garante que o robô final seja um especialista, não um generalista que falha em tarefas específicas.

4. O Resultado: Um Robô "Pronto para Implementação"

Ao final do treinamento, o RHO produz um único "Repositório" perfeito (um conjunto completo de arquivos de código).

  • A Magia: Quando este robô é implementado no mundo real, ele não precisa mais da IA para pensar. Ele não pausa para escrever código. Ele apenas executa o código pré-escrito e altamente otimizado.
  • A Analogia: É como a diferença entre um aluno que precisa consultar todas as fórmulas matemáticas durante uma prova versus um aluno que já memorizou as fórmulas e praticou milhares de problemas. O robô RHO é o aluno que já fez todo o trabalho pesado durante o "dever de casa" (treinamento) e está pronto para gabaritar o teste (implementação) instantaneamente.

O Que Eles Realmente Alcançaram?

O artigo afirma que este método é significativamente melhor do que o estado da arte atual:

  • Velocidade e Confiabilidade: Em benchmarks padrão de robótica (como empilhar blocos ou mover objetos), o RHO alcançou uma taxa de sucesso de 70% usando uma única execução rápida. O método anterior (que exigia que a IA pausasse e reescrevesse o código constantemente) obteve 68% e era muito mais lento.
  • Lidando com o Caos: Quando os pesquisadores mudaram as regras (como mover os objetos para lugares diferentes ou mudar a descrição da tarefa), outros modelos de IA (como o OpenVLA) falharam completamente (0% de sucesso). O RHO ainda conseguiu ter sucesso 45% das vezes.
  • Eficiência: Em uma simulação de mundo real mais complexa, o RHO reduziu o tempo que o robô passava "pensando" em 20% e reduziu o número de ferramentas que ele precisava chamar em 27%, tudo isso enquanto dobrava sua taxa de sucesso.

O Ponto Principal

O RHO muda o jogo ao mover o esforço pesado da implementação (quando o robô está trabalhando) para o treinamento (quando o robô está aprendendo). Ele utiliza uma IA inteligente e capaz de usar ferramentas para evoluir uma biblioteca de código completa, multi-arquivos, que é robusta, interpretável (humanos podem ler o código) e pronta para rodar instantaneamente sem precisar de um supercomputador para reescrever suas instruções em tempo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →