← Últimos artigos
💻 computer science

RIO: Flexible Real-Time Robot I/O for Cross-Embodiment Robot Learning

Este artigo apresenta o RIO, um framework Python de código aberto projetado para superar a infraestrutura fragmentada de robôs, fornecendo componentes flexíveis e leves para controle e processamento de dados em diversas plataformas de hardware, permitindo assim o treinamento e a implantação eficientes de modelos de Visão-Linguagem-Ação de última geração em diferentes corporificações.

Autores originais: Pablo Ortega-Kral, Eliot Xing, Arthur Bucker, Vernon Luk, Junseo Kim, Owen Kwon, Angchen Xie, Nikhil Sobanbabu, Yifu Yuan, Megan Lee, Deepam Ameria, Bhaswanth Ayapilla, Jaycie Bussell, Guanya Shi, Jon
Publicado 2026-05-13
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Pablo Ortega-Kral, Eliot Xing, Arthur Bucker, Vernon Luk, Junseo Kim, Owen Kwon, Angchen Xie, Nikhil Sobanbabu, Yifu Yuan, Megan Lee, Deepam Ameria, Bhaswanth Ayapilla, Jaycie Bussell, Guanya Shi, Jonathan Francis, Jean Oh

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a fazer tarefas domésticas, como dobrar uma camisa ou esfregar uma tigela. No mundo da robótica, isso é atualmente como tentar ensinar uma criança a falar todas as línguas diferentes do mundo, mas com uma pegadinha: toda vez que você troca para um robô diferente (um "corpo" ou "encarnação" diferente), você precisa reaprender completamente como falar com ele.

Se você tem um braço robótico de uma empresa e uma câmera de outra, o código que faz com que funcionem juntos é frequentemente um emaranhado de instruções personalizadas. Se quiser trocar para um braço robótico diferente, não pode apenas substituir a peça; muitas vezes é preciso reescrever todo o "cérebro" do robô do zero. Isso torna incrivelmente difícil e lento compartilhar avanços entre cientistas.

Apresentamos o RIO (Robot I/O).

Pense no RIO como um tradutor universal e um sistema modular "plug-and-play" para robôs. É um kit de software leve que permite aos pesquisadores combinar e trocar diferentes partes de robôs sem reescrever o código a cada vez.

Veja como funciona, usando algumas analogias simples:

1. A Abordagem "Lego" (Flexibilidade)

Imagine que você tem uma caixa de blocos de Lego. Alguns são braços robóticos, outros são garra (mãos), alguns são câmeras e outros são controladores de teleoperação (as coisas que humanos usam para mover o robô).

  • Sem o RIO: Você precisa colar os blocos juntos com cola superforte e permanente. Se quiser trocar o braço, precisa desmontar tudo e começar de novo.
  • Com o RIO: Os blocos têm conectores padrão. Você pode encaixar um "braço Franka" em uma "garra Robotiq" ou um "óculos de realidade virtual" em um "robô humanoide" apenas alterando um arquivo de configuração. A lógica central (o "cérebro" que diz ao robô o que fazer) permanece exatamente a mesma; apenas o "corpo" muda.

2. A "Fita de Energia Universal" (Middleware)

Robôs precisam conversar entre si em velocidade da luz. Geralmente, partes diferentes falam "línguas" (protocolos) diferentes.

  • Solução do RIO: Ele age como uma régua de energia inteligente ou um adaptador universal. Ele fica entre o hardware do robô e o software. Seja você usando uma conexão de memória compartilhada de alta velocidade (como duas pessoas sussurrando diretamente na mesma sala) ou uma conexão de rede (como falar pela internet), o RIO lida com a tradução automaticamente. Isso significa que você pode trocar o método de comunicação sem alterar o código do robô.

3. O Controle Remoto de "Teleoperação"

Para ensinar um robô, humanos frequentemente o "teleoperam" — ou seja, usam um controlador e movem o robô com suas próprias mãos.

  • O RIO suporta uma enorme variedade desses controladores: desde teclados e gamepads simples até óculos de realidade virtual de alta tecnologia (como o Apple Vision Pro) e braços robóticos especializados que imitam o movimento humano.
  • O artigo mostra que você pode usar o mesmo software para controlar um único braço robótico, um robô de dois braços ou até mesmo um humanoide de tamanho real andando por aí, apenas trocando o controlador e o corpo do robô.

4. O "Motorista Inteligente de Entrega" (Inferência de Política)

Uma vez que o robô é treinado, ele precisa tomar decisões (como "pegar a xícara") e se mover. Isso é chamado de "inferência".

  • O RIO foi projetado para ser rápido. Ele separa o "pensar" (executar o modelo de IA) do "fazer" (enviar comandos para os motores).
  • O artigo compara o RIO a outro sistema popular chamado LeRobot. Eles descobriram que o RIO é muito mais rápido ao levar um comando da câmera para a mão do robô.
    • LeRobot: Levou cerca de 581 milissegundos (um tempo longo na velocidade de robôs).
    • RIO: Levou apenas 130 milissegundos.
    • Analogia: Se o LeRobot é como enviar uma carta pelo correio, o RIO é como enviar uma mensagem de texto. Essa velocidade é crucial para tarefas dinâmicas, como virar uma tortilha ou jogar uma bola, onde um atraso de fração de segundo causa falha.

O Que Eles Realmente Fizeram?

Os autores não apenas construíram a ferramenta; eles a testaram no mundo real. Eles usaram o RIO para:

  • Coletar dados por meio de humanos controlando robôs para realizar tarefas domésticas (dobrar camisas, esfregar tigelas, pegar caixas).
  • Treinar modelos avançados de IA (como π0.5 e GR00T) com esses dados.
  • Implantar esses modelos treinados em três tipos muito diferentes de robôs:
    1. Robôs de braço único (como um braço de fábrica padrão).
    2. Robôs bimanuais (robôs com dois braços).
    3. Humanoides (robôs que parecem e andam como humanos).

Eles conseguiram fazer com que esses robôs dobrassem roupas, pegassem objetos e até mesmo caminhassem, provando que a mesma pilha de software pode acionar hardware completamente diferente.

A Conclusão

O artigo argumenta que o maior gargalo na aprendizagem de robôs não é apenas ter mais dados ou melhores modelos de IA; é a infraestrutura. Cientistas estão atualmente desperdiçando muito tempo construindo "fiação" personalizada para cada novo robô.

RIO é uma ferramenta gratuita e de código aberto que fornece a "fiação" de uma vez por todas. Ela permite que a comunidade de robótica pare de reinventar a roda e comece a focar em ensinar robôs a fazer coisas mais complexas e úteis, independentemente de como o robô se parece.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →