← Últimos artigos
🤖 AI

HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

O HIL-UMI introduz um framework sem robô, com o humano no ciclo (human-in-the-loop), para modelos de Visão-Linguagem-Ação pós-treinamento que aproveita uma Interface de Manipulação Universal portátil e uma pontuação de energia guiada por política para coletar dados direcionados de forma eficiente e refinar estimadores de vantagem, superando assim as limitações do ajuste fino supervisionado estático e permitindo a melhoria iterativa escalável sem a implantação de robôs físicos.

Autores originais: Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong

Publicado 2026-09-18
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os robôs estão se tornando cada vez mais capazes de compreender o mundo através da visão e da linguagem, aprendendo com vastas quantidades de dados para realizar tarefas complexas. No entanto, permanece uma lacuna significativa entre o que esses sistemas de inteligência artificial aprendem de forma geral e o que eles podem realmente fazer em uma cozinha, oficina ou fábrica específica. Quando um robô é implantado em um ambiente real, ele frequentemente encontra situações que nunca viu antes, levando a erros que podem se acumular até que a tarefa falhe. Para corrigir isso, pesquisadores tradicionalmente dependem do "ajuste fino supervisionado", um processo onde humanos demonstram as ações corretas no próprio robô, e a máquina aprende a imitá-las. Embora isso ajude, é lento, caro e muitas vezes perde os momentos específicos onde o robô tem maior probabilidade de falhar, porque o robô aprende apenas com os exemplos que lhe foram dados, não com os erros que comete ao tentar resolver o problema por conta própria.

Uma equipe de pesquisadores desenvolveu uma nova abordagem chamada HIL-UMI que muda a forma como os robôs aprendem com os humanos, removendo a necessidade de o robô estar presente durante a fase de treinamento. Em vez de observar um robô lutando e depois corrigi-lo, este método utiliza um dispositivo portátil e manual que se parece com uma garra robótica, mas é segurado por um operador humano. O operador realiza a tarefa com este dispositivo enquanto um programa de computador, executando o "cérebro" atual do robô, assiste à mesma transmissão de vídeo e tenta adivinhar o que o humano fará a seguir. O sistema não move o robô; ele simplesmente compara os movimentos reais do humano com suas próprias previsões. Quando o humano faz algo que o computador não esperava, o sistema sinaliza esse momento como uma oportunidade de aprendizado e o registra. Isso permite que o robô aprenda com seus próprios pontos cegos sem jamais ter que tentar fisicamente a tarefa e arriscar falhas.

O núcleo deste método envolve um ciclo contínuo de observação e refinamento. À medida que o humano demonstra uma tarefa, o computador verifica constantemente se suas próprias previsões coincidem com as ações do humano. Se o palpite do computador for drasticamente diferente do que o humano está fazendo, o sistema sabe que está em um "ponto cego" — uma situação que o robô não compreende bem. Nesse ponto, o humano é solicitado a continuar a demonstração, e o sistema salva esse segmento específico de dados. Os pesquisadores também adicionaram uma segunda camada de inteligência: uma forma de julgar o quão bem a tarefa está progredindo. Se o sistema pensar que a tarefa está indo mal, mesmo que o humano esteja se movendo corretamente, ele registra esse momento para ajudar o computador a aprender a julgar melhor o sucesso. Ao combinar esses dois tipos de dados, o robô aprende não apenas o que fazer, mas quais ações são mais úteis para concluir o trabalho.

Para testar essa ideia, os pesquisadores a aplicaram a quatro tarefas distintas do mundo real usando um braço robótico padrão. As tarefas variaram desde dobrar uma toalha e limpar uma mesa até empilhar cubos e carimbar um pedaço de papel com alta precisão. Em todos os casos, o robô começou com um conjunto básico de instruções e passou por várias rodadas de treinamento usando o novo método manual. Os resultados mostraram uma melhora clara em relação aos métodos tradicionais. Enquanto as técnicas de treinamento padrão frequentemente atingiam um teto onde adicionar mais dados não ajudava, o novo método permitiu que o robô melhorasse consistentemente a cada rodada de treinamento. O robô aprendeu a lidar com sequências de ações longas e complicadas e movimentos delicados e precisos de forma mais eficaz do que antes.

Uma das descobertas mais impressionantes foi a velocidade com que este novo método coletou informações úteis. Os métodos tradicionais que exigem que um robô se mova fisicamente e seja corrigido por um humano são lentos e difíceis de escalar. Em contraste, o método manual foi considerado mais de cinco vezes mais rápido na coleta dos dados necessários. Isso ocorre porque o operador humano pode mover o dispositivo livremente sem esperar que um robô reinicie ou que um humano intervenha fisicamente em uma máquina pesada. O sistema identificou com sucesso os momentos exatos em que o robô precisava de ajuda, focando o treinamento nas partes mais difíceis da tarefa, em vez de desperdiçar tempo em partes que o robô já entendia.

O estudo sugere que esta abordagem oferece um caminho escalável para ensinar novas habilidades a robôs em diferentes locais e por diferentes pessoas. Como o treinamento acontece em um dispositivo manual, múltiplos operadores poderiam potencialmente coletar dados simultaneamente em diferentes lugares, todos alimentando o processo de aprendizado do mesmo robô. Os pesquisadores descobriram que, ao focar nos lacunas específicas do conhecimento do robô e usar um sistema que recompensa o progresso, eles puderam criar um robô que é mais confiável e eficiente. Este trabalho aponta para um futuro onde robôs podem ser adaptados a novos ambientes de forma rápida e segura, sem a necessidade de tentativas físicas repetitivas, caras e demoradas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →