← Últimos artigos
🤖 machine learning

InSight: Self-Guided Skill Acquisition via Steerable VLAs

O InSight é um framework que permite que modelos de Visão-Linguagem-Ação (VLA) adquiram autonomamente novas habilidades de manipulação ao decompor demonstrações em ações primitivas direcionáveis e utilizar um volante de dados guiado por um VLM para gerar, rotular e integrar primitivos ausentes para novas tarefas de longo horizonte sem intervenção humana adicional.

Autores originais: Maggie Wang, Lars Osterberg, Stephen Tian, Ola Shorinwa, Jiajun Wu, Mac Schwager

Publicado 2026-06-24
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Maggie Wang, Lars Osterberg, Stephen Tian, Ola Shorinwa, Jiajun Wu, Mac Schwager

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a cozinhar. Tradicionalmente, se você quiser que o robô aprenda um novo prato, como "fazer um sanduíche", você tem que ficar ao lado dele, segurando sua mão e guiando-o através de cada etapa: pegar o pão, passar a manteiga, adicionar o queijo e assim por diante. Isso é lento, caro e, se você quiser que ele aprenda a "fazer uma sopa" mais tarde, terá que fazer todo o processo novamente.

O artigo INSIGHT propõe uma maneira mais inteligente de ensinar robôs, uma que funciona mais como a forma como os humanos aprendem novas habilidades. Em vez de memorizar receitas inteiras, o robô aprende movimentos individuais (como "pegar", "levantar", "girar" ou "derramar") e então descobre como combiná-los por conta própria.

Veja como o sistema funciona, dividido em etapas simples:

1. A Abordagem "Peça de Lego"

Pense nas habilidades de um robô não como um bloco gigante e inquebrável, mas como uma caixa de peças de Lego.

  • O Problema: A maioria dos robôs hoje é treinada para tarefas completas. Se você mostrar a eles como "pegar uma xícara", eles aprendem aquela sequência específica. Se você pedir para eles "derramarem água", eles podem falhar porque nunca viram a peça do "derramar" antes.
  • A Solução do INSIGHT: O sistema pega demonstrações humanas (como um vídeo de alguém pegando uma xícra) e as fatia automaticamente em pequenas "peças" rotuladas chamadas primitivas.
    • Exemplo: Em vez de ver "pegar xícara", o robô vê: "Mover mão até a xícara" + "Fechar dedos" + "Levantar".
    • O robô aprende esses movimentos individuais tão bem que pode ser "conduzido" para fazer apenas um deles sob comando.

2. O "Assistente Inteligente" (O VLM)

O robô possui um "Assistente Inteligente" integrado (um Modelo de Linguagem e Visão, ou VLM) que atua como um gerente de projeto.

  • O Cenário: Imagine que o robô sabe como "pegar uma garrafa" e "colocá-la no chão", mas você pede para ele "derramar o conteúdo da garrafa em uma tigela".
  • A Lacuna: O Assistente Inteligente olha para o plano e diz: "Ei, nós temos a peça 'pegar' e a peça 'colocar no chão', mas nos falta a peça 'inclinar e derramar'!"
  • A Correção: Em vez de pedir a um humano para mostrar como derramar, o Assistente Inteligente descobre a física do movimento (ex: "Inclinar a garrafa para frente 45 graus") e diz ao robô para tentar.

3. O "Ciclo de Prática"

É aqui que a mágica acontece. O robô tenta realizar esse movimento que estava faltando por conta própria.

  • Tentativa e Erro: O robô tenta o movimento de "inclinar". Se ele derramar em todo lugar, ele tenta novamente com um ângulo ligeiramente diferente.
  • A Verificação do "Oráculo": Após o robô tentar, o Assistente Inteligente observa o resultado (como um professor corrigindo uma prova). "A água foi para a tigela? Sim? Ótimo! Não? Tente de novo."
  • Aprendizado: Assim que o robô consegue derramar a água com sucesso, o sistema salva esse movimento específico de "inclinar" como uma nova peça de Lego em sua biblioteca. Ele então se treina novamente para lembrar dessa nova peça para sempre.

4. Construindo Novas Habilidades do Zero

Uma vez que o robô aprendeu a peça de "derramar", ele não precisa que um humano o ensine novamente.

  • O Resultado: Se mais tarde você pedir ao robão para "girar uma tampa e depois derramar", ele agora pode combinar a peça de "girar" (que ele pode ter aprendido anteriormente) com a nova peça de "derramar".
  • A Analogia: É como um músico que aprendeu a tocar um acorde de Dó maior e um acorde de Fá maior. Se ele quiser tocar uma música nova, não precisa de um professor para lhe mostrar a música inteira; ele apenas combina os acordes que já conhece.

O Que Eles Realmente Provaram?

Os pesquisadores testaram isso tanto em simulações de computador quanto em robôs reais (usando um braço robótico). Eles mostraram que:

  • Nenhuma Nova Ajuda Humana Foi Necessária: Eles ensinaram o robô a realizar tarefas complexas como virar um bloco, fechar uma gaveta, girar a tampa de uma garrafa e derramar feijões sem nunca mostrar a ele um vídeo de alguém fazendo essas coisas específicas.
  • Funciona Rápido: O robô aprendeu essas novas habilidades muito mais rápido do que os métodos tradicionais (como o Aprendizado por Reforço, que é como um robô tentando aprender por tentativa e erro cega milhares de vezes).
  • Não Esquece: Quando o robô aprendeu a nova habilidade de "derramar", ele não esqueceu como "pegar" a garrafa. Ele manteve todas as suas habilidades antigas enquanto adicionava as novas.
  • Sucesso no Mundo Real: Em um robô real, ele alcançou altas taxas de sucesso (até 96% para derramar) e conseguiu até combinar habilidades para realizar uma tarefa longa de 14 etapas (girar uma tampa e depois derramar) que ele nunca tinha visto antes.

A Conclusão

INSIGHT é um framework que permite aos robôs decompor tarefas complexas em movimentos pequenos e reutilizáveis. Quando encontram um novo trabalho, eles usam um "Assistente Inteligente" para descobrir quais movimentos lhes faltam, praticam esses movimentos por conta própria e os salvam para depois. Isso permite que os robôs aprendam novas habilidades continuamente, sem precisar que um humano segure sua mão toda vez.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →