← Últimos artigos
💻 computer science

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

O Open-AoE é um conjunto de dados e uma cadeia de ferramentas aberta e impulsionada pela comunidade que preenche a lacuna entre a captura escalável de vídeo egocêntrico baseada em smartphones e o treinamento de IA incorporada, ao fornecer 2.000 horas de dados de manipulação estruturados juntamente com um pipeline abrangente para processamento, retargeting e treinamento de vários modelos de aprendizado robótico.

Autores originais: Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo W
Publicado 2026-07-21
📖 4 min de leitura☕ Leitura rápida

Autores originais: Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo Wang, Yifan Yang, Zhaowen Zhou, Man Luo, Hao Cheng, Bo Zhang, Jianshu Li, Jiansheng Cai, Guocai Yao, Jize Zhang, Chenhao Lin, Renjing Xu, Lequan Yu, Chao Shen, Chunhua Shen, Zhe Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine tentar ensinar um robô a fazer um sanduíche, consertar uma torneira com vazamento ou dobrar uma camisa. Você não pode simplesmente alimentá-lo com uma biblioteca de livros didáticos; ele precisa ver e sentir como os humanos fazem essas coisas. Este é o mundo da inteligência incorporada (embodied intelligence), onde os computadores aprendem interagindo com o mundo físico, exatamente como nós fazemos. Mas há um problema: os robôs veem o mundo de forma diferente de nós. Se você gravar um vídeo de uma câmera em uma prateleira (uma visão de "terceira pessoa"), o robô vê o quarto inteiro, mas perde os pequenos movimentos dos dedos. Se você gravar a partir dos próprios olhos de um robô (visão "egocêntrica"), ele obtém a perspectiva correta, mas conseguir dados de alta qualidade suficientes para ensiná-lo é incrivelmente difícil e caro. Geralmente, você precisa de câmeras especiais e caras presas às cabeças das pessoas, ou tem que rotular manualmente cada segundo de vídeo para dizer ao computador o que está acontecendo. Sem uma biblioteca massiva e de fácil uso desses vídeos de "olhar humano", os robôs têm dificuldade em aprender os truques sutis da vida cotidiana.

É aqui que um novo projeto chamado Open-AoE entra, atuando como um kit de ferramentas de código aberto massivo para ensinar robôs. Os pesquisadores por trás dele perceberam que todo mundo já tem a câmera perfeita no bolso: um smartphone. Então, eles construíram um sistema que transforma milhares de pessoas comuns em coletores de dados. Eles criaram um aplicativo que grava vídeos de pessoas realizando tarefas cotidianas — como despejar café ou digitar em um teclado — usando seus próprios telefones. Mas eles não pararam apenas na gravação; eles construíram uma gigantesca fábrica automatizada na nuvem que pega esses vídeos brutos e desorganizados e os transforma em lições super organizadas e prontas para o robô.

A equipe reuniu impressionantes 2.000 horas desses vídeos, coletados por mais de 500 pessoas diferentes usando mais de 400 tipos diferentes de smartphones. Isso é muito tempo! Os vídeos cobrem mais de 400 cenas diferentes (de cozinhas a escritórios) e mais de 8.000 tarefas diferentes. O que torna isso especial não é apenas o volume, mas a "mágica" que o sistema adiciona às filmagens. Usando IA avançada, o sistema identifica automaticamente exatamente onde as mãos estão se movendo (até os 21 articulações dos dedos), para onde a câmera está se movendo e divide o vídeo em pequenos pedaços significativos de ação. Ele até escreve descrições em texto sobre o que está acontecendo.

Pense nisso desta forma: antes, se você quisesse ensinar um robô, tinha que contratar uma equipe de filmagem, comprar equipamentos caros e passar anos editando as filmagens. O Open-AoE é como entregar um smartphone para cada pessoa, dizendo "Filme o seu dia", e depois ter um editor de robô mágico que instantaneamente transforma esses filmes em um livro didático perfeito para um robô aprender. O artigo mostra que essa abordagem funciona, fornecendo um conjunto de dados rico e diversificado que ajuda os robôs a entender não apenas o que fazer, mas como mover suas mãos e olhos para fazer isso.

Os pesquisadores também construíram um conjunto de ferramentas (uma "cadeia de ferramentas" ou toolchain) que permite aos cientistas pegar esses dados e fazer coisas legais com eles. Eles podem visualizar o movimento 3D das mãos, "retarget" (reajustar) movimentos humanos para se ajustarem a diferentes corpos de robôs (como transformar um braço humano em um braço robótico) e treinar diferentes tipos de modelos de IA. Eles descobriram que, ao usar esses dados diversos baseados em smartphones, podem criar uma base muito mais forte para os robôs aprenderem com o mundo real, sem precisar de um milhão de dólares em equipamentos. É um grande passo para criar robôs que possam realmente nos ajudar em nossas tarefas diárias, porque agora eles têm uma biblioteca massiva e aberta de experiências humanas para estudar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →