← Últimos artigos
💻 computer science

Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos

Este artigo apresenta o **DroneEyes**, o primeiro conjunto de dados de vocabulário aberto em nível de pixel para alvos aéreos minúsculos, e o **SkyAnchor**, um modelo de linguagem de grande escala multimodal aumentado por memória que apresenta um roteador de tokens consciente da semântica e um banco de memória hierárquico para permitir a compreensão em tempo real e eficiente de recursos de pequenos objetos em vídeos aéreos de streaming.

Autores originais: Penglei Sun, Yehua Huang, Zhuoli Tao, Xiang Li, Runwei Guan, Yaoxian Song, Kaiyong Zhao, Henghui Ding, Bo Han, Yang Yang, Xiaowen Chu

Publicado 2026-07-23
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Penglei Sun, Yehua Huang, Zhuoli Tao, Xiang Li, Runwei Guan, Yaoxian Song, Kaiyong Zhao, Henghui Ding, Bo Han, Yang Yang, Xiaowen Chu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é o piloto de um pequeno e tecnológico drone voando sobre uma cidade movimentada. Seu trabalho não é apenas tirar fotos bonitas; você tem que responder a perguntas de um operador humano em tempo real, como "Encontre aquele carro vermelho" ou "Mostre-me o caminhão branco". Este é o mundo da visão aérea, onde computadores tentam entender o que veem do céu. Mas aqui está o problema: as coisas que o drone vê são frequentemente incrivelmente pequenas — como uma única formiga em um enorme piquenique. Para tornar isso ainda mais difícil, o drone está voando, então ele não pode esperar para ver o filme inteiro antes de responder; ele tem que reagir instantaneamente conforme o vídeo é transmitido, quadro a quadro. Isso é chamado de compreensão de vídeo em streaming.

Agora, imagine tentar descrever essa pequena formiga para um amigo enquanto você corre uma maratona. Você não pode carregar um álbum de fotos gigante de cada passo que deu (isso seria muito pesado), mas se você esquecer onde estava um segundo atrás, pode perder a formiga no meio da multidão. Este é exatamente o problema que os pesquisadores enfrentam com os Modelos de Linguagem de Grande Escala Multimodais (MLLMs). Estes são cérebros de IA super inteligentes que podem ver e ler, mas geralmente ficam sobrecarregados com detalhes minúsculos ou esquecem o passado quando o vídeo continua rodando. Este artigo aborda o desafio de ensinar esses cérebros de IA a detectar objetos pequenos e móveis em filmagens de drones ao vivo sem ficar confuso ou ficar sem bateria.


O Problema do Alvo Minúsculo

Os pesquisadores começaram percebendo que as ferramentas de IA existentes eram terríveis para este trabalho específico. A maioria dos modelos de IA é treinada em vídeos de pessoas e cachorros em parques, onde os sujeitos são grandes e fáceis de ver. Quando você aponta uma IA para um vídeo de drone, ela tenta esmagar a imagem inteira para economizar espaço, tratando um carro minúsculo da mesma forma que um edifício enorme. O resultado? O carro minúsculo se perde no borrão.

Para corrigir isso, a equipe construiu primeiro um novo campo de treinamento chamado DroneEyes. Pense nisso como uma biblioteca massiva de 2.140 vídeos de drone em alta definição, mas com um toque especial: cada objeto minúsculo em cada quadro está delineado com precisão de pixel. Eles não apenas desenharam caixas ao redor das coisas; eles traçaram a forma exata de um pequeno carro prateado ou de um pedestre distante. Este conjunto de dados inclui mais de 176.000 pares de perguntas e respostas, ensinando a IA não apenas a encontrar essas coisas minúsculas, mas a descrevê-las em detalhes, como "Aquele é uma escultura vermelha em um pátio circular".

Conheça o SkyAnchor: O Novo Cérebro do Drone

Com esses novos dados, a equipe construiu um novo modelo de IA chamado SkyAnchor. Se os modelos antigos eram como um estudante tentando ler um livro enquanto faz malabarismo, o SkyAnchor é como um estudante com um caderno super organizado e um marca-texto mágico. Ele resolve as duas principais dores de cabeça da visão de drones com dois truques inteligentes:

  1. O Marca-Texto Mágico (Roteador de Tokens Consciente de Semântica):
    Normalmente, quando uma IA olha para um vídeo, ela divide a imagem em milhares de pequenos pedaços de quebra-cabeça (chamados de tokens). Ela trata cada peça igualmente, mesmo o céu entediante do fundo. O SkyAnchor usa um "roteador" que age como um marca-texto inteligente. Ele escaneia a imagem e diz: "Ei, aquele pedaço de céu é entediante, vamos ignorá-lo", mas "Aquele carro minúsculo é importante, vamos manter todos os seus detalhes!". Isso permite que a IA foque sua capacidade cerebral nos alvos minúsculos sem precisar processar toda a imagem massiva, economizando energia e mantendo os detalhes nítidos.

  2. O Sistema de Dois Cadernos (Banco de Memória Hierárquica):
    Como o drone está voando, a IA precisa se lembrar do que viu alguns segundos atrás para saber onde o objeto está agora. Mas ela não pode se lembrar de tudo para sempre, ou sua memória encheria instantaneamente. O SkyAnchor usa um sistema de memória de duas camadas:

    • O Caderno do "Quem" (Memória Semântica): Armazena a identidade do objeto. Ele lembra: "Aquele é um sedan prateado". Esta parte permanece na memória por um longo tempo para que a IA não esqueça o que está rastreando.
    • O Caderno do "Onde" (Memória de Rastreamento): Esta é uma janela deslizante de curto prazo que contém apenas os últimos segundos de movimento. Ela lembra: "O carro acabou de se mover para a esquerda".
      Ao separar "quem é" de "onde está", o SkyAnchor consegue rastrear um alvo suavemente mesmo enquanto o drone aproxima ou afasta o zoom, sem ficar confuso ou perder o objeto.

O Que Eles Descobriram

A equipe testou o SkyAnchor em seu novo conjunto de dados DroneEyes e o comparou com os modelos de IA mais inteligentes disponíveis atualmente. Os resultados foram impressionantes. Na tarefa de descrever objetos, o SkyAnchor pontuou duas vezes mais alto do que os melhores modelos de uso geral. Quando se tratou de encontrar e delinear os objetos minúsculos (segmentação de referência), ele superou o próximo melhor modelo em 15,3%, mesmo sendo o SkyAnchor muito menor e mais leve.

Mas o verdadeiro teste foi se esta IA conseguiria lidar com um ambiente completamente novo que nunca tinha visto antes. Os pesquisadores lançaram o modelo contra um conjunto de dados diferente chamado SkyFind, que apresenta cenas marítimas (oceânicas). Sem qualquer treinamento adicional, o SkyAnchor melhorou os resultados anteriores em 25,9% na localização precisa de objetos. Isso sugere que o modelo aprendeu uma habilidade geral para detectar coisas minúsculas, não apenas memorizar os vídeos de treinamento.

Voo no Mundo Real

Finalmente, a equipe não deixou o SkyAnchor apenas em um laboratório de computador. Eles o colocaram em um drone real voando sobre um campus universitário. Eles otimizaram o software para que pudesse rodar em um computador pequeno e portátil (um NVIDIA Jetson AGX Orin) sem precisar enviar dados para a nuvem. O resultado? O sistema rodou 3,05 vezes mais rápido do que uma configuração padrão, permitindo que o drone responda a perguntas e desenhe contornos em tempo real enquanto voa.

Em vídeos do mundo real, o SkyAnchor rastreou com sucesso um SUV vermelho, um carro prateado escondido em uma estrada de cascalho e até mesmo um peixe koi em um lago, tudo isso enquanto o drone se movia e a visão mudava. Ele não se perdeu nas sombras nem se confundiu com objetos de aparência semelhante.

A Conclusão

Este artigo sugere que, ao combinar um novo conjunto de dados de alta qualidade com um sistema de memória inteligente e um roteador que preserva o foco, podemos tornar a IA muito melhor em detectar coisas minúsculas em vídeos de drones ao vivo. Ele prova que você não precisa de um computador gigante e pesado para fazer isso; um modelo otimizado e consciente da memória pode voar em um drone e ajudar operadores a encontrar exatamente o que estão procurando, agora mesmo. Embora o artigo mostre resultados fortes em conjuntos de dados específicos e testes do mundo real, ele também indica que o trabalho futuro se concentrará em tornar o sistema ainda mais rápido e em ensinar o drone a controlar automaticamente sua trajetória de voo para manter o alvo em vista.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →