← Últimos artigos
💻 computer science

X2SAM: Any Segmentation in Images and Videos

X2SAM é um Modelo de Linguagem Grande Multimodal unificado que estende capacidades de segmentação de qualquer segmento de imagens para vídeos ao acoplar um LLM a um módulo de Memória de Máscara, permitindo a geração de máscaras de alta qualidade e consistentes temporalmente a partir de instruções conversacionais e prompts visuais em diversas tarefas de segmentação.

Autores originais: Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

Publicado 2026-05-05
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente superinteligente que pode olhar para uma foto ou um vídeo e dizer exatamente o que está acontecendo. Por muito tempo, esses assistentes eram ótimos em descrever a "imagem geral" (como "um cachorro brincando em um parque"), mas péssimos em apontar detalhes específicos (como "desenhe um círculo ao redor da pata esquerda do cachorro").

Por outro lado, você tem ferramentas especializadas que são incríveis em desenhar aqueles círculos precisos (máscaras) ao redor de objetos, mas são como robôs que só entendem comandos simples como "clique aqui" ou "desenhe uma caixa". Elas não entendem frases complexas como: "Encontre o cachorro que está perseguindo a bola vermelha e desenhe ao redor dele".

X2SAM é o novo "superconector" que preenche essa lacuna. Ele combina o cérebro de uma IA conversacional com as mãos de uma ferramenta de desenho precisa, e funciona tanto para fotos estáticas quanto para vídeos em movimento.

Aqui está uma explicação de como funciona, usando algumas analogias do dia a dia:

1. O "Tradutor Universal" para Fotos e Vídeos

Pense no X2SAM como um tradutor universal que fala tanto "Linguagem Humana" quanto "Linguagem de Pixels".

  • O Jeito Antigo: Se você quisesse encontrar um objeto específico em um vídeo, talvez tivesse que usar uma ferramenta para entender o vídeo e outra para desenhar o contorno. Elas não conversavam bem entre si.
  • O Jeito X2SAM: Você pode simplesmente conversar com ele naturalmente. Você pode dizer: "Mostre-me a pessoa andando de um lado para o outro perto da parede branca", ou até apontar para um ponto na sua tela e dizer: "Encontre o que está nesta área". O X2SAM entende a instrução e desenha o contorno instantaneamente para você, seja em uma única foto ou em um clipe de vídeo de 10 segundos.

2. O "Banco de Memória" para Imagens em Movimento

Este é o ingrediente secreto que torna o X2SAM especial para vídeos.

  • O Problema: Se você pedir a uma IA padrão para rastrear uma pessoa em um vídeo, ela frequentemente olha para cada quadro (cada imagem de fração de segundo) como se fosse totalmente nova. Ela pode perder o rastro da pessoa quando ela passa atrás de uma árvore ou quando a câmera treme.
  • A Solução X2SAM: O X2SAM possui um Módulo de Memória de Máscara. Imagine isso como um sistema de "bilhetes adesivos". À medida que o vídeo toca, o X2SAM anota onde o objeto estava no quadro anterior e guarda esse bilhete no bolso. Quando olha para o próximo quadro, ele consulta suas anotações para dizer: "Ah, eu sei que essa pessoa estava aqui há instantes, então provavelmente ainda está aqui". Isso permite que ele mantenha o contorno do objeto suave e consistente, mesmo que o objeto se mova, seja escondido ou mude de forma.

3. A "Canivete Suíço" de Tarefas

O artigo afirma que o X2SAM pode lidar com uma vasta variedade de tarefas com um único sistema, em vez de precisar de uma ferramenta diferente para cada trabalho. Ele pode fazer:

  • Segmentação Genérica: "Desenhe contornos para tudo nesta imagem."
  • Segmentação por Referência: "Desenhe o gato usando um chapéu."
  • Segmentação por Raciocínio: "Encontre o objeto que poderia ser usado para despejar água em um copo." (Ele precisa pensar para descobrir que é uma jarra, não apenas procurar pela palavra "jarra").
  • Segmentação Visual Fundamentada: Você aponta para um ponto na tela, e ele desenha o objeto para o qual você está apontando.
  • Conversação: Ele pode conversar com você sobre a imagem ou o vídeo enquanto desenha as máscaras ao mesmo tempo.

4. Como Ele Aprendeu (O Treinamento)

Para se tornar tão bom, os pesquisadores não ensinaram apenas uma coisa de cada vez. Eles usaram uma estratégia de Treinamento Conjunto Unificado.

  • A Analogia: Imagine ensinar um aluno. Em vez de ensinar matemática na segunda-feira e história na terça-feira, você ensina como resolver problemas de matemática usando fatos de história, e vice-versa, tudo ao mesmo tempo.
  • O X2SAM foi treinado em uma enorme mistura de imagens e vídeos simultaneamente. Isso ajudou-o a aprender que as regras para encontrar um "cachorro" em uma foto são semelhantes às de encontrar um "cachorro" em um vídeo, mas com o toque adicional de lembrar onde o cachorro estava um segundo atrás.

5. O Novo "Teste" (V-VGD)

Os autores também criaram um novo teste chamado Segmentação Visual Fundamentada em Vídeo (V-VGD).

  • A Analogia: Antes, os testes principalmente perguntavam: "Você consegue encontrar o cachorro?" O novo teste do X2SAM pergunta: "Estou apontando para um ponto na tela neste vídeo; você consegue encontrar o objeto para o qual estou apontando e rastreá-lo enquanto ele se move?" Isso testa se a IA consegue realmente entender a conexão entre um sinal visual e o objeto em movimento. O X2SAM passou neste teste com louvor, superando modelos anteriores.

Em Resumo

O X2SAM é como dar a um artista humano um par de olhos que pode ver cada pixel, um cérebro que entende frases complexas e lógica, e uma memória que lembra onde as coisas estavam um momento atrás. Ele permite que você tenha uma conversa natural com um computador para encontrar e delinear coisas específicas em fotos e vídeos, tudo de uma só vez.

O que ele não faz (com base no artigo):
O artigo foca inteiramente na capacidade técnica de segmentar (delimitar) objetos em imagens e vídeos. Ele não afirma ser usado para diagnóstico médico, carros autônomos ou vigilância de segurança, embora essas sejam usos futuros potenciais para tal tecnologia. É estritamente uma ferramenta para entender e delinear conteúdo visual com base em instruções.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →