← Últimos artigos
💻 computer science

SAM 2++: Tracking Anything at Any Granularity

O artigo apresenta o SAM 2++, um framework unificado de rastreamento de vídeo que integra codificação de prompts, decodificação de saída e representação de memória para lidar com diversas granularidades de alvo (máscaras, caixas e pontos) dentro de um único modelo, acompanhado da criação do primeiro conjunto de dados em larga escala de multi-granularidade para alcançar desempenho state-of-the-art em diversas tarefas de rastreamento.

Autores originais: Jiaming Zhang, Cheng Liang, Yichun Yang, Chenkai Zeng, Yutao Cui, Xinwen Zhang, Xin Zhou, Kai Ma, Gangshan Wu, Limin Wang

Publicado 2026-05-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jiaming Zhang, Cheng Liang, Yichun Yang, Chenkai Zeng, Yutao Cui, Xinwen Zhang, Xin Zhou, Kai Ma, Gangshan Wu, Limin Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robótico muito inteligente, cuja função é assistir a vídeos e acompanhar coisas específicas. Antes deste novo artigo, se você quisesse que o robô acompanhasse um carro em movimento, você precisava ensiná-lo de uma maneira específica. Se quisesse que ele acompanhasse o rosto de uma pessoa, você precisava ensiná-lo de uma maneira completamente diferente. Se quisesse que ele acompanhasse um pequeno ponto em uma bola, você precisava de um terceiro professor, totalmente separado.

Os pesquisadores por trás do SAM 2++ fizeram uma pergunta simples: Por que precisamos de três professores diferentes para a mesma tarefa? Eles perceberam que, seja você acompanhando um carro inteiro (uma caixa), o corpo de uma pessoa (uma máscara) ou um único ponto (um ponto), o robô está realizando exatamente o mesmo trabalho mental: "Lembre-se de como essa coisa parecia um segundo atrás e encontre-a novamente agora."

Veja como eles construíram um "Rastreador Universal" que faz tudo isso, explicado de forma simples:

1. O Problema: Muitas Ferramentas Especializadas

Pense no método antigo como ter uma canivete suíço onde você precisa trocar todo o cabo apenas para usar o chaves de fenda em vez das tesouras. Os rastreadores de vídeo existentes foram construídos para apenas uma tarefa.

  • Rastreadores de Caixa só sabiam desenhar um retângulo ao redor de um objeto.
  • Rastreadores de Máscara só sabiam colorir a forma exata de um objeto.
  • Rastreadores de Pontos só sabiam seguir um único ponto.

Isso significava que o robô precisava carregar três "cérebros" diferentes, o que era desperdício e dificultava o aprendizado a partir de todos os tipos de vídeos ao mesmo tempo.

2. A Solução: Um Cérebro, Três Idiomas

A equipe criou o SAM 2++, que é como um robô poliglota (alguém que fala muitos idiomas). Ele tem um cérebro principal, mas consegue entender três "idiomas" diferentes de instruções:

  • O Idioma "Caixa": "Aqui está um retângulo ao redor do carro."
  • O Idioma "Máscara": "Aqui está o contorno exato da pessoa."
  • O Idioma "Ponto": "Aqui está um pequeno ponto na bola."

O Tradutor (Prompts Específicos da Tarefa):
Quando você dá ao robô uma caixa, uma máscara ou um ponto, um tradutor especial converte imediatamente essa instrução em um "pensamento" universal que o cérebro do robô entende. Dessa forma, o robô não se importa se você lhe deu uma caixa ou um ponto; ele apenas sabe: "Ok, preciso rastrear isso."

A Saída Universal (Decodificador Unificado):
Uma vez que o robô encontra o objeto, ele não apenas devolve uma caixa ou um ponto. Primeiro, ele desenha uma "sombra" perfeita (uma máscara) do objeto. Em seguida, se você pediu uma caixa, ele mede rapidamente a sombra para desenhar uma caixa. Se você pediu um ponto, ele encontra o centro da sombra. Isso mantém o processo simples e consistente.

3. A Memória: O "Caderno Inteligente"

A parte mais difícil do rastreamento em vídeo é lembrar como o objeto parecia quando ele fica escondido atrás de uma árvore ou se move rapidamente. O robô usa um "Caderno de Memória" para armazenar quadros passados.

Os pesquisadores notaram que, se eles forçavam o robô a usar as mesmas páginas exatas do caderno para caixas, máscaras e pontos, o robô ficava confuso. Uma caixa precisa de um esboço grosseiro; uma máscara precisa de um desenho detalhado; um ponto precisa de uma coordenada precisa.

O Conserto (Memória Adaptativa à Tarefa):
Em vez de um caderno rígido, eles deram ao robô um caderno inteligente e flexível.

  • Ao rastrear uma caixa, ele escreve no estilo de "esboço grosseiro".
  • Ao rastrear uma máscara, ele escreve no estilo de "arte detalhada".
  • Ao rastrear um ponto, ele escreve no estilo de "matemática precisa".

Isso permite que o robô mantenha um cérebro principal, mas alterne seu estilo de escrita dependendo da tarefa, evitando confusão e tornando-o muito melhor em lembrar coisas.

4. O Campo de Treinamento: O Conjunto de Dados "TAG"

Para ensinar esse robô, eles não podiam usar apenas livros didáticos antigos, porque esses tinham apenas um tipo de exercício. Eles construíram uma nova biblioteca massiva chamada TAG (Rastreamento-De-Qualquer-Granularidade).

  • Como eles a construíram: Eles usaram um sistema inteligente de "humano no loop". Humanos rotularam alguns quadros (como o início e o fim de um clipe), e o robô preencheu o restante. Em seguida, humanos verificaram o trabalho do robô e corrigiram erros.
  • Por que é especial: Cada vídeo único nesta biblioteca tem três rótulos para o mesmo objeto: uma caixa, uma máscara e um ponto. Isso permitiu que o robô aprendesse as três habilidades simultaneamente, tornando-o um verdadeiro mestre do rastreamento.

O Resultado

Quando eles testaram esse novo robô, ele não fez apenas "ok" nas três tarefas; ele superou os robôs especializados que haviam sido treinados por anos para fazer apenas uma tarefa.

  • Ele rastreou caixas melhor do que especialistas em caixas.
  • Ele rastreou máscaras melhor do que especialistas em máscaras.
  • Ele rastreou pontos melhor do que especialistas em pontos.

Em resumo: O SAM 2++ prova que você não precisa de uma ferramenta diferente para cada tarefa. Com o design certo, um sistema inteligente e flexível pode lidar com o rastreamento de qualquer coisa, em qualquer lugar, em qualquer nível de detalhe, apenas falando o "idioma" certo com ele.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →