← Últimos artigos
💻 computer science

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

O GridVAD é um pipeline de detecção de anomalias em vídeo sem treinamento que utiliza modelos de linguagem e visão (VLMs) como proponentes de anomalias em grade estratificada, filtrando alucinações com Consolidação de Autoconsistência e ancorando as propostas em máscaras densas por meio de Grounding DINO e SAM2, alcançando desempenho superior em benchmarks como UCSD Ped2 sem necessidade de ajuste fino específico de domínio.

Autores originais: Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

Publicado 2026-03-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

Artigo original dedicado ao domínio público sob CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é o chefe de segurança de um grande shopping center. Você tem milhares de câmeras de vídeo rodando 24 horas por dia. Sua tarefa é encontrar qualquer coisa estranha que aconteça lá: alguém correndo onde não deve, um carro entrando na calçada, ou uma briga.

O problema é que você não pode contratar um segurança para olhar cada segundo de cada câmera o tempo todo. E se você usar um computador comum, ele só sabe o que você já ensinou a ele. Se um "alienígena" (algo totalmente novo) aparecer, o computador não vai saber o que é.

É aqui que entra o GridVAD, uma nova inteligência artificial que funciona como um detetive superinteligente, mas com um método muito específico.

Aqui está como funciona, explicado de forma simples:

1. O Problema: O "Oráculo" Confuso

Antes, as pessoas tentavam usar modelos de IA gigantes (chamados VLMs, ou Modelos de Visão e Linguagem) como se fossem guardas de segurança diretos. Eles perguntavam: "Isso é normal ou anormal?"

O problema é que esses modelos são como oráculos muito criativos, mas um pouco loucos. Eles são ótimos em descrever o que veem ("Vejo um cachorro, vejo um carro"), mas péssimos em dizer se algo é um crime ou não. Eles podem ficar confusos e gritar "ALERTA!" porque viram uma sombra estranha, ou ignorar um ladrão porque acharam que era apenas uma pessoa correndo. Eles alucinam muito.

2. A Solução: O Detetive, o Cartógrafo e o Pintor

Os autores do GridVAD mudaram a estratégia. Em vez de pedir para o oráculo decidir se é um crime, eles o usam apenas para fazer sugestões. Eles dividem o trabalho em três etapas, como uma equipe de detetives:

Etapa 1: O Detetive (O VLM)

Em vez de olhar o vídeo quadro a quadro (o que seria lento e caro), o GridVAD pega o vídeo e o divide em blocos de tempo, como se fosse um tabuleiro de xadrez.

  • Imagine que você pega 9 quadros diferentes do vídeo e os cola juntos em uma única imagem gigante (um "colagem").
  • O Detetive olha essa colagem e diz: "Ei, na parte de cima, parece que tem um carro subindo na calçada!" ou "Na parte de baixo, alguém está correndo de forma estranha".
  • O Detetive não decide se é crime. Ele apenas descreve o que vê de estranho.

Etapa 2: O Filtro de Verdade (SCC - Consolidação)

Como o Detetive é um pouco louco, ele pode inventar coisas. Para resolver isso, o GridVAD pede para o Detetive olhar a mesma cena 5 vezes diferentes (tirando fotos aleatórias dos mesmos blocos de tempo).

  • Se o Detetive disser 5 vezes: "Tem um carro na calçada!", então é verdade.
  • Se ele disser uma vez: "Tem um dragão voando!" e nas outras 4 vezes ficar em silêncio, o sistema descarta como alucinação.
  • Isso é como pedir para 5 testemunhas diferentes descreverem o mesmo crime. Se todas contarem a mesma história, você sabe que é real.

Etapa 3: O Cartógrafo e o Pintor (Grounding DINO e SAM2)

Agora que temos uma lista de coisas estranhas que são "provavelmente verdadeiras", passamos para a equipe de precisão:

  • O Cartógrafo (Grounding DINO): Pega a descrição do Detetive ("carro na calçada") e aponta exatamente onde isso está no vídeo, desenhando uma caixa em volta.
  • O Pintor (SAM2): Pega essa caixa e pinta o objeto em todos os quadros do vídeo, seguindo o movimento. Ele cria uma máscara pixel a pixel, mostrando exatamente a forma do carro ou da pessoa correndo, quadro a quadro.

Por que isso é genial?

  1. Não precisa de treinamento: Você não precisa ensinar o sistema sobre "ladrões" ou "incêndios". O Detetive já sabe o que é um carro, uma pessoa ou um fogo. Ele apenas descreve o que é estranho para o contexto.
  2. Economia de energia: Em vez de perguntar ao Detetive sobre cada segundo do vídeo (o que seria exaustivo), o sistema faz apenas 5 perguntas inteligentes por clipe de vídeo, não importa se o vídeo tem 1 minuto ou 1 hora. É como olhar um mapa em vez de caminhar por cada rua.
  3. Precisão: Ao separar a "ideia" do Detetive da "precisão" do Cartógrafo, o sistema evita falsos alarmes e consegue desenhar perfeitamente onde o problema está.

O Resultado

Nos testes, o GridVAD foi o melhor em detectar onde exatamente a anomalia aconteceu (pixel a pixel), superando até sistemas que foram treinados especificamente para aquele local. Ele é como um detetive que, mesmo sem conhecer o bairro, consegue identificar o suspeito e desenhar seu contorno com perfeição, apenas olhando para uma colagem de fotos e pedindo a opinião de várias testemunhas.

Resumo da ópera: O GridVAD não tenta adivinhar o futuro. Ele usa a inteligência de um modelo gigante para sugerir o que pode estar errado, usa a lógica para filtrar o que é mentira, e usa ferramentas de precisão para mostrar exatamente onde o problema está.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →